
保証つきの予測は可能か——コンフォーマル予測をめぐる対話
要点 コンフォーマル予測は、単一の答えではなく「真の答えを含む集合」を返す枠組みである。 交換可能性という弱い仮定の下で、集合が正解を含む確率に分布によらない保…
確信度と較正・曖昧性と表現・信頼とリスク認知・評価と限界——すべての記事。

要点 コンフォーマル予測は、単一の答えではなく「真の答えを含む集合」を返す枠組みである。 交換可能性という弱い仮定の下で、集合が正解を含む確率に分布によらない保…

要点 不確実性は、データ自体の雑音による偶然性(aleatoric)と、モデルの無知による認識的不確実性(epistemic)に分けられる。 Kendall &…

要点 ベンチマークの平均精度は、不確実性の質を直接には測らない。 テストデータの訓練への混入(汚染)は、評価を実力以上に見せてしまう。 グッドハートの法則のとお…

要点 IPCC は「likely(可能性が高い)」などの言葉に、明示的な確率の範囲を割り当てている。 Mastrandrea ら(2010)のガイダンスでは、「…

要点 同じリスクでも、確率(1%)と自然頻度(1000人中10人)では人の理解度が変わる。 Gigerenzer らは、自然頻度のほうが誤解を減らすと論じた。 …

要点 自動化への信頼は、多すぎても少なすぎても失敗を招く。 Lee & See(2004)は、信頼を能力に合わせる「較正された信頼」を提唱した。 過信は…

要点 不確かさを画面や言葉でどう表すかは、技術ではなく設計の問題である。 確率の数値、言葉のヘッジ、選択肢の提示——伝え方によって受け手の行動は変わる。 「曖昧…

要点 言語モデルのハルシネーションは、誤りでありながら高い流暢さと確信を伴うことがある。 Farquhar ら(Nature, 2024)は、答えを意味ごとにま…

要点 言語モデルに「自分の答えは正しいか」を自己評価させる研究が進んでいる。 Kadavath ら(2022)は、モデルが自答の正しさの確率 P(True) を…

要点 「降水確率70%」は、その予報を多数集めたとき約7割で雨が降る、という頻度的な約束である。 予報が較正されているかは、ブライアスコア(Brier, 195…
✓ 登録ありがとうございます