判断モデルの較正とは何ですか?
較正とは、モデルが申告する信頼度と実際の正解率の統計的な整合です。70% の信頼度を申告した予測すべてを集めたとき、正解率が約 70% に乗っていれば、そのモデルは較正されています。型付きの選択肢と確率を返す判断モデルにとって、較正はしきい値が意味を持つための前提です。「0.85 以上は自動化」は、0.85 が自分のラベル上で実際に約 85% の正解率に対応してきたときにしか成立しない、ワークロードの将来についての主張です。
ECE(期待較正誤差)はどう計算しますか?
すべての予測を信頼度ビンに分け(慣例は 10 ビン)、各ビン内の実測正解率と平均申告信頼度の差を求め、各ビンの予測数の割合で重み付けして平均します。0.9 と言えば必ず正解、0.4 と言えば必ず不正解というモデルは、全体の精度が平凡でも ECE はほぼゼロです。ECE は能力ではなく誠実さを測る指標だからです。必ずリライアビリティ図と並べて読んでください。同じ ECE の 2 モデルが、片方は系統的な自信過剰、もう片方は自信過少と、正反対の失敗をすることがあります。
信頼度が高ければ回答は信頼できますか?
それ単体では、いいえ。Synthpop 監査が最もきれいな反例です。正解率 1% の答えられない設問で、モデルはそれでも 32〜36% の信頼度を報告し、知識カットオフ後は正解率がコイントスまで落ちたのに信頼度は 82% に上がりました。高い信頼度は主張であって証拠ではありません。自分のラベル付きワークロードで、その信頼度水準が実際にどの程度正解してきたかを測って初めて証拠になります。それが、本ページの 5 ステップ ワークフローが生み出すものです。
自分のモデルを較正するには?
ワークロードからホールドアウトのラベル付きセットを凍結し、モデルに通して全確率を記録し、リライアビリティ図を描き、ECE を算出します。そのうえで、曲線が誠実な位置にだけ自動/レビュー/人間のみのしきい値を置き、四半期ごと、またはモデル バージョンやトラフィック構成が変わったときに検証し直します。図が温度スケーリング型の系統的な歪みを示すなら、較正セット上でのスケーリング フィットが役立ちます。答えられない設問での高信頼回答——前述の監査の失敗——であれば、事後の再較正では直りません。そういう設問を別のプロセスへ回すしかありません。
Jev の信頼度はどこから来ますか?
モデルが自分についてコメントしたものではありません。Jev の呼び出しは、宣言した選択肢から選ばれた型付きの答えと、1 回のパスで付けられた全選択肢の並列スコアを返します。信頼度は決定契約の構造的な出力であり、生成された文章ではありません。スキーマを凍結すれば検査も再現もできる——当サイトのベンチマークがスライスごとに ECE を公表できる理由です。ただし監査が免除されるわけではありません。公開された Synthpop の較正監査は、まさにこのアーキテクチャに対して行われ、知識の境界で高信頼の失敗を確認しました。
較正と精度の違いは何ですか?
精度はモデルがどのくらい正解するか。較正は、その信頼度が「いつ正解するか」について真実を語っているか。95% の精度で較正が壊れているモデル(すべての誤りに 0.99 の印)も、70% の精度でほぼ完璧に較正されたモデル(推っているときを確実に自覚している)も存在します。自動化には 2 番目の性質が、1 番目と同等以上に必要です。しきい値もフォールバック レーンも監査証拠も、精度ではなく信頼度の数値の上に築かれるからです。