AI・機械学習
Jevはキャリブレーションできない
Jev Can't Be Calibrated (alexmolas.com)
要約
TypeSafeの「System One Model」であるJevは、テキスト生成ではなく、定義済みの出力セットから確率付きの決定を返すAIモデルです。そのセールスポイントの一つは「キャリブレートされた確率と信頼スコア」ですが、この記事では、Jevの出力は確率ではなくスコアとして扱うべきだと主張しています。モデルは特定のデータ分布でキャリブレートされても、ユーザーのデータ分布ではそうでない可能性があるためです。
全文翻訳
Jevはキャリブレーションできない
2026年9月23日 · 3分 · 617語
X · HNで共有
よほど変わったところに住んでいない限り、Jevについては聞いたことがあるでしょう。Simon Willisonの投稿は良い概要であり、この記事ではPython数行で実装する方法を示しています。要するに、JevはTypeSafe初の「System One Model」です。テキストを生成するのではなく、構造化されていない入力を受け取り、事前に定義した出力セットから、それぞれに確率が付与された決定を返します。そのセールスポイントの1つは、「すべての回答にはキャリブレートされた確率と信頼スコアが伴う」ということです。この記事では、Jevは有用であると主張しますが、キャリブレーションの主張は一般的に成り立たず、その出力を確率ではなくスコアとして扱うべきだと論じます。
トレーニングデータなしで有用
トレーニングデータを収集する前に、任意の分類問題に投入して合理的な結果を得ることができます。Twitterの多くの人が「これは単にファインチューニングされたBERTだ」と言いましたが、BERTのファインチューニングにはデータが必要です。データがない場合、Jevは素晴らしい代替手段です。また、Jevはユニバーサル分類器ですが、ファインチューニングされたBERTは、トレーニングされたタスクにのみ役立ちます。しかし、これにはコストがかかり、データなしで有用であることが、その確率があなたのためにキャリブレートできない理由なのです。
キャリブレートされていない確率
TypeSafeは、JevがRLCD(キャリブレートされた決定のための強化学習)を使用してトレーニングされ、生成される確率がキャリブレートされていると述べています。私はそうは思いません。モデルはTypeSafeのデータでキャリブレートされていても、あなたのデータでは誤ってキャリブレートされている可能性があります。モデルがキャリブレートされているとは、予測された確率pに対して、その予測が与えられたときの正クラスの真の確率がpである場合です。これはP(Y = 1 |
p = p) = pであり、ここで
pはモデルによって予測された確率です。直感的には、モデルがX%と予測したすべてのインスタンスをグループ化した場合、それらの実際のケースの約X%が真実になることを意味します(例:Jevがspam_probability=0.7と述べたメールの場合、それらの約70%が実際にスパムであると期待すべきです)。重要な点は、キャリブレーションはモデルの特性だけでなく、あなたのデータ分布の特性でもあるということです。同じモデルでも、あるデータセットではキャリブレートされていても、別のデータセットではそうでない場合があります。異なる企業はスパムを同じように定義できますが、異なるデータ分布を持っている可能性があります。しかし、同じ入力とプロンプトに対して、Jevは異なる基盤となるデータ分布に関係なく、両方の企業に同じ確率を提供します。したがって、モデルは一方の企業ではキャリブレートされていても、もう一方ではそうでない可能性があります。RLCDがJevをトレーニング/評価分布でキャリブレートするように正常にトレーニングしたとしても、その確率はあなたの本番分布でキャリブレートされたままにならない可能性があります。この失敗は、単なる分布シフトよりも悪いという証拠がいくつかあります。この記事を書いている間に、Jevが公正なコインが0.92の確率で表になると述べているこれらのツイートを見つけました。これは上記のドリフトよりも悪いです。真の確率はプロンプトにありますが、モデルはそれを報告しません。この最近の実験でも、Noulが同じ問題でChoiceよりもはるかに優れたキャリブレーションを示していることがわかっています。Jevの確率が、どのプリミティブを使用するかによって異なる意味を持つ場合、「キャリブレートされた確率」とは正確には何を意味するのでしょうか?キャリブレートされた確率が必要な場合は、自分のデータでJevの確率を再キャリブレートする必要があります。良いニュースは、それが安価であるということです。あなたの実際のデータからの数百のラベル付き例があれば、Jevのスコアの上にPlattスケーリングを適合させるのに十分です。私の見解は、Jevの出力を良い確率ではなく、良いスコア(例をうまくランク付けする)として扱うことです。システムが実際の数値(しきい値、期待コスト、他のモデルとの組み合わせなど)に依存している場合は、信頼する前に自分のデータでキャリブレーションを測定してください。