HN 日本語サマリー

← 一覧へ戻る
AI・機械学習

Jevのキャリブレーションはどの程度正確か?

How accurately calibrated is Jev? (maximumeffort.substack.com)

53 pointsby dblack1270520 コメント

要約

TypeSafeの新しい分類モデル「Jev」は、LLMとは対照的な「システム1」思考モデルとして紹介されています。しかし、物理学の確率分布を予測させる実験では、Jevの出力する確率分布が実際の物理分布と乖離しており、キャリブレーションが不十分であることが明らかになりました。特に、分布のピークを過度に強調し、滑らかな裾野の表現に課題があることが示唆されています。

全文翻訳

JevはTypeSafeの新しい「システム1」分類モデルです。この名称は、ダニエル・カーネマンの著書「ファスト&スロー」に登場する、速く直感的なシステム1思考と、遅く意識的なシステム2思考の区別から着想を得ています。このアナロジーでは、ClaudeやGPTのような大規模言語モデル(LLM)はシステム2モデルであり、Jevやその前身(Layaなど)のような「決定モデル」はシステム1です。 トランスフォーマーアーキテクチャは現代のLLMの基盤であり、ほとんどのタスクを学習するための非常に柔軟で汎用的なパラダイムです。しかし、現代のLLMは本質的に確率的であり、自己回帰的であり、その出力スタイル(自由形式のテキスト)は分類タスクにはあまり適していません。例えば、claude("2 + 2 = ?")のようなLLM呼び出しを考えてみましょう。私たちは4を期待しますが、それは文字列として、整数として、浮動小数点数として…?Jevでは、代わりにjev("2+2=?", "3 : int, 4 : int, 5 : int")のように呼び出し、整数として正しく型付けされた4を受け取ることになります。私の理解では、Jevは、汎用的な事前学習済みトランスフォーマーを採用し、その末尾に分類器を接続しています。これにより、分類器は特定のタスクでトレーニングする必要がなく、新しいコンテキストを即座に使用できますが、それでも分類器として機能します。コンテキストと多肢選択式の質問を与えると、その選択肢に対する確率分布が返されます。また、非常に安価で、以下の実験シリーズ全体で4ドル未満しかかかりませんでした。しかし、Jevは単に答えを選ぶだけでなく、可能な答えに対する確率分布を返します。その確率分布はどの程度正確なのでしょうか? Maximum Effort, Minimum Rewardをお読みいただきありがとうございます!新しい投稿を受け取り、私の活動をサポートするために無料で購読してください。 購読する Jevのキャリブレーションはどの程度正確か? 私は、答えがよく理解されている質問でこれをチェックすることにしました。例えば: 質量mの古典粒子が、温度Tの熱平衡状態にあるシステムに埋め込まれています。その速度vは何ですか? 答えはvに関する確率分布であり、具体的にはマクスウェル・ボルツマン分布です。 Wikipedia:「多数の同一の非相互作用、非相対論的な古典粒子が熱平衡状態にある系では、速度空間の微小要素d 3v内の粒子の割合は、速度ベクトルv(大きさv)を中心とする場合、[上記の分布]によって与えられます。」mは質量です。 Wikipediaより:「298.15 K(25℃)の温度におけるいくつかの貴ガスの速度の速度確率密度関数。y軸はs/mであり、任意の曲線部分の下の面積(その範囲内の速度の確率を表す)は無次元です。」 楽しいデモはこちらです:モーターといくつかのボールでマクスウェル・ボルツマン分布を物理的に生成できることを知っていましたか?ビデオはこちら3 手法 これらの実験の実装、テンプレートプロンプトの作成、API呼び出しなどには、GPT-6 AstraとClaude Opus 5.5を使用しました。また、Opus 5.5のプロット作成能力についても実験しており、これまでのところ非常に感銘を受けています。 そこで、物理的に関連性の高い分布のリストを選び、GPT-6 AstraとClaude Opus 5.5に、答えが確率分布を生成するはずのプロンプトテンプレートのシリーズを作成させました。私はJevに確率分布そのものを求めているわけではありません。有限集合(通常は連続パラメータのビン化された範囲)に対する「選択」を求めています。Jevは、各ビンに対する内部確率を持つ型付けされた決定を返します。Jevが適切にキャリブレーションされている場合、その出力確率は物理的に正しい確率分布関数と一致するはずです。合計で、10個の候補分布、分布ごとに5つのプロンプトテンプレート、および各プロンプトの20のバリエーション(例えば、呼び出しごとに周囲温度を変更するなど)を選択し、1,000の設定が得られました。各テンプレートの回答ビンは固定されており、描画間で変更されません。 以下はプロンプトの例です。stateはコンテキスト、instructionsはタスク、criteriaはJevが確率分布を返す連続パラメータのビンのセットです。 プロンプトテンプレートの例。プロンプト+バリエーションはClaude Opus 5.5によって作成されました。分布:ガウス、ローレンツ、マクスウェル、ガンマ、指数、レイリー、一様、ポアソン、二項、ボルツマン。 ビン:各連続テンプレートについて、物理的な範囲を1つ設定しました。これは、20回の描画の中で最も広い法則(ローレンツ分布を除く、ただしローレンツ分布は裾が長い)を包含するのに十分な広さで、等幅ビンに分割されました(ローレンツ分布は最後のビンが開放端でした)。符号付き回答(ガウス、ローレンツ):[-R, R]の範囲で幅R/24の48個のビン、「-R未満」と「R以上」を追加。 非負回答(マクスウェル、ガンマ、指数、レイリー):幅wの49個のビンを0から開始し、「49w以上」を追加。 一様位置:すべての描画を含む範囲での50個のビン ポアソン:0〜48のカウントと「49以上」 二項:N=49回の試行で0〜49 ボルツマン:リストされたエネルギー準位 Opus 5.5が作成した、この手法を視覚的に示す非常に素晴らしい図です。 手法。A) Jevへのプロンプトの基本的な構造(例)。B) Jevの報告した確率(例)対正しい分布。C) 私が差を表示するために選択した方法の例—パーセンタイルごとのJev予測と理論値の比率。これはJevのエラーの多くを境界ビンに巻き込むため、非常に一般的な「スパイク状のエッジ」構造になります。 Jevの回答は、すべての可能な選択肢にわたる全変動(Total Variation)で、描画ごとにスコアリングされました。 TV(q, p) = 1/2 * Σ |qi - pi| (i=1からKまで) K個のビンに対して、qはJevの応答確率、pはビン内の正しいPDFの積分です。TV = 0は完全一致、TV = 1は確率質量が完全に分離していることを示します。 単純なキャリブレーション結果 Jevのキャリブレーションはどの程度か?あまり良くありません。もしJevが完全に回答を放棄し、すべての可能な選択肢に確率を均等に分散させた場合、平均TVは0.546になります。しかし、Jevは0.518をスコアしました。一様分布の場合、0.77対フラットな推測の0.39、ポアソン分布の場合、0.65対0.64です。これは、LLMの回答の自動評価方法(これは良いアイデアですが、非常に有名な問題に対する分布のキャリブレーションが不十分です)に対して、私に深い疑念を抱かせます。 顕著な失敗モードがあります。 キャリブレーションの直接的なテスト。答えが確率分布からの描画である物理的な質問(Jevにはこの分布は与えられていませんでした)を含むプロンプトがJevに与えられ、ビン化された多肢選択式の回答セットも与えられました。回答は全変動でスコアリングされました。A) 各分布ファミリーのJev応答の中央値TVの例を示しています。B) 「相対的な過大評価」(Jev/理論値)を比率でプロットしています。C) 各ファミリーの全変動(実質的にはエラー)をプロットしています(低いほど良い)。 Jevは、分布がピークすぎ、滑らかに消える裾野にさらに困難があるという強い傾向があります。Jevは、実際の分布では確率質量がほぼゼロである裾野のビンに非ゼロの重みを与える傾向があります。ローレンツ分布は実際にはかなり良好ですが、これは、それが元々ピークがあり裾野が広いことの結果であると推測されます。さて、分布のピークを特定するのが得意な理由は、ピークがプロンプトに現れる可能性が非常に高いことです。例えば、ローレンツ分布の場合: 孤立した発光線は、基準レーザーより-14.033 MHz上に中心を持ち、半値半幅は6.8364 MHzです。その広がりは、指数関数的に減衰する励起状態のみに起因します。 平均値やその他の特性統計量を与えずに問題を指定する他の方法は実際にはありませんが、Jevは当然、「-16から-12 MHz」(p = 0.74)をその出力選択肢として選択します。つまり、これらのテストの多くはコピーテストと混同される可能性があり、Jevはそれを実行します。マクスウェル、レイリー、ガンマ分布では、ピークは分布を定義するパラメータの1つではなく、派生したものであるため、それはfi