AI・機械学習
RLCDとは何か? Jevの秘密
What Is RLCD? The Secret Behind Jev (di-zhang-llm.github.io)
要約
RLCD(Reinforcement Learning from Calibrated Decisions)は、言語モデルの代替ではなく、報酬モデリングの次のステップと見なすことができます。これは、多段階の選好モデリングと確率キャリブレーションを組み合わせたもので、Jevのようなシステムが、単なる報酬スコアではなく、信頼性の高い確率分布に基づいた決定を下せるようにします。このアプローチは、従来の単一の報酬値から、ペアワイズ比較、多段階の選好、そして最終的な確率的決定へと進化しています。
全文翻訳
ペアワイズ報酬モデリングから、キャリブレーションされた多段階決定へ
Jevは、言語モデルの代替として見ると神秘的に見えます。
報酬モデリングの次のステップとして見ると、はるかに単純になります。
中心的なアイデアは次のとおりです。
RLCD = 多段階選好モデリング + 確率キャリブレーション
より具体的には、RLCDはスキーマ条件付きPlackett–Luce目的関数です。
Jevは、型付けされた出力と並列推論を追加することで、その目的関数を積に変換します。
それが秘密です。報酬モデルはもはやジェネレーターの後ろに隠されていません。
報酬モデルがモデルになります。
図1。学習されるオブジェクトは各ステップで変化します。スカラー報酬は選好になり、選好は多段階分布になり、キャリブレーションはその分布を決定インターフェースに変換します。
報酬モデリングはスカラーから始まりました
従来の報酬モデルは、コンテキスト x と候補となる回答 a を受け取り、スカラーを生成します。
rθ(x,a) ∈ ℝ
結果報酬モデルは最終的な回答をスコアリングします。
プロセス報酬モデルは個々の推論ステップをスコアリングします。
どちらの場合も、学習されるオブジェクトは絶対値のように見える数値です。
問題は、この数値が実際には絶対値ではないということです。
0.8の報酬は、問題、候補プール、チェックポイント、またはモデルファミリー間で安定した意味を持ちません。
それは主に、同様の条件下で生成された候補を比較するのに役立ちます。
rθ(x,a1) > rθ(x,a2)
運用上の信号は常に相対的な選好でした。
スカラーはそれを隠していただけです。
PPRMは選好を明示しました
LLaMA-Berryのペアワイズ選好報酬モデル(PPRM)は、比較を直接公開します。
問題 x と 2 つの解 a1 と a2 が与えられた場合、PPRM は次のように答えます。
最初の回答は 2 番目の回答よりも優れていますか?
その確率は次の形式をとります。
P(a1 ≻ a2 | x) = exp uθ(x,a1) / (exp uθ(x,a1) + exp uθ(x,a2))
または同等に:
P(a1 ≻ a2 | x) = σ(uθ(x,a1) - uθ(x,a2))
これはBradley–Terryモデルです。
LLaMA-Berryは、制約付き言語モデルがYes/Noトークンで決定するとして比較を実装します。
約780万の数学的解のペアで評価者をトレーニングし、DPOを使用してペアワイズ予測タスクを改善します。
本質的な変更は概念的です。報酬モデリングは選好確率モデリングになります。
LLaMA-Berryの論文を参照してください。
PPRMは依然として潜在的なスカラーユーティリティ uθ(x,a) を含んでいますが、そのユーティリティはもはや絶対報酬として提示されません。
正規化された比較を通じて意味を持つようになります。
LLaMA-Berryはその後、MCTS内でペアワイズ比較を集計するためにEnhanced Borda Countを使用します。
それは下流の検索メカニズムです。
EBCはPPRMの選好損失を定義せず、PPRMからRLCDへの橋渡しもしません。
関連する系譜は単純です。
スカラー報酬 → ペアワイズ選好 → 多段階選好 → キャリブレーションされた決定
Plackett–Luceは多段階PPRMです
PPRMは 2 つの候補を比較します。
実際の決定インターフェースは通常、 2 つ以上を受け取ります。
候補セットを A = {a1, a2, ..., aK} とします。
各候補にコンテキスト依存のユーティリティを割り当てます。
ui = uθ(x,ai)
次に、すべての候補をまとめて正規化します。
P(ai | x, A) = exp ui / Σj=1^K exp uj
これはLuce選択モデルであり、多項ロジットとも呼ばれます。
これはPlackett–Luceファミリーのトップワン形式です。
K=2 の場合、Bradley–Terryとまったく同じになります。
P(a1 | x, {a1, a2}) = exp u1 / (exp u1 + exp u2)
PPRMはしたがって、同じ選択幾何学のバイナリケースです。
監督が完全なランキング aπ1 ≻ aπ2 ≻ ... ≻ aπK を指定する場合、完全なPlackett–Luce尤度は、次の最も良い残りの候補を繰り返し選択します。
P(π | x) = Πt=1^K (exp uπt / Σj=t^K exp uπj)
対応する損失は次のようになります。
LPL = -Σt=1^K log (exp uπt / Σj=t^K exp uπj)
ラベルが 1 つの正しい選択 y のみを指定する場合、損失は次のようになります。
Lchoice = -log (exp uy / Σj exp uj)
これはPlackett–Luce尤度の最初の段階です。PPRMの多段階拡張です。
これがRLCDの数学的中心です。
図2。Bradley–TerryとPPRMは、同じLuce選択幾何学の 2 候補ケースです。Plackett–Luceは、その正規化を 1 つの選択から完全または部分的なランキングに拡張します。
RLCDはキャリブレーションを追加します
Plackett–Luceは確率分布を与えますが、正規化はキャリブレーションではありません。
ソフトマックスベクトルは常に合計で 1 になります。
これは、0.8 と報告された予測が 80% の確率で正しいことを意味するわけではありません。
キャリブレーションは、その経験的な意味を追加します。
P(Y = Ŷ | Ŷ̂ = p) ≈ p
確率 0.8 が割り当てられた予測全体で、約 80% が正しいはずです。
これもTypeSafeがRLCDに提供する契約です。
Jevは決定と確率を返しますが、より高い報告確率がより高い観測精度に対応するはずです。
TypeSafeのRLCD primerを参照してください。
最小限の実装では、対数損失のような適切なスコアリングルールを使用します。
LNLL = -log py
Brierキャリブレーション: 確信には代償が伴います
Brierスコアは、キャリブレーションの目的を具体化します。
バイナリ決定の場合、p = P(Y=1 | x) および y ∈ {0,1} とします。
スコアは次のようになります。
BS(p,y) = (p-y)²
モデルが p=0.8 を報告した場合、イベントが発生したときは 0.04、発生しなかったときは 0.64 のスコアを受け取ります。
自信を持って間違った予測は、自信を持って正しい予測の 16 倍のコストがかかります。
これがBrierスコアが決定モデルに適している理由です。
これは厳密に適切なスコアリングルールです。期待値として、モデルはしきい値を操作するのではなく、真の条件付き確率を報告することによってスコアを最小化します。
スコアは、Glenn Brier によって確率的予測のために導入されました。適切なスコアリングルールとしての役割は、Gneiting と Raftery によって開発されました。
多段階選択の場合、スコアは完全な確率ベクトルに拡張されます。
2 クラスの場合がバイナリ式と一致する正規化を使用します。
BS(p, y) = 1/2 Σi=1^K (pi - 1[i=y])²
これは、トップ 1 の精度が確率の質を無視するため重要です。
2 つのモデルが同じアクションを選択しながら、0.55 と 0.99 を報告する可能性があります。
結果が到着すると、Brierスコアは、その追加の確信が正当化されたかどうかを教えてくれます。
バイナリ結果の場合、Murphy の分解は平均スコアを 3 つの項に分離します。
BS = REL - RES + UNC
信頼性 REL は、報告された確率と観測された頻度の間のギャップを測定します。低いほど良いです。
解像度 RES は、モデルが異なる結果率のケースを分離するかどうかを測定します。
高いほど良いです。
不確実性 UNC は、評価セットのベースレートの難しさです。
モデルが同じデータで比較される場合、これは固定されます。
したがって、低いBrierスコアは、より良いキャリブレーション、容易なケースと困難なケースのより良い分離、またはその両方に起因する可能性があります。
定数ベースレート予測子はキャリブレーション可能ですが、解像度がゼロである可能性があります。Brier はその弱点を明らかにします。
図3。Brierスコアは確信に代償を課し、予測の質を分解し、観測された結果から運用上の決定ポリシーへのループを閉じます。
RLCD実装は、トレーニング中に決定確率にBrierスコアを適用し、事後キャリブレーションのためのホールドアウト目的関数として再度使用できます。
温度スケーリングを使用すると、キャリブレーションパラメータを検証結果で直接選択できます。
T* = arg min T>0 Σn=1^N BS(p⁽ᵀ⁾(xn), yn)
温度スケーリングは、分布のシャープネスを調整します。
pi = exp(ui/T) / Σj exp(uj/T)
ここで T は、順序を変更せずに確率がどれだけ集中しているかを制御します。
Brier は