HN 日本語サマリー

← 一覧へ戻る
AI・機械学習

RLCDとは何か? Jevの秘密

What Is RLCD? The Secret Behind Jev (di-zhang-llm.github.io)

45 pointsby tnspacetime4 コメント

要約

RLCD(Reinforcement Learning from Calibrated Decisions)は、言語モデルの代替ではなく、報酬モデリングの次のステップと見なすことができます。これは、多段階の選好モデリングと確率キャリブレーションを組み合わせたもので、Jevのようなシステムが、単なる報酬スコアではなく、信頼性の高い確率分布に基づいた決定を下せるようにします。このアプローチは、従来の単一の報酬値から、ペアワイズ比較、多段階の選好、そして最終的な確率的決定へと進化しています。

全文翻訳

ペアワイズ報酬モデリングから、キャリブレーションされた多段階決定へ Jevは、言語モデルの代替として見ると神秘的に見えます。 報酬モデリングの次のステップとして見ると、はるかに単純になります。 中心的なアイデアは次のとおりです。 RLCD = 多段階選好モデリング + 確率キャリブレーション より具体的には、RLCDはスキーマ条件付きPlackett–Luce目的関数です。 Jevは、型付けされた出力と並列推論を追加することで、その目的関数を積に変換します。 それが秘密です。報酬モデルはもはやジェネレーターの後ろに隠されていません。 報酬モデルがモデルになります。 図1。学習されるオブジェクトは各ステップで変化します。スカラー報酬は選好になり、選好は多段階分布になり、キャリブレーションはその分布を決定インターフェースに変換します。 報酬モデリングはスカラーから始まりました 従来の報酬モデルは、コンテキスト x と候補となる回答 a を受け取り、スカラーを生成します。 rθ(x,a) ∈ ℝ 結果報酬モデルは最終的な回答をスコアリングします。 プロセス報酬モデルは個々の推論ステップをスコアリングします。 どちらの場合も、学習されるオブジェクトは絶対値のように見える数値です。 問題は、この数値が実際には絶対値ではないということです。 0.8の報酬は、問題、候補プール、チェックポイント、またはモデルファミリー間で安定した意味を持ちません。 それは主に、同様の条件下で生成された候補を比較するのに役立ちます。 rθ(x,a1) > rθ(x,a2) 運用上の信号は常に相対的な選好でした。 スカラーはそれを隠していただけです。 PPRMは選好を明示しました LLaMA-Berryのペアワイズ選好報酬モデル(PPRM)は、比較を直接公開します。 問題 x と 2 つの解 a1 と a2 が与えられた場合、PPRM は次のように答えます。 最初の回答は 2 番目の回答よりも優れていますか? その確率は次の形式をとります。 P(a1 ≻ a2 | x) = exp uθ(x,a1) / (exp uθ(x,a1) + exp uθ(x,a2)) または同等に: P(a1 ≻ a2 | x) = σ(uθ(x,a1) - uθ(x,a2)) これはBradley–Terryモデルです。 LLaMA-Berryは、制約付き言語モデルがYes/Noトークンで決定するとして比較を実装します。 約780万の数学的解のペアで評価者をトレーニングし、DPOを使用してペアワイズ予測タスクを改善します。 本質的な変更は概念的です。報酬モデリングは選好確率モデリングになります。 LLaMA-Berryの論文を参照してください。 PPRMは依然として潜在的なスカラーユーティリティ uθ(x,a) を含んでいますが、そのユーティリティはもはや絶対報酬として提示されません。 正規化された比較を通じて意味を持つようになります。 LLaMA-Berryはその後、MCTS内でペアワイズ比較を集計するためにEnhanced Borda Countを使用します。 それは下流の検索メカニズムです。 EBCはPPRMの選好損失を定義せず、PPRMからRLCDへの橋渡しもしません。 関連する系譜は単純です。 スカラー報酬 → ペアワイズ選好 → 多段階選好 → キャリブレーションされた決定 Plackett–Luceは多段階PPRMです PPRMは 2 つの候補を比較します。 実際の決定インターフェースは通常、 2 つ以上を受け取ります。 候補セットを A = {a1, a2, ..., aK} とします。 各候補にコンテキスト依存のユーティリティを割り当てます。 ui = uθ(x,ai) 次に、すべての候補をまとめて正規化します。 P(ai | x, A) = exp ui / Σj=1^K exp uj これはLuce選択モデルであり、多項ロジットとも呼ばれます。 これはPlackett–Luceファミリーのトップワン形式です。 K=2 の場合、Bradley–Terryとまったく同じになります。 P(a1 | x, {a1, a2}) = exp u1 / (exp u1 + exp u2) PPRMはしたがって、同じ選択幾何学のバイナリケースです。 監督が完全なランキング aπ1 ≻ aπ2 ≻ ... ≻ aπK を指定する場合、完全なPlackett–Luce尤度は、次の最も良い残りの候補を繰り返し選択します。 P(π | x) = Πt=1^K (exp uπt / Σj=t^K exp uπj) 対応する損失は次のようになります。 LPL = -Σt=1^K log (exp uπt / Σj=t^K exp uπj) ラベルが 1 つの正しい選択 y のみを指定する場合、損失は次のようになります。 Lchoice = -log (exp uy / Σj exp uj) これはPlackett–Luce尤度の最初の段階です。PPRMの多段階拡張です。 これがRLCDの数学的中心です。 図2。Bradley–TerryとPPRMは、同じLuce選択幾何学の 2 候補ケースです。Plackett–Luceは、その正規化を 1 つの選択から完全または部分的なランキングに拡張します。 RLCDはキャリブレーションを追加します Plackett–Luceは確率分布を与えますが、正規化はキャリブレーションではありません。 ソフトマックスベクトルは常に合計で 1 になります。 これは、0.8 と報告された予測が 80% の確率で正しいことを意味するわけではありません。 キャリブレーションは、その経験的な意味を追加します。 P(Y = Ŷ | Ŷ̂ = p) ≈ p 確率 0.8 が割り当てられた予測全体で、約 80% が正しいはずです。 これもTypeSafeがRLCDに提供する契約です。 Jevは決定と確率を返しますが、より高い報告確率がより高い観測精度に対応するはずです。 TypeSafeのRLCD primerを参照してください。 最小限の実装では、対数損失のような適切なスコアリングルールを使用します。 LNLL = -log py Brierキャリブレーション: 確信には代償が伴います Brierスコアは、キャリブレーションの目的を具体化します。 バイナリ決定の場合、p = P(Y=1 | x) および y ∈ {0,1} とします。 スコアは次のようになります。 BS(p,y) = (p-y)² モデルが p=0.8 を報告した場合、イベントが発生したときは 0.04、発生しなかったときは 0.64 のスコアを受け取ります。 自信を持って間違った予測は、自信を持って正しい予測の 16 倍のコストがかかります。 これがBrierスコアが決定モデルに適している理由です。 これは厳密に適切なスコアリングルールです。期待値として、モデルはしきい値を操作するのではなく、真の条件付き確率を報告することによってスコアを最小化します。 スコアは、Glenn Brier によって確率的予測のために導入されました。適切なスコアリングルールとしての役割は、Gneiting と Raftery によって開発されました。 多段階選択の場合、スコアは完全な確率ベクトルに拡張されます。 2 クラスの場合がバイナリ式と一致する正規化を使用します。 BS(p, y) = 1/2 Σi=1^K (pi - 1[i=y])² これは、トップ 1 の精度が確率の質を無視するため重要です。 2 つのモデルが同じアクションを選択しながら、0.55 と 0.99 を報告する可能性があります。 結果が到着すると、Brierスコアは、その追加の確信が正当化されたかどうかを教えてくれます。 バイナリ結果の場合、Murphy の分解は平均スコアを 3 つの項に分離します。 BS = REL - RES + UNC 信頼性 REL は、報告された確率と観測された頻度の間のギャップを測定します。低いほど良いです。 解像度 RES は、モデルが異なる結果率のケースを分離するかどうかを測定します。 高いほど良いです。 不確実性 UNC は、評価セットのベースレートの難しさです。 モデルが同じデータで比較される場合、これは固定されます。 したがって、低いBrierスコアは、より良いキャリブレーション、容易なケースと困難なケースのより良い分離、またはその両方に起因する可能性があります。 定数ベースレート予測子はキャリブレーション可能ですが、解像度がゼロである可能性があります。Brier はその弱点を明らかにします。 図3。Brierスコアは確信に代償を課し、予測の質を分解し、観測された結果から運用上の決定ポリシーへのループを閉じます。 RLCD実装は、トレーニング中に決定確率にBrierスコアを適用し、事後キャリブレーションのためのホールドアウト目的関数として再度使用できます。 温度スケーリングを使用すると、キャリブレーションパラメータを検証結果で直接選択できます。 T* = arg min T>0 Σn=1^N BS(p⁽ᵀ⁾(xn), yn) 温度スケーリングは、分布のシャープネスを調整します。 pi = exp(ui/T) / Σj exp(uj/T) ここで T は、順序を変更せずに確率がどれだけ集中しているかを制御します。 Brier は