HN 日本語サマリー

← 一覧へ戻る
AI・機械学習

GRPOのクレジット割り当て問題を、全ステップ評価なしで解決する

Fixing GRPO's credit assignment problem without evaluating every step (arxiv.org)

23 pointsby mrkn13 コメント

要約

本論文では、大規模言語モデルエージェントの学習におけるGroup Relative Policy Optimization (GRPO) の課題、すなわち全ポリシー要素に均一に有利度を割り当てることで、重要な決定とそうでない決定を区別できない問題を解決するフレームワーク「ProVer」を提案しています。ProVerは、エージェントジャッジが成功と失敗の軌跡を比較して可能性のある重要な決定セグメントを特定し、そのセグメントの前後の継続サンプリング結果の差から有利度を推定することで、網羅的な評価なしに局所的なクレジットを観測された結果に結びつけます。ALFWorld、WebShop、SearchQAのベンチマークでGRPOを上回る性能を示しました。

全文翻訳

Group Relative Policy Optimization (GRPO) は、大規模言語モデルエージェントのトレーニングにおいて有望なアプローチとなっています。しかし、軌跡レベルの有利度をすべてのポリシー トークンに均一に割り当てることは、結果に影響を与える重要な決定とそうでない決定を区別できず、中間的な決定が成功にどのように貢献したかを不明瞭にしてしまいます。エージェント型強化学習において、きめ細かなクレジット割り当てのために潜在的に重要な決定をターゲットとするフレームワーク、ProVer を紹介します。 ロールアウト グループが与えられると、エージェント ジャッジは成功した軌跡と失敗した軌跡を対比させ、それらの異なる結果の原因となった可能性のあるセグメントを提案します。ProVer は、ジャッジの評価を直接信頼するのではなく、セグメントの前後にサンプリングされた現在のポリシーの継続における終端成功率の差から有利度を推定することで、提案されたセグメントを検証します。肯定的な推定値は、提案されたセグメント内のポリシー トークンの GRPO 有利度に組み込まれます。モデルの判断を検証する場所を選択するためにのみ使用することで、ProVer は、すべての中間状態を網羅的に評価することなく、観測された結果に基づいてローカル クレジットを確立します。 ALFWorld、WebShop、および SearchQA を通じて、ProVer は両方のモデル スケールで最も強力な平均パフォーマンスを達成し、Qwen3.5-2B および Qwen3.5-4B に対して GRPO に対する相対的な改善率はそれぞれ 9.91% および 7.12% です。さらなる分析により、情報に基づいたセグメント選択が、フロンティア スケールのジャッジ モデルなしでも、わずかな追加の生成オーバーヘッドでポリシー トレーニングを改善することが示されており、エージェント型強化学習におけるきめ細かなクレジット割り当てのために重要な決定を選択的にターゲットにすることの有効性と効率性が強調されています。