HN 日本語サマリー

← 一覧へ戻る
AI・機械学習

VibeThinker: 3Bパラメータモデルが、新しいSFT+GRPOにより推論でOpus 4.5を凌駕

VibeThinker: 3B param model that beats Opus 4.5 on reasoning with novel SFT+GRPO (arxiv.org)

19 pointsby timhigins4 コメント

要約

VibeThinker-3Bは、厳密な小規模モデルの枠内で検証可能な推論能力を追求するために開発された、30億パラメータのコンパクトな言語モデルです。このモデルは、カリキュラムベースのSFT、マルチドメインRL、オフライン自己蒸留を含む最適化されたパイプラインを通じて強化されました。その結果、DeepSeek V3.2やGemini 3 Proのような大規模モデルと同等かそれ以上の推論能力を、AIME26で94.3点、LiveCodeBench v6でPass@1 80.2といった優れた性能で示しています。

全文翻訳

この技術レポートは、厳密な小規模モデルの枠内で検証可能な推論能力をどこまで高められるかを調査するために開発された、30億パラメータのコンパクトな密なモデルであるVibeThinker-3Bを紹介します。Spectrum-to-Signalポストトレーニングパラダイムに基づいて、カリキュラムベースの教師ありファインチューニング、マルチドメイン強化学習、オフライン自己蒸留を含む最適化されたパイプラインを通じてモデルを体系的に強化しました。実験的評価により、VibeThinker-3Bは非常に要求の厳しい検証可能タスクにおいて最先端レベルの性能を達成することが実証されました。具体的には、AIME26で94.3点(請求レベルのテスト時スケーリングでは97.1点に向上)、LiveCodeBench v6でPass@1 80.2点を達成し、最近の未見のLeetCodeコンテストでは96.1%の受理率を示し、強い分布外汎化能力を発揮します。これにより、DeepSeek V3.2、GLM-5、Gemini 3 Proのような桁違いに大きなフラッグシップモデルと同等またはそれ以上の性能を持つ、第一級の推論システム群に効果的に位置づけられます。さらに、IFEvalで93.4点というスコアは、この極端な推論強化が厳密な指示制御性を損なわないことを確認しています。以前の1.5Bモデルでの研究を拡張するこれらの知見は、検証可能な推論はコンパクトな推論コアに圧縮可能である一方、オープンなドメイン知識と汎用的な能力には事実、概念、ロングテールシナリオにわたる広範なパラメータカバレッジが必要であると考える「パラメトリック圧縮-カバレッジ仮説」を動機付けます。この観点から、コンパクトなモデルは単なるデプロイメント効率の良い代替品ではなく、パラメータ密度の高い能力領域における最先端レベルの性能に向けた補完的な道筋であると示唆されます。