HN 日本語サマリー

← 一覧へ戻る
AI・機械学習

Beam: Reflectionの501Bオープンウェイトモデル

Beam: Reflection's 501B open-weight model (reflection.ai)

78 pointsby Philpax19 コメント

要約

Reflection社は、コーディング、推論、エージェントワークロード向けに設計された、5010億パラメータ(アクティブ230億)を持つオープンウェイトモデル「Beam」を発表しました。Beamは、23.8兆トークンに及ぶ大規模な事前学習と、10.5KのNVIDIA GB300 GPUを用いた高計算リソースの強化学習(RL)によって開発されました。これにより、推論時の計算効率に優れた最先端のオープンウェイト性能を実現しています。

全文翻訳

Reflection社の最初のオープンウェイトモデルであるBeamを紹介します。 Beamは、コーディング、推論、エージェントワークロード向けに設計された、5010億の総パラメータ(アクティブ230億)を持つスパースなMixture-of-Expertsモデルです。 Beamの能力は、事前学習と強化学習(RL)の両方への大規模な投資から生まれています。私たちは、Webおよびプロプライエタリなライセンスデータセットから収集された23.8兆もの多様でキュレーションされた高品質なトークンでモデルを事前学習し、同等サイズの既存のオープンベースモデルと同等またはそれ以上の性能を達成しました。並行して、高計算リソースのRLを大規模に維持するために必要なアルゴリズム、トレーニング環境、インフラストラクチャを開発しました。私たちの高計算リソースRL実行では、4週間のトレーニング期間中に10.5KのNVIDIA GB300 GPUで1億回以上のロールアウトを生成しました。 これらの取り組みにより、最先端のオープンウェイト性能と推論時の計算効率を両立させることができました。 Beamは現在、最終的なレッドチーミングと評価を進めています。モデルの早期アクセスにサインアップできます。重み、技術レポート、モデルカード、開発者向け成果物は今月後半にリリースする予定です。 モデルの能力 Beamは、特にコーディングとエージェントパフォーマンスに重点を置いてトレーニングしました。Beamは、西洋のオープンウェイトの最先端を前進させ、コーディングおよびエージェントタスクにおいて、GLM 5.2のようなより大きなオープンモデルやQwen 3.8-Maxに匹敵する性能を発揮します。Kimi K3のような最先端のオープンモデルが生の能力で先行しているのに対し、Beamの利点は推論時の効率にあります。 以下の図は、Beamのコーディング、エージェント、推論、STEMベンチマーク全体でのパフォーマンスを示しています。NRは報告されていないスコアを示します。 モデルの能力(表) Beamは、コーディングとエージェントの能力を、非常に効率的な推論と組み合わせています。高度な推論ベンチマークでは、GLM-5.2に匹敵するスコアを達成しながら、推論に必要な計算リソースは3〜4倍少なくて済みます。Qwen 3.8-Maxのような2T+パラメータファミリーのモデルと比較すると、効率の向上はさらに顕著であり、トークンあたりの推論計算リソースが大幅に多く必要となります。 これらの結果は、トークンあたりの知能向上につながり、低コストで強力なモデル能力を提供するため、Beamはエンタープライズのコーディングおよびエージェントワークロードにとって強力なワークホースモデルとなります。 図2:Beamは、DeepSWE、Humanity’s Last Exam(HLE)、Terminal Bench 2.1全体で、FLOPSとトークン数の両方の観点から、最先端の推論効率を示しています。人工分析(Artificial Analysis)とDataCurveのデータを使用し、生成フォワードパスの計算量をFLOPs ≈ 2 × アクティブパラメータ数 × 平均生成トークン数/試行と推定しました。生成トークンには、推論と最終的な回答が含まれます。Mixture-of-Expertsモデルの場合、総モデルサイズではなく、トークンごとにアクティブ化されたパラメータを使用しました。これらの推定値は、プロンプトのプリフィル、コンテキスト依存の注意操作、およびサービングオーバーヘッドを除外しているため、測定された推論コストではなく、近似的な計算比較を表します。他のモデルの評価には、人工分析(Artificial Analysis)とDataCurveを情報源として使用しています。 高計算リソースの強化学習 Beamの主要なスケーリング軸として高計算リソースの強化学習を位置づけ、RLサイエンス、データ、インフラストラクチャに投資して、より多くの計算リソースをより強力な能力に変換しました。RLをスケーリングすることで、問題解決戦略のより広範な探索が可能になり、より長いロールアウトは、複数ステップの推論、ツールの使用、および環境フィードバックへの適応をサポートします。 強化学習をスケーリングするために、私たちは4週間にわたって10.5KのNVIDIA GB300 GPUを展開し、1億回以上のロールアウトを生成しました。最大コンテキスト長は256Kトークンでした。トレーニングと評価には、約13億のサンドボックスが使用されました。この規模の実行を維持するために、私たちは100万もの高品質なコーディング、エージェント、STEM環境を調達しました。これは、これまでにオープンラボによって実施された最大規模のRL実行の1つであると信じています。評価スイート全体で、RL計算リソースを増やしても能力は向上し続け、プラトーの兆候は見られませんでした。 図3:Beamの推論エキスパートのトレーニング中の累積RLロールアウト数に対する、Terminal-Bench 2.1、HLE、およびDeepSWEのスコア。これは、RLキャンペーン全体で生成された1億回以上のロールアウトのうち8000万回を占めています。比較のために、Inklingは3000万ロールアウトで、MiMoは753Kロールアウトでトレーニングされました。 私たちは、非同期ポリシー勾配法を用いてBeamをトレーニングしました。この規模では、ポリシーの遅延(staleness)がこれらの手法の不安定性の主要な原因となります。長時間のロールアウトでは、複数のモデルチェックポイントによって生成されたトークンが含まれており、初期のトークンは現在のポリシーに対してますます遅延していきます。トレーニングと推論エンジンの間の数値的な不一致が、この課題をさらに悪化させます。 私たちは、これらの条件下で安定した学習を維持し、パイプライン全体でトレーニングと推論の不一致を体系的に低減するための新しいアルゴリズムを開発しました。これらの進歩により、1日以上前に生成されたインタラクションから学習している場合でも、安定した大規模な完全非同期RLが可能になります。 図4:遅延が蓄積しても、学習は安定して継続します。上のプロットはバッチ内の最も古いサンプルを示し、下のプロットは安定した数値を示しています。Beamを1日の遅延(現在のポリシーから107バージョン遅れている)でトレーニングした場合でも、数値は安定しています。 効率的な推論学習 Beamは、成功したソリューションを報酬とし、不要なトークンを抑制する、制御可能な長さペナルティを用いてトレーニングしました。RLの初期段階では、完了長が短くなるにつれてパフォーマンスが向上しました。モデルは、より少ない推論でタスクをより効果的に解決することを学習しました。その後、Beamがより強力なエージェント能力を発達させるにつれて、完了長は再び増加しましたが、それらの追加トークンはパフォーマンスのさらなる向上をサポートしました。トレーニング全体を通して、RLは能力とトークン使用量の間のトレードオフを改善しました。 図5:RL実行の一部におけるDeepSWEスコア。各点は異なる推論努力に対応します。パレートフロンティアは2つのフェーズで移動します。まず、ポリシーがトークン効率を高めるように学習するにつれて、それは収縮します。次に、より高い推論努力が外側に広がり、高パフォーマンスを達成します。ユーザーは、このトレードオフをBeamの推論努力パラメータを通じて制御できます。低い設定は短い応答を優先し、高い設定は要求の厳しいタスクでパフォーマンスを向上させるために長い推論を許可します。これにより、ユーザーは推論努力をタスクと計算予算に合わせる柔軟性を得られます。 RLによる行動の一般化 BeamのRLトレーニングは、トレーニングタスクを超えて一般化する推論およびエージェント能力を開発するように設計されました。推論、ソフトウェアエンジニアリング、およびターミナル…