HN 日本語サマリー

← 一覧へ戻る
AI・機械学習

>10倍効率的な事前学習

>10x More Efficient Pretraining (magic.dev)

62 pointsby ronfriedhaber30 コメント

要約

Magic.devは、AIモデルの事前学習における計算効率を大幅に向上させる新しいレシピを開発しました。この技術により、DeepSeek V4 Pro Baseモデルと同等の性能を約50分の1のFLOPs(計算量)で達成し、GPT-3の事前学習コストの半分、約50万ドルに相当します。さらに、約400万ドルのコストでスケールアップし、公開されているオープンベースモデルを大幅に上回る性能を示しました。同社は、この効率化された事前学習が、超人的なコーディングエージェントの構築とAI研究開発の自動化に不可欠であると考えています。

全文翻訳

>10倍効率的な事前学習 計算効率の高い事前学習と、兆パラメータモデルへのスケーリングに関する研究アップデート。 Magic Team、2026年9月8日 最先端の事前学習は、大規模ラボ限定のゲームだと言われています。私たちはまだ10万個のチップを持っていませんが、道は一つしかありません。アルゴリズムの効率化です。しばらくの間、積み重ねた結果、私たちの事前学習レシピは、主要なオープンウェイトベースモデルのレシピと比較して、計算効率が10倍以上になりました。私たちはDeepSeek V4 Pro Baseに匹敵する性能を約50分の1のFLOPsで達成しました。これはGPT3の事前学習計算量の約半分、またはGB200で約50万ドルに相当します。私たちはさらに10倍(約400万ドル)スケールアップを続け、パープレキシティ評価で公開されているすべてのオープンベースモデルを大幅に上回りました。図1のスケール則によれば、DeepSeek V4 Proのレシピでこれほど高性能なモデルをトレーニングするには1億ドル以上かかるでしょう(これは存在するデータの量も無視しています)。もちろん、私たちはそこでスケーリングを止めるつもりはありません。私たちは、事前学習、エージェントRL、および長文コンテキストが、超人的なコーディングエージェントを構築し、AI研究開発を自動化するのに十分であると信じています。私たちは長文コンテキストから始めました。今日のブログ記事は事前学習についてです。 バイトあたりのビット数(低いほど良い) プライベートコードリポジトリ バイトあたりのビット数は低いほど良いです。トレーニング計算量は対数軸上のFLOPsです。曲線は現在のレシピに適合しており、破線部分は最大の実行を超えた予測です。 0.185 0.204 0.223 0.242 0.261 10^2 10^21 10^22 10^23 10^24 10^25 DeepSeek V4 Flash: 0.206 bpb DeepSeek V4 Pro: 0.202 bpb Kimi K2: 0.205 bpb Nemotron 3 Ultra: 0.203 bpb V5 e21: 0.246 bpb V5 e22: 0.222 bpb V5 e23: 0.202 bpb V5 e24: 0.194 bpb 29xDSv4 Flash 48xDSv4 Pro 31xKimi K2 47xNemotron 3 Ultra 保留された研究論文 低いビット数はより良いです。トレーニング計算量は対数軸上のFLOPsです。曲線は現在のレシピに適合しており、破線部分は最大の実行を超えた予測です。 0.36 0.41 0.46 0.52 0.57 10^2 10^21 10^22 10^23 10^24 10^25 DeepSeek V4 Flash: 0.415 bpb DeepSeek V4 Pro: 0.404 bpb Kimi K2: 0.421 bpb Nemotron 3 Ultra: 0.406 bpb V5 e21: 0.527 bpb V5 e22: 0.463 bpb V5 e23: 0.407 bpb V5 e24: 0.383 bpb 24xDSv4 Flash 45xDSv4 Pro 41xKimi K2 35xNemotron 3 Ultra 推論、保留された数学問題 低いビット数はより良いです。トレーニング計算量は対数軸上のFLOPsです。曲線は現在のレシピに適合しており、破線部分は最大の実行を超えた予測です。 0.53 0.64 0.76 0.87 0.98 10^2 10^21 10^22 10^23 10^24 10^25 DeepSeek V4 Flash: 0.710 bpb DeepSeek V4 Pro: 0.678 bpb Kimi K2: 0.695 bpb Nemotron 3 Ultra: 0.619 bpb V5 e21: 0.890 bpb V5 e22: 0.770 bpb V5 e23: 0.647 bpb V5 e24: 0.587 bpb 72xDSv4 Flash 127xDSv4 Pro 58xKimi K2 15xNemotron 3 Ultra 6・N・D トレーニングFLOPs 図1: トレーニング計算量に対する事前学習スケール則、主要な公開されているオープンウェイトベースモデルとの比較。1 保持されたデータでのビット/バイト損失(トークナイザーの違いを正規化する指標)を測定し、特定のレベルの能力に到達するために必要な計算量を予測するためにスケール則を適合させました。より良いトレーニング計算効率は、すべての予算でより強力なモデルを意味します。DeepSeek、Moonshot (Kimi)、NVIDIAの最新の公開されているオープンウェイトベースモデル2を評価しました。Claude、Gemini、GPT-nなどのベースモデルは公開されていませんが、Kimi K3とMetaのMuse SparkはそれぞれKimi K2を2.5倍、3.3倍上回っています。GB200とGB300の両方でvLLMとSGLangでオープンモデルのログ確率を評価し、その過程でいくつかのバックエンドに問題があることがわかりました。さらなる確認のため、Fireworksと提携し、社内推論エンジンでベースラインのログ確率を検証しました。モデルはトレーニングパーサーの特性を学習できるため、事前学習パイプラインとは異なるパーサー/OCRを使用して評価セットを構築しました。一般化の評価 一般化を測定するために、保持されたデータでの損失を評価しました(図1)。コード評価は、独自のコードベースと、他のスタートアップから取得したプライベートコードベースで構成されています。推論評価では、Kimi K3を使用して保持されたプライベート数学問題に対してCoTとステップバイステップのウォークスルーを生成し、正解をフィルタリングしました。テキストと研究については、最近の低引用数の研究論文を使用しました。ベンダー提供のOSSコードと、トレーニングデータと比較して96文字ウィンドウの正規化テキストまたはジャカード類似度がしきい値を超えて一致するドキュメントを削除しました。3 知識の評価 一般化に加えて、データセットのギャップを特定するために、主要なドメインでのモデルの知識をテストすることに興味があります。例えば、保持された研究テキスト評価セットを主題別に分解できます。バイトあたりのビット数(低いほど良い) 保留されたコンピュータサイエンス論文 低いビット数はより良いです。トレーニング計算量は対数軸上のFLOPsです。曲線は現在のレシピに適合しており、破線部分は最大の実行を超えた予測です。 0.37 0.43 0.48 0.54 0.59 10^2 10^21 10^22 10^23 10^24 10^25 DeepSeek V4 Flash: 0.450 bpb DeepSeek V4 Pro: 0.437 bpb Kimi K2: 0.458 bpb Nemotron 3 Ultra: 0.434 bpb V5 e21: 0.548 bpb V5 e22: 0.481 bpb V5 e23: 0.425 bpb V5 e24: 0.400 bpb 62xDSv4 Flash 120xDSv4 Pro 108xKimi K2 69xNemotron 3 Ultra 保留された工学論文 低いビット数はより良いです。トレーニング計算量は対数軸上のFLOPsです。曲線は現在のレシピに適合しており、破線部分は最大の実行を超えた予測です。 0.359 0.409 0.458 0.507 0.556 10^2 10^21 10^22 10^23 10^24 10^25 DeepSeek V4 Flash: 0.413 bpb DeepSeek V4 Pro: 0.403 bpb Kimi K2: 0.421 bpb Nemotron 3 Ultra: 0.405 bpb V5 e21: 0.517 bpb V5 e22: 0.456 bpb V5 e23: 0.405 bpb V5 e24: 0.383 bpb 26xDSv4 Flash 48xDSv4 Pro 49xKimi K2 38xNemotron 3 Ultra 保留された数学論文 低いビット数はより良いです。トレーニング計算量は対数軸上のFLOPsです。曲線は現在のレシピに適合しており、破線部分は最大の実行を超えた予測です。 0.32 0.37 0.43 0.48 0.54 10^2 10^21 10^22 10^23 10^24 10^25 DeepSeek V4 Flash: 0.365 bpb DeepSeek V4 Pro: 0.354 bpb Kimi K2: 0.367 bpb Nemotron 3 Ultra: 0.360 bpb V5 e21: 0.492 bpb V5 e22: 0.426 bpb V5 e23: 0.367 bpb V5 e24: 0.342 bpb 12xDSv4 Flash 21xDSv4 Pro 16xKimi K2 22xNemotron 3 Ultra 保留された物理学論文 低いビット数はより良いです。トレーニング計算量は対数軸上のFLOPsです。曲線は現在のレシピに適合しており、破線部分は最大の実行を超えた予測です。 0.38 0.43 0.49 0.54 0.60 10^2 10^21 10^22 10^23 10^24 10^25 DeepSeek V4 Flash: 0.433 bpb DeepSeek V4 Pro: 0.422 bpb Kimi K2: 0.440 bpb Nemotron 3 Ultra: 0.425 bpb V5 e21: 0.552 bpb V5 e22: 0.487 bpb V5 e23: 0.431 bpb V5 e24: 0.406 bpb 16xDSv4 Flash 29xDSv4 Pro 29xKimi K2 24xNemotron 3 Ultra 6・N・D トレーニングFLOPs 図2: 研究分野ごとの実効計算量。特定のソフトウェアツールのドキュメントや、アライメント研究の主要論文など、詳細なコンテンツのバケットを収集することで、さらに正確なシグナルを得ることができます。一般化評価とは異なり、これらの情報の多く(例:分野の主要論文)を事前学習コーパスから完全に削除したくはありませんが、シーケンスの記憶に報酬を与えることを避ける必要があります4。これを達成するために、サードパーティの最先端LLMを使用してこれらのドキュメントを言い換え/要約しました。詳細な評価への過学習を避けるために、モデル生成ごとに一度だけ作成および評価しました。以下は先週作成されたものです。Magicの目標は、コーディングと自律AI研究開発のための最高のモデルを構築することです。データミキシングのトレードオフを意図的にバランスさせるために、軽視するドメイン(例:著名な人物に関する事実、ローカルニュース、スポーツ/イベント)も評価します。私たちのレシピ対 各評価における最高のオープンモデル 評価における実効計算量乗数対最高のオープンモデル 評価乗数は、各パネル内で対数軸上にランク付けされます。1を超える値は現在のレシピを支持し、1未満の値はベースラインを支持します。 0.01x 0.1x 1x 10x 100x SWE & AI R&D SWE AI R&D 0.01x 0.1x 1x 10x 100x ローカルニュース、世界知識、法律 ローカルニュース 世界知識 法律 図3: ドメイン全体の実効計算量乗数。167のドメインにわたる評価セットにスケール則を適合させ、データセットごとの計算効率の向上を示します。 ショートカットなし 2024年後半、非常に長いコンテキストウィンドウ用に設計されたアーキテクチャを持つ小さな密モデルをトレーニングしました。初期の事前学習スケールアップは、さまざまな方法で失敗し続けました。安定した基盤を最初に構築する必要があることをすぐに学びました。スムーズな収束、低精度、