AI・機械学習
シーケンス重み付けのスケーリングに関する研究
A study of sequence weighting at scale (blog.janestreet.com)
要約
本研究では、大規模な言語モデル(LM)におけるデータ重み付けのスケーリング則を、社内モデルとオープンウェイトモデルの両方で調査しました。その結果、モデルの規模が大きくなるにつれて、シーケンスの重みに対するモデルの損失削減効果が非単調に変化する挙動が明らかになりました。具体的には、小規模モデルはデータ重みに関係なく一般的なパターンを学習し、中規模モデルはデータ重みに比例して特定のパターンを学習し、大規模モデルは再びデータ重みに関係なく全てのパターンを学習することが示されました。
全文翻訳
シーケンス重み付けのスケーリングに関する研究
2026年9月14日 | 10分で読む
Facebookで共有 Twitterで共有 LinkedInで共有
著者: Alex Renda
著者: Nitya Mani
要約: 社内およびオープンウェイトのLM全体でデータ重み付けのスケーリング則を研究し、規模全体で非単調な挙動を発見しました。トレーニング中にシーケンスに割り当てられる重みを変化させ、シーケンスの損失削減がそのシーケンスの重みにどれだけ強く依存するかを測定します。全体として、私たちの結果は一般的な傾向と一致しています。モデルが小規模から中規模に移行するにつれて、データ重みに依存しない一般的なパターンの学習から、データ重みに比例したデータ固有のパターンの学習へと移行します。その後、モデルが中規模から大規模に移行すると、再びデータ重みに依存せず、データに含まれるすべてのパターンを学習できるようになります。
ニューラルネットワークをトレーニングする際、モデルに何を学習させたいのかを正確に考えることに多くの時間を費やします。すべてのコーディングタスクにわたる一般的な知能と、OCamlに特化した能力のどちらをどれだけ重視すべきでしょうか?古い市場レジームのデータは、最近収集されたデータと比較してどれほど有用でしょうか?一般的に、高品質なデータにどれだけ重みを付け、モデルにあらゆるデータから学習させることを許可すべきでしょうか?これらの質問は、最終的にはデータ混合(data mixing)の質問、つまりモデルの表現能力とFLOPsをどのように、どこで費やすかという質問です。さらに、これらの質問を複雑にしているのは、実際には実行したい実験の多くが法外に高価であるということです。中規模でさえ、ハイパーパラメータの密な多次元グリッドサーチを実行することは不可能であり、ましてや最大規模(特定のタスクに対して1つのモデルしかトレーニングできない場合がある)ではなおさらです。これに対する標準的なアプローチは、スケーリング則アプローチを介してデータ混合ウェイトのようなハイパーパラメータを適合させることです。このアプローチでは、小規模でハイパーパラメータを適合させ、それらのハイパーパラメータを大規模に外挿します(これの典型的な例はChinchillaスケーリングです)。
図1: スケール全体での学習率のChinchillaスタイルの適合例。
スケーリング則における中心的な課題は、外挿が有効であるためには、大規模モデルが(a)スケールに対して不変である(例: 多くのハイパーパラメータの最適値がスケール全体で安定しているMuPスタイルの結果)か、または(b)小規模での挙動の変化を外挿することによって予測可能である(例: 損失がスケールとともに予測可能に減少するKaplanスタイルの結果)必要があるということです。残念ながら、すべての挙動がこれらの特性を持っているわけではありません。一部の挙動はスケールで出現し、スケーリング則によって予測できません。この記事の残りの部分では、このような予測不可能なスケーリング挙動を「異常(aberrant)」と呼びます。私たちの内部実験では、データ混合が異常なスケーリング挙動を起こしやすい設定であることが示されています。これは、MAI-Thinking-1技術レポート(セクション2.5.2)の発見と並行しています。そこでは、コード中心のミックスとSTEM中心のミックスのトレーニングの品質の相対的な順序が、モデルサイズの増加とともに逆転しました。したがって、私たちは言語モデルがデータミックスでそのデータに与えられた重みに比例して実際にデータ内のパターンをどれだけ学習するか、そしてその挙動がスケール全体でどのように変化するかを正確に特徴づけることを目指しました。
データミックス実験は、コーパス内のデータの重みの効果を、他の重要だが異なる考慮事項と混同する可能性があります。特に注目すべきは、データミックス実験の結果は、異なるソース間のデータ品質のばらつきや、特定のデータソースの任意のトークンの周辺トークンのユニークさの違いに大きく影響されるということです。ミックスウェイトの効果を分離するために、この記事では特にデータ重み付け(data weighting)を分析します。これはデータ混合のバリアントであり、トレーニングデータセット内の個々のシーケンスが損失で異なる重みを受け取ります。トレーニングされたモデルが特定の重みを持つトレーニングシーケンスをどれだけ学習したかを測定するために、まずデータセット内の各シーケンスにランダムなシーケンスウェイトを割り当て、そのデータセットでモデルをトレーニングし、次に同じトレーニングデータセットで再評価します。その後、シーケンスの重みの何乗かが、そのシーケンスでのモデルの期待損失減少に最も比例するかを測定する指標(効果的シーケンスウェイト指数、と表記)を定義します(例: は、シーケンスでのモデルの期待損失減少がその重みに直接比例することを示し、は、すべての可能なシーケンスウェイトに対してシーケンスでの期待損失減少が同じであることを示します)。以前の研究は、スケールに対する予測について混合した結果を示しています。(Byrd & Lipton 2019)および大規模補間(interpolation)の一般的な現象は、大規模モデルがに漸近すると予測しますが、Li et al. 2026 は、固定トークンあたりのパラメータ数で、価値のあるドメインの最適なトークン繰り返し回数がモデルサイズとともにわずかに増加することを発見しました。私たちは、効果的シーケンスウェイト指数はスケールに対して滑らかなべき乗則なのか、それとも異常なのかを問います。
私たちは、社内のテキストベースのベンチマークでシーケンス重み付けの効果を評価します。モデルファミリーとスケール全体でテストするために、数千万から数百億パラメータの範囲の2つの社内事前学習済みLLMファミリーと、5億から720億パラメータの範囲の1つのオープンウェイトモデルファミリー(Qwen 2.5)を評価します。私たちは、いくつかの異常なスケーリング挙動(スケール全体でのデータ混合に関する推論は複雑です!)といくつかの顕著な傾向を発見しました。全体として、私たちの結果は、効果的シーケンスウェイト指数における非単調な上昇→下降の傾向と一致しています。小規模モデルは小さい効果的シーケンスウェイト指数に適合し、データ重みに関係なくデータセット全体にわたるパターンを学習します。中規模モデルはより大きい効果的シーケンスウェイト指数に適合し、データ重みに比例したデータ内のパターンを学習します。大規模モデルは再び小さい効果的シーケンスウェイト指数に適合し、重みに関係なくデータに含まれるすべてのパターンを学習します。エポック(Epoching)は、効果的シーケンスウェイトのピークをより小さいモデルの方にシフトさせます。
異常なスケーリング則は、モデルトレーニング方法論にとって不便ですが、それらを特定することで悪い外挿を避けることができます。私たちの科学では、そのような異常な挙動に常に注意を払い、それらを発見した際には、スケーリング実験と評価を予測可能になるように再設計します。私たちの実験は、十分に大規模なモデルからのみデータミックスの結果を評価および外挿すること、または観測されたを補償するためにトレーニングウェイトを調整することなど、いくつかの可能な解決策を示唆しています。そして、モデルが予測からどれだけ外れているかを測定し続け、スケーリング則が破綻する次の場所を捉え、さらに自信を持ってより大きく、より良いモデルをトレーニングできるようにします。
方法論
データセット。
私たちは、社内のテキストベンチマークでシーケンス重み付けの効果を評価します。このデータセットのシーケンスには、0.01から10の範囲で対数一様(log-uniform)にサンプリングされたシーケンスウェイトを使用します。3エポックトレーニングし、各エポック後に評価します。
モデル。
このデータセットで3つの異なるモデルファミリーを評価します。JS-dense、9つのモデルからなる社内事前学習済み密結合(dense)LMファミリー。JS-sparse、8つのモデルからなる社内事前学習済みMoE(Mixture of Experts)LMファミリー。Qwen 2.5、5億パラメータから720億パラメータの範囲のオープンウェイト密結合LMファミリー。JS-denseおよびJS-sparseモデルは、数千万から数百億パラメータの範囲です。すべてのコンテキストで、これらのモデルのホールドアウトパフォーマンスはスケールとともに増加していることに注意してください。
シーケンス重み付けの効果の測定。
まず、モデルをトレーニングデータセット(各シーケンスがに対応する重み付けがされている)でトレーニングし、トレーニングデータセットでモデルを再評価し、各シーケンスについてトレーニングから得られた損失削減を測定します。次に、(適切に正規化された)重みを持つ特定のシーケンスでの損失削減が、によって最もよく説明されるようにを適合させます。この適合を付記でより正確にしますが、異なる値の意味をよりよく理解するために、