AI・機械学習
Dust: バックプロパゲーションなしでのトランスフォーマー事前学習
Dust: Pretraining Transformers Without Backpropagation (qlabs.sh)
要約
本研究では、バックプロパゲーションに匹敵する性能を持つ、初のゼロ次法によるトランスフォーマー言語モデルの事前学習手法「Dust」を提案しています。Dustは各トークンで独立に活性化を摂動させることで、計算量を大幅に削減しつつ、大規模なモデルや計算リソースが豊富な環境ではバックプロパゲーションを超える可能性を示唆しています。
全文翻訳
TL;DR
我々は、トランスフォーマー言語モデルの事前学習において、バックプロパゲーションに匹敵する性能を持つ初のゼロ次法を提案します。Dustは、各トークンで独立に活性化を摂動させます(ノード摂動)。これにより、各トークンは仮想的な集団メンバーとなり、1回のフォワードパスでそれらをすべて並列に評価できます。
Dustは、大きな集団サイズ(つまり、大幅に多くの計算量)においてバックプロパゲーションを密接に近似し、複数の設定でそれを超えることさえあります。これは、計算リッチな領域ではバックプロパゲーションを超える可能性があることを示唆しています。
Dustは、重み空間におけるES(Evolution Strategies)よりも桁違いに効率的です。100万トークン以上では、Dustは、我々の外挿に基づくと、最先端のES手法であるEGGROLLのトランスフォーマー実装と比較して、10^3から10^4倍効率的です。
ゼロ次法は、大規模ネットワークにはスケールしないと広く信じられています。驚くべきことに、我々は、より大きなモデルの方が集団効率が高いことを見出しました。2億4300万パラメータのモデルは、テストしたほとんどの集団サイズで、120倍小さいモデルよりも優れた性能を発揮します。Dustの勾配推定値は、集団が成長するにつれてバックプロパゲーションのものとより良く一致し、テストしたすべてのスケール(最大10億トークン)で良好な一致を保っており、スケーリングに向けて有望です。
1 はじめに
ディープラーニングは、バックプロパゲーションを中心に構築されてきました。これは、最新のニューラルネットワーク、特にトランスフォーマーベースの言語モデルをトレーニングできる唯一のクレジット割り当てアルゴリズムです。バックプロパゲーションは微分可能性を必要とし、一次勾配を生成します。ディープラーニングのアーキテクチャ、オプティマイザー、およびハードウェアは、この制約を中心に共同進化してきました。
しかし、世界で利用可能な計算量が増加するにつれて、微分可能性やバックプロパゲーション、高階勾配の近似のような帰納的バイアスよりも、検索に基づいた、より汎用的でブルートフォースな学習アルゴリズムを好むかもしれません。苦い教訓(Sutton、2019)は、計算量とともにスケールする汎用的な手法が最終的に勝利するというものであり、AlphaGo Zero(Silver et al.、2017)はその明白な例です。人間のデータでAlphaGoをブートストラップすることは、ネットワークの初期学習を助けましたが、大量の計算により、純粋な自己対戦ネットワークがそれを追い越しました。同様に、微分可能性とバックプロパゲーションは、学習を効率化する低計算量レジームでは良い帰納的バイアスかもしれませんが、高計算量レジームでは、機能するアーキテクチャの空間を制限します。
アーキテクチャ内であっても、勾配ベースの手法は損失ランドスケープを最適に探索できません(Liu et al.、2020)。これは、現在のニューラルネットワークが汎化するために大量のデータを必要とする理由も説明しているかもしれません。検索に基づいた、より柔軟なクレジット割り当てアルゴリズムは、はるかに優れた汎化に向けた重要なステップとなるでしょう。
この論文では、バックプロパゲーションを、ブルートフォース計算に大きく依存し、解析構造にあまり依存しない学習アルゴリズムに置き換えることを目指します。我々はそれをDustと呼びます。
Dustはゼロ次最適化アルゴリズムであり、活性化を摂動させ、各摂動を損失をどれだけ低下させたかで報酬を与え、集団全体で報酬付き摂動を平均化して勾配を推定します。重みを摂動させる従来のES手法(Salimans et al.、2017)、例えばEGGROLL(Sarkar et al.、2025)は、集団サイズとともにスケールしますが、集団をスケールさせることはコストがかかります。なぜなら、各メンバーを具体化して評価する必要があるからです。我々は、重み空間を完全にバイパスし、代わりに活性化を摂動させる(Werfel et al.、2003; Widrow and Lehr、1990)ノード摂動の概念により、これらの両方のコストを排除します。我々はこれを各トークンで独立に行うため、各トークンがメンバーとなり、1回のフォワードパスでそれらをすべて並列に評価できます。
活性化は、重みよりも探索する興味深い空間です。メカニズム解釈可能性は、言語モデルにおける推論(口頭で説明できるかどうかにかかわらず)が活性化に存在することを示しています(Gurnee et al.、2026; Lindsey et al.、2025)。これは、このアプローチがトレーニングを潜在的推論の探索に変える可能性があることを意味します(Vegesna and Dahal、2025)。次に、活性化空間の摂動を、トランスフォーマーブロックの異なるレイヤータイプに異なるトークンレベルの報酬を割り当てる非常に汎用的なクレジット割り当てルールとペアにします。これらの2つのバイアスと、いくつかの実装上の詳細、および摂動モジュール間の干渉の回避などの効率化策が、アルゴリズム全体です。
我々は以下の貢献をします。
我々は、トランスフォーマー言語モデルの事前学習において、バックプロパゲーションに匹敵する性能を持つ初のゼロ次法を提案します。大きな集団サイズでは、Dustは複数の設定でバックプロパゲーションを超えており、計算リッチな領域ではバックプロパゲーションを超える可能性があることを示唆しています。Dustは、重み空間ESよりも桁違いに効率的です。100万トークン以上では、Dustは、我々の外挿に基づくと、EGGROLLのトランスフォーマー実装と比較して、10^3から10^4倍効率的です。従来の考え方に反して、より大きなモデルの方が集団効率が高いことが多く、より大きな集団を利用できます。これは、過剰適合を、より大きな探索空間と潜在的に優れた幾何学的構造として捉え直す視点を提供します。Dustの勾配推定値は、集団が成長するにつれてバックプロパゲーションのものとより良く一致し、テストしたすべてのスケール(最大10億トークン)で良好な一致を保っており、スケーリングに向けて有望です。
この論文の目標は、我々が考えうる最も困難なタスクであるトランスフォーマーの事前学習において、バックプロパゲーションに匹敵する検索ベースのクレジット割り当てアルゴリズムの基盤を築くことです。我々は、今日バックプロパゲーションを置き換えるのに十分な計算効率の高いものにしようとはしません。また、外部プログラムをループに組み込んだネットワークや、バックプロパゲーションが...(本文が途中で切れています)