AI・機械学習
オープンモデル間のJ-space比較
J-space comparisons across open models (eliebak.com)
要約
この記事は、オープンな言語モデルの各層が最終的な出力に与える影響を測定するためのJ-spaceという手法を紹介しています。CKAやPRといった指標を用いて、モデルの内部表現の形状や情報伝達の持続時間を分析し、モデルの構造と機能に関する洞察を提供します。実験結果は、モデルの深層部における情報の減衰や、層間の構造的な境界を示唆しています。
全文翻訳
測定とは、1つの層を調べ、何が出力に到達するかを観察することです。このページ上のすべては、単一の測定から来ています。モデルにテキストを読み込ませ、層ℓでその残差ストリームを微調整し、最終層—次のトークンを決定する層—がどのように応答するかを記録します。多くの位置とプロンプトで平均化されたその応答は、行列Jℓ、すなわち層の出力に対する典型的な影響です。
Fig. 1 微調整から2つの数値へ J-lensパイプライン。下流のすべてはVℓで動作します。アンベッドを掛けると、影響が具体的になります。4,096の一般的なトークンのそれぞれにベクトルが与えられます。これは、層ℓでそのトークンの確率を押し上げる方向であり、これらのベクトルは文字通りの意味でのステアリングベクトルです—1つを注入すると、モデルはそのトークンを言うようになり、これはE3が利用するものです。これら4,096のベクトルは、層の辞書を形成します。
2つの数値が辞書を要約します。最初の数値はCKA—Centered Kernel Alignment—であり、座標を比較できない場合に2つの辞書が同じ形状を持つかどうかを問います。レシピは、辞書のベクトルをセンタリングし、その関係のテーブルK = VVTを構築することです—4,096×4,096のグリッドで、セル(i, j)はエントリiがエントリjに沿ってどれだけ強く指しているかを記録します。このテーブルは座標フリーです—辞書全体を回転させても、1つのセルも変化しません。CKAは、2つのこのようなテーブル間のコサイン、CKA(A, B) = ⟨KA, KB⟩ / ‖KA‖ ‖KB‖ です—形状が同一の場合は1.0、無関係なランダムなテーブルの場合はゼロに近くなります。キャリブレーションのために、同じモデルの2つの独立したフィットは約0.997をスコアし、一致した深さで比較された2つの異なる学習済みモデルは約0.5–0.7になります。
Fig. 2 CKAの計算方法 6つのトイエントリ、2つのモデル。回転はすべての座標を変更しますが、関係は変更しないため、2つのテーブルは同一になります。モデル自身の各層のペア間で計算された場合、同じ数値がブロックが見えるマップを描画します—入力を読み取る入力側ブロック、長い中間ブロック(論文の「ワークスペース」)、および出力を書き込む小さな出力側ブロックです。
Fig. 3 モデルの層ごとの一致性 qwen3-1.7bのすべての層の辞書のペア間のCKA。値を確認するにはホバーしてください。ブロックは教師なしで現れ、それらのエッジ—深さの分数ρとして引用される「境界」—は以下のすべての実験で再出現します。
2番目の数値はPR—Participation Ratio—であり、辞書が実際に使用する方向の数を数えます。辞書の共分散の固有値λi(各独立方向が持つ重み)を取り、PR = (λ1 + … + λn)² / (λ1² + … + λn²) を形成します。すべての方向が等しい重みを持つ場合、PRはその数に等しくなります。1つの方向がすべてを持つ場合、PRは1になります。2つの方向に広がる6つのエントリはPR ≈ 2を与えます。エントリは方向ではありません。
Fig. 4 なぜ4,096のエントリが4,096の方向ではないのか 関連する単語は同じ方向を指すため、エントリは方向を共有します。実際の層の4,096のエントリは200〜600の有効な方向をスパンします。その数—常に中間帯で取られます。出力に近いと測定値が出力行列に崩壊するため—は、以下の全体で使用される「容量」数です。
ここに旅行する1つの注意点があります:Jはテキスト分布の平均です。テキストを変更すると測定値が変更されます—それがE5です。
E1・時間的ホライズン 微調整はどれくらいの間出力を操り続けますか? Verbalizable-Workspace論文は、中間層を「心に留めておく」ワークスペースとして読みます。文字通りに取ると、そこでの微調整は多くのトークンにわたって出力を操り続けるはずです—他のどこよりも長く。標準的なフィットではこれをテストできません:すべての将来の位置で平均化し、時間軸を消去します。そのため、距離で分割します:正確にΔトークン離れたソース–ターゲットペアで個別の辞書をフィットさせ、その全体的な強度、effectℓ(Δ) = ‖P·Jℓ(Δ)‖ を追跡します—層ℓでの微調整がΔトークン後にどれだけ出力を動かすか。
6つのモデル、それぞれ250のプロンプト、Δは0から96までです。
Fig. 5 なぜ時計がΔ = 1から始まるのか effect(Δ1) ÷ effect(Δ0):次のトークンに到達する微調整の即時効果の割合。モデルごとに1本の線。Δ = 0では、測定値は位置自身の出力へのパスによって支配されます—微調整は残差ストリームをまっすぐに下に伝わります。これは「微調整がこのトークンをどれだけ変えるか」に答えますが、どれだけ遠くまで伝わるかではありません:最大でその4分の1が1トークンを横切り、最も深い層では3〜6%です。そのため、以下のすべての曲線と統計は時計をΔ = 1から開始し、それに対して引用されます。
すべてのモデルでρ ≈ 0.6–0.7のステップダウンは、結論が戻る崖です。
Fig. 6 微調整がターゲットが遠くなるにつれて、どれだけ出力を動かし続けるか 距離Δでの効果を距離1と比較して、対数-対数スケール。選択されたモデルの各層に1本の線。スライダーをドラッグして層を歩きます。モデル層 初期層は強く始まりゆっくりと衰退します。最も深い層は1トークン以内にすべてを失います。ハイライトされた帯状の層はΔ ≈ 12とΔ ≈ 96の間ではほとんど衰退しません—しかし、これは128トークンのウィンドウ内で測定され、次の図は、その平坦さのどれだけがウィンドウ自体によって製造されたかを示しています。
これらの曲線には問題があります:それらは128トークンのシーケンスから来ています。したがって、Δ ≈ 96での効果は、ウィンドウの最初の30トークンに押し込められたソース位置からのみ測定できます。そのため、初期位置が異なる動作をする場合、遠いバケットは偏っています。2つのモデルを4,096トークンのシーケンスで再測定しました—各プロンプトは完全な4,096トークンで、距離はΔ ≈ 3,000までバケット化されました。2つの近似によりコストを妥当な範囲に保ちます:プロンプトの数を減らす(250対112および200)、および効果は、各位置ではなく、プロンプトあたり160の対数間隔のターゲット位置で累積されます。バケットあたりの平均は偏りがなく、再結合された辞書は標準的なフィットとr = 0.996および0.987で一致します。
Fig. 7 長いウィンドウでの再測定 シーケンス長4,096での同じ統計、層ごとに1本の線。破線は帯状層のseq-128測定を再生します。垂直線は古いウィンドウのエッジです。モデル 平坦さは、より大きなウィンドウでは生き残りません:帯状層のΔ96 ÷ Δ12比はqwenで0.56から0.26に低下し、古いウィンドウのエッジを過ぎると、すべての層はスケールフリーのべき乗則、effect ∝ Δ−α、として減衰し、Δ ≈ 1,500までプラトーはありません。生き残るのは順序—感覚層は最も遅く減衰し、帯状層が次、運動層が最も速く—そして崖です:帯状層の深い境界での低下は、Δ = 2からΔ = 4,095までのすべての距離で同じ2.3〜2.4倍です。
Fig. 8 同じデータを深さ全体の1つの統計として表示 メトリックを選択してください。垂直線はモデルのCKAブロックが終わる場所を示します。モデルメトリック 深さの最初の6分の1でピークに達する半減期は、単一のビューでの予測の失敗です。交差する割合は、深いブロックエッジでの崖を示します。平坦さと遠方テールは、上記のウィンドウの注意点を運びます。
6つのモデルすべてで2つの規則性が保持されます。予測は失敗します:最も長持ちする影響は中間層からではなく、最初の数層から来ます—半減期のピークはすべてのモデルでρ = 0.03–0.17にあり、帯状層の半減期は平凡な2〜5トークンです。そして影響は深さと共に縮小します:層が深いほど、トークンを横断する効果の割合は小さくなり、半減期は短くなり—長いウィンドウフィットでは—減衰指数は急になります。その減衰における最も鋭い特徴はρ ≈ 0.6–0.7での崖であり、セグメンテーションが明確な深い境界を見つける場所では、崖はその上に座っています:qwen3-1.7bの崖はρ = 0.667、qwen3-4bの崖は0.657で、2.3倍のスケール変化にわたります。アブレーションはキャリアを特定します:アテンションパターンを固定すると、すべてのプロファイルはそのままです(r ≥ 0.996)。バリューパスをカットすると、トークンを横断する到達範囲の86〜95%が失われます。モデルの識別可能なコピーヘッドをカットしても何も変わりません。到達範囲は、固定されたアテンションパターンを通じて運ばれるコンテンツです—そして測定されたウィンドウを超えるとデータはありません、ヌルですらありません。
E1×E2・トレーニングを通じたホライズン 時間的構造は現れるのか—そして到達範囲は成長するのか? 同じ距離分解フィットを、0.1兆から11.2兆トークンまでのSmolLM3-3Bの12の公開チェックポイントで繰り返し実行しました。E1からの3つの数量を追跡します。Tem