AI・機械学習
レイヤーは1つで十分か?単一のTransformerレイヤーがフルパラメータRLトレーニングに匹敵
Is One Layer Enough? A Single Transformer Layer Matches Full-Parameter RL Train (arxiv.org)
要約
本研究では、大規模言語モデル(LLM)の強化学習(RL)後学習における各Transformerレイヤーの寄与を体系的に調査しました。 驚くべきことに、単一のTransformerレイヤーのトレーニングで、フルパラメータRLトレーニングと同等以上の成果が得られることが判明しました。この発見は、RL適応がモデルの特定の部分に集中していることを示唆しており、効率的なモデル調整の可能性を示しています。
全文翻訳
コンピュータサイエンス > 機械学習
arXiv:2607.01232 (cs) [2026年7月1日提出]
タイトル:レイヤーは1つで十分か?単一のTransformerレイヤーがフルパラメータRLトレーニングに匹敵
著者:Zijian Zhang, Rizhen Hu, Athanasios Glentis, Dawei Li, Chung-Yiu Yau, Hongzhou Lin, Mingyi Hong
Zijian Zhangら6人の著者による「Is One Layer Enough? Training A Single Transformer Layer Can Match Full-Parameter RL Training」というタイトルの論文のPDFを表示
PDFを表示 HTML(実験的)
要旨:
大規模言語モデル(LLM)のポストトレーニングにおいて、強化学習(RL)は中心的なコンポーネントとなっていますが、RL適応がTransformerレイヤー全体にどのように分散されているかはほとんど理解されていません。
既存のアプローチは通常、すべてのモデルパラメータを均一に更新しており、RLポストトレーニング中に得られる利益にすべてのレイヤーが同様に貢献していると暗黙的に仮定しています。
本研究では、RLトレーニングの体系的なレイヤーごとの研究を通じて、この仮定に異議を唱えます。
驚くべきことに、単一のTransformerレイヤーのトレーニングで、フルパラメータRLトレーニングによって達成される利益のほとんどを回復できることがわかりました。
場合によっては、それを上回ることさえあります。
この現象を定量化するために、レイヤー貢献という指標を導入しました。
これは、単独でレイヤーをトレーニングすることによって回復される完全なRL改善の割合を測定します。
Qwen3、Qwen2.5の2つのモデルファミリー、GRPO、GiGPO、Dr. GRPOの3つのRLアルゴリズム、および数学的推論、コード生成、エージェント意思決定を含む複数のタスクドメインにわたる7つのモデル全体で、非常に安定したパターンを観察しています。
RLの利益は、少数の、多くの場合単一のTransformerレイヤーに高度に集中しています。
さらに驚くべきことに、同じ構造パターンが一貫して現れています。
高貢献レイヤーはTransformerスタックの中央に集中し、入力端と出力端に近いレイヤーの貢献は著しく少なくなります。
結果として得られるレイヤーランキングは、データセット、タスク、モデルファミリー、RLアルゴリズム全体で強く相関したままです。
件名:機械学習(cs.LG);計算と言語(cs.CL)
引用形式:arXiv:2607.01232 [cs.LG] (またはこのバージョンの場合はarXiv:2607.01232v1 [cs.LG])
https://doi.org/10.48550/arXiv.2607.01232
詳細はこちらをご覧ください arXiv発行のDOIはDataCite経由(登録保留中)
提出履歴
送信者:Zijian Zhang [メールを表示] [v1] 2026年7月1日(水)17:59:54 UTC (268 KB)
全文リンク:
論文へのアクセス:Zijian Zhangら6人の著者による「Is One Layer Enough? Training A Single Transformer Layer Can Match Full-Parameter RL Training」というタイトルの論文のPDFを表示 PDFを表示 HTML(実験的) TeXソース ライセンスを表示
現在の閲覧コンテキスト:cs.LG < 前 | 次 > 新着 | 最近 | 2026-07
次の基準で閲覧を変更:cs cs.CL
参考文献と引用
NASA ADS Google Scholar Semantic Scholar
エクスポート BibTeX引用
読み込み中...
BibTeX形式の引用 ×
読み込み中...
提供元データ:
ブックマーク
書誌ツール
書誌および引用ツール
書誌エクスプローラー 書誌エクスプローラーを切り替える(エクスプローラーとは何ですか?)
コネクテッドペーパー コネクテッドペーパーを切り替える(コネクテッドペーパーとは何ですか?)
Litmaps Litmapsを切り替える(Litmapsとは何ですか?)
scite.ai sciteスマート引用を切り替える(スマート引用とは何ですか?)
コード、データ、メディア
この論文に関連するコード、データ、メディア
alphaXiv alphaXivを切り替える(alphaXivとは何ですか?)
コードへのリンク
CatalyzeX コードファインダー(CatalyzeXとは何ですか?)
DagsHub DagsHubを切り替える(DagsHubとは何ですか?)
GotitPub Gotit.pubを切り替える(Gotit.pubとは何ですか?)
Huggingface Hugging Faceを切り替える(Hugging Faceとは何ですか?)
ScienceCast ScienceCastを切り替える(ScienceCastとは何ですか?)
デモ
デモ
Replicate Replicateを切り替える(Replicateとは何ですか?)
Spaces Hugging Face Spacesを切り替える(Spacesとは何ですか?)
Spaces TXYZ.AIを切り替える(TXYZ.AIとは何ですか?)
関連論文
レコメンダーおよび検索ツール
影響力フラワーへのリンク 影響力フラワー(影響力フラワーとは何ですか?)
Coreレコメンダーを切り替える COREレコメンダー(COREレコメンダーとは何ですか?)
IArxivレコメンダーを切り替える IArxivレコメンダー(IArxivレコメンダーとは何ですか?)
著者 掲載誌 機関 トピック
arXivLabsについて
arXivLabs:コミュニティ協力者との実験的なプロジェクト
arXivLabsは、協力者がarXivの新しい機能を直接ウェブサイトで開発および共有できるフレームワークです。
arXivLabsと協力する個人および組織は、オープンネス、コミュニティ、卓越性、ユーザーデータプライバシーの価値を受け入れ、遵守しています。
arXivはこれらの価値にコミットしており、それらを遵守するパートナーのみと協力します。
arXivコミュニティに価値をもたらすプロジェクトのアイデアがありますか?arXivLabsの詳細をご覧ください。
この論文の著者のうち、誰が推薦者ですか? | MathJaxを無効にする(MathJaxとは何ですか?)