HN 日本語サマリー

← 一覧へ戻る
AI・機械学習

Ring-Zero: 兆パラメータへのスケーリングによるゼロRLでの創発的推論

Ring-Zero: Scaling Zero RL to a Trillion Parameters for Emergent Reasoning (arxiv.org)

49 pointsby binyu17 コメント

要約

本論文は、人間によるアノテーションなしで検証可能な報酬を用いた強化学習(ゼロRL)の、兆(Trillion)パラメータ規模へのスケーリングに関する研究成果を発表しています。大規模モデルでは、単純なスケーリングでは読みにくさや冗長性、推論深度の不足といった問題が生じますが、本研究では、クリップド重要度サンプリングなどのアルゴリズムとシステム最適化を組み合わせた安定かつ効率的な学習パイプラインを提案しています。実験により、1兆パラメータへのスケーリングがサンプル効率と性能上限を大幅に向上させ、モデルが構造化された推論、自己検証、文脈不安などの高度な認知能力を自律的に獲得することを示しました。

全文翻訳

コンピュータサイエンス > 計算と言語 arXiv:2607.12395 (cs) [2026年7月14日提出] タイトル: Ring-Zero: 兆パラメータへのスケーリングによるゼロRLでの創発的推論 著者: Xinyu Tang, Gangqiang Cao, Yurou Liu, Yuliang Zhan, Xiaochong Lan, Yifan Li, Yuchen Yan, Han Peng, Zican Dong, Zhenduo Zhang, Tianshu Wang, Xinyu Kong, Zujie Wen, Wayne Xin Zhao, Zhiqiang Zhang, Jun Zhou PDFを表示: Ring-Zero: Scaling Zero RL to a Trillion Parameters for Emergent Reasoning (Xinyu Tang他15名による論文) PDFを表示 HTML (実験的) 抽象: 人間によるアノテーションデータなしで検証可能な報酬を用いた強化学習、しばしばゼロRLと呼ばれるものは、連鎖思考推論を引き出す強力なパラダイムとして登場しました。しかし、計算上の制約から、既存の研究は主に小規模なモデルに限定されており、大規模での学習ダイナミクスと創発的な能力は未探求のままでした。このフロンティアを有意義に探求するために、私たちは高品質な推論行動を引き出すことを目指します。しかし、単純なスケーリングでは読みにくさ、トークンの冗長性、適応的な推論深度の欠如に悩まされることがわかりました。これらの課題に対処するため、クリップド重要度サンプリング、学習推論比率補正、混合精度制御などのアルゴリズムおよびシステム最適化を組み込んだ、安定かつ効率的な学習パイプラインを提案します。私たちの実験は、「苦い教訓」であるスケーリングを検証する3つの主要な発見を提供します:(1) 1兆パラメータへのスケーリングは、サンプル効率と性能上限を大幅に向上させます;(2) 学習プロセスは、初期の発見フェーズに続いてシャープニングフェーズへと段階的に進行します;(3) モデルは、擬人化、構造化されたフォーマット、自己検証、並列推論、文脈不安などの高度な認知行動を自発的に発達させ、手作業で作られたヒューリスティクスを不要にします。7つの数学的ベンチマークで評価されたRing-2.5-1T-Zeroは、競争力のある性能を達成しました。さらに、最終的な回答の正しさ以外のCoT(Chain-of-Thought)の質を評価するために、3つの次元(理解可能性、再現可能性、効率性)にわたる構造化された評価フレームワークを提案し、私たちのモデルは構造化され簡潔な推論トレースの生成において明確な優位性を示しました。観察された創発現象を共有することで、コミュニティに、特に1兆規模でのスケーリング行動に関するより深い洞察を提供できることを願っています。主題: 計算と言語 (cs.CL) 引用: arXiv:2607.12395 [cs.CL] (またはこのバージョンの場合は arXiv:2607.12395v1 [cs.CL]) https://doi.org/10.48550/arXiv.2607.12395 詳細はこちら arXiv発行のDOIはDataCite経由 (登録保留中) 提出履歴 From: Yuliang Zhan [メール表示] [v1] 2026年7月14日(火)06:14:55 UTC (4,310 KB) 全文リンク: アクセス論文: Ring-Zero: Scaling Zero RL to a Trillion Parameters for Emergent Reasoning (Xinyu Tang他15名による論文) PDFを表示 HTML (実験的) TeXソース ライセンス表示 現在の閲覧コンテキスト: cs.CL < 前 | 次 > 新着 | 最近 | 2026-07 の表示に変更: cs 参考文献と引用 NASA ADS Google Scholar Semantic Scholar export BibTeX citation Loading... BibTeXフォーマットの引用 × loading... 提供元データ: ブックマーク 参考文献ツール 参考文献と引用ツール 参考文献エクスプローラー トグル 参考文献エクスプローラー (エクスプローラーとは?) 関連論文 トグル 関連論文 (関連論文とは?) Litmaps トグル Litmaps (Litmapsとは?) scite.ai トグル scite Smart Citations (Smart Citationsとは?) コード、データ、メディア この論文に関連するコード、データ、メディア alphaXiv トグル alphaXiv (alphaXivとは?) コードへのリンク トグル CatalyzeX論文検索 (論文検索とは?) DagsHub トグル DagsHub (DagsHubとは?) GotitPub トグル Gotit.pub (Gotit.pubとは?) Huggingface トグル Hugging Face (Hugging Faceとは?) ScienceCast トグル ScienceCast (ScienceCastとは?) デモ デモ Replicate トグル Replicate (Replicateとは?) Spaces トグル Hugging Face Spaces (Spacesとは?) Spaces トグル TXYZ.AI (TXYZ.AIとは?) 関連論文 レコメンダーと検索ツール Influence Flowerへのリンク Influence Flower (Influence Flowersとは?) COREレコメンダー トグル CORE Recommender (CORE Recommenderとは?) 著者 発表場所 機関 トピック arXivLabsについて arXivLabs: コミュニティ協力者との実験的プロジェクト arXivLabsは、協力者がarXivの新しい機能を直接ウェブサイトで開発・共有できるフレームワークです。arXivLabsと協力する個人および組織は、オープンさ、コミュニティ、卓越性、ユーザーデータプライバシーという私たちの価値観を受け入れ、遵守しています。arXivはこれらの価値観にコミットしており、それらを遵守するパートナーとのみ協力します。arXivコミュニティに価値をもたらすプロジェクトのアイデアがありますか?arXivLabsについてもっと知る この論文の著者のうち、推薦者は誰ですか? | MathJaxを無効にする (MathJaxとは?)