AI・機械学習
AIはAIの研究開発を自動化できるか?
Can AI automate AI R&D yet? (epoch.ai)
要約
AI開発者は、自動化されたAI研究者の創出を目指していますが、その実現にはまだ課題があります。本稿では、AIが機械学習の革新的な手法を独自に発見できるかを評価するInnovationEvalという新しいベンチマークを紹介します。最新のAIモデルでも、多大な計算リソースを費やしても、このタスクで目立った進歩は見られませんでした。
全文翻訳
Introduction
AI開発者は、自動化されたAI研究者の創出を目指しています。彼らはどれほどそれに近づいているのでしょうか?既存の証拠は、AIがAI研究に関連するソフトウェアエンジニアリングタスク、データセット作成、および定義されたメトリクスのオープンエンドな最適化(オートリサーチ)を含むその他のタスクを実行できることを示しています。しかし、AIの研究開発(R&D)の完全な自動化が何を意味するのか、そこには幅広い活動が含まれるため、まだ不明瞭です。明白なギャップの一つは、エンドツーエンドの研究プロジェクトを実行する能力です。最近のCrux Evals、ResearchGym、RSI-Benchなどの研究と同様に、私たちはAIをエンドツーエンドの研究タスクでテストします。
私たちは、AIが人間の研究者によって開発されたものに匹敵する、新しい機械学習技術を独立して発見する能力を測定する評価であるInnovationEvalからの初期結果を発表します。最近の最先端モデルは、数千ドル相当のGPU時間を費やして実験を実行しているにもかかわらず、このタスクではほとんど進歩が見られません。私たちはこの方法論を拡大・反復し、AI自体の研究を自動化する方向でのAIの進歩を追跡する予定です。
Methodology
InnovationEvalは、AIが、AIが見たことのない最近の人間の開発したイノベーションと同等の性能を持つMLイノベーションを独立して考案できるかどうかをテストします。これは、最近提案された科学的発想のテストに似ています。もしAIに1905年までの人類の知識が与えられたら、特殊相対性理論を再発見できるでしょうか?私たちはより控えめな質問をします。もしAIに2026年初頭までのAI研究者の知識が与えられたら、それ以降の人間の研究者が達成した改善に匹敵する、独自のMLアルゴリズムのイノベーションを発見できるでしょうか?
このアプローチを通じて、いくつかの利点を達成したいと考えています。それは、AIのR&D能力のエンドツーエンド検証、既存技術の組み合わせではなく、真のイノベーションの要件、研究分野の現実的な表現、そして保証された実現可能性です。
エンドツーエンド検証:AIシステムは、アイデアの創出から実装に至るまで、MLイノベーションを発見するプロセス全体を実行する必要があります。NanoGPTスピードランやResearchGymなどの既存の研究と同様に、改善されるべきメトリクスと満たされるべき制約を定義します。エンドツーエンドメトリクスを使用することは、メトリクスの改善がAIに研究の進歩を要求する場合、AIのパフォーマンスを評価するための分かりやすい方法を提供します。私たちのケースでは、これらのメトリクスは人間が作成した既存の論文に合わせるように設定されています。私たちは、ポストトレーニング手法を改善する必要があるAIエージェントを設定しました。これには、アイデアの生成、実装の詳細の検討、実験、結果の分析、そして成功または限界に達するまでの反復といったエンドツーエンドのプロセスが必要です。
イノベーションが必要:多くのAI R&D評価は、イノベーションを必要としない、または新規でない技術の組み合わせを適用することで解決できる、明確に定義されたタスクを調べています。一部の既存のベンチマークは、R&Dのアイデア創出タスクを分離しようとしていますが、実装と分析を含む完全なループからこのタスクを分離して実行できるかどうかは不明です。私たちの評価は、トレーニング中にAIが見たことのない手法の開発を必要とする、エンドツーエンドのメトリクスを大幅に改善するタスクを設定します。これはタスク設定で詳しく説明します。
研究分野の現実性:最先端のAIラボで価値があるとされ(そして使用されている)ML技術を発見するAIの能力をテストしたいと考えています。これは、最先端のAI開発者が多くの手法について秘密主義であるため困難です。私たちはAIにそれらのML技術を再発見させることを直接テストすることはできません。そのため、代わりに公開されている出版物や、著名なニアフロンティアモデルでの採用、ポストトレーニング研究者による議論など、技術が有用である証拠に依存します。ここでは、オンポリシー自己蒸留に関する論文を選択しました。これについては以下でさらに詳しく説明します。
実現可能性:実際の、再現可能なAI論文を使用することで、タスクが実現可能であることが保証され、人間の研究者が必要とするGPUリソースに関する情報が得られます。一部のAI R&D評価では、既存の方法を改善することが目的ですが、人間のベースラインがないため、必要な予算や、人間が異なるアプローチを試したかどうかについての明確さが低下します。
既存のイノベーションに依存することには、欠点もあります。一つは、少なくともこのイテレーションでは、完全に自動化された採点を可能にするタスクを作成するのに苦労したことです。これはタスク設定で詳しく説明します。もう一つの欠点は、各個々の試みがかなりの計算予算を必要とするため、少数の実行に依存することになったことです。
既存のイノベーションを使用することのもう一つの欠点は、新しいモデルが私たちのタスクを記憶してしまうことです。これはこのプロジェクトの過程で起こりました。私たちの主な結果は、Claude Fable 5とGPT-5.6 Solに関するもので、検索を使用せずに論文の詳細を思い出したり推測したりするように指示されたとき、記憶の兆候は見られませんでした。しかし、それらの後継機であるClaude Fable 5.1とGPT-6 Astraは、タスクを認識していました。将来の評価では、新しいモデルでの記憶のテストを継続的に実行し、その結果を適切にフラグを立て、必要に応じて新しいタスクを開発して評価を更新する予定です。
Task setup
テストベッドタスクとして、最近のモデルに採用され、引用されている最新のAIイノベーションであるオンポリシー自己蒸留(SDPO)を使用しました。AIエージェントには、強力なGRPOベースラインを上回る新しいポストトレーニング技術を開発するように指示されました。エージェントの目標は「分野を真に進歩させるような、説得力のある研究結果を生み出すこと」であると強調しました。その後、元の論文の結果で使用されたメトリクスとデータセットを提供しました。それは、短い回答の質問とコーディングです。エージェントには、Qwen3-8Bモデルをポストトレーニングしてこれらのタスクでのパフォーマンスを向上させることで、その手法の成功の証拠を生成するように指示されました。理想的には、最近の匿名の手法(SDPO)によって設定された参照値を一致させるか、それを超えることを目指しました。
全体的な評価グレードは、元の論文の実験に基づいた複数のサブメトリクスを持つ2つの結果領域にわたる平均パフォーマンスです。領域で元の論文のパフォーマンスに一致またはそれを超えることは100%のスコアをもたらし、GRPOベースラインでのスコアは0%と採点されます。プロンプトと採点の詳細については、Scoringで提供します。
タスクの範囲を正しく設定することが重要です。もし目標がこれらのデータセットでのパフォーマンスを純粋に向上させることであれば、ファインチューニング用の合成データセットを生成するなど、多くの方法が考えられます。これは新しいポストトレーニング技術の開発とは見なされず、分野を進歩させないため、エージェントはこのアプローチを使用しないように知っているべきだと主張できます。新規性を評価しようとするのではなく、エージェントが自身の独自のアプローチを通じて、元のイノベーションのパフォーマンスに一致させることのみができるように範囲を制限しようとしました。範囲を、損失とその更新、および/または固定されたトレーニングデータバッチを与えられたモデル駆動のリビジョンに影響を与えるアルゴリズムの変更に限定します。この範囲は、元の論文のイノベーションとは大きく異なる可能性のある、多くの異なるアルゴリズムのアイデアを可能にします。しかし、それは開発を大まかに同じ研究分野に制約します。
このように範囲を制限すると、エージェントが定義の抜け穴を繰り返し探し、後で範囲外と見なされるソリューションを実装するという、いたちごっこ(whack-a-mole)のダイナミクスにつながるリスクがあります。しかし、範囲を不完全に制限することでも、エージェントのソリューションをレビューする際の負担が軽減されるため役立ちます。
当初、エージェントのソリューションをレビューし、範囲違反を評価するためにOpus 5ジャッジを使用した自動グレーダーを実験しました。しかし、評価したモデルの数が少なかったため、タスク完了後に人間が介入するレビューを行い、提出されたスコアとその仕組みを調査しました。定性的な発見は全体を通して議論します。
Environme