HN 日本語サマリー

← 一覧へ戻る
AI・機械学習

Terminal-Bench-Science: 科学研究ワークフローにおけるAIエージェントの評価

Terminal-Bench-Science: Evaluating AI agents on scientific research workflows (terminal-bench-science.ai)

15 pointsby matt_d3 コメント

要約

Terminal-Bench-Scienceは、科学研究のワークフローにおけるAIエージェントの能力を評価するための新しいベンチマークです。スタンフォード大学の研究者らが主導し、世界中の科学分野の専門家が協力して作成されました。このベンチマークは、実際の科学研究から抽出された70のタスクを含み、AIエージェントが科学的発見を加速させるための実用的なアシスタントとなることを目指しています。現在の最高性能モデルであるClaude Opus 5は、30%の解決率を達成しています。

全文翻訳

Terminal-Bench-Science 0.1 Terminal-Bench-Scienceは、研究者自身の仕事からのワークフローでAIエージェントを評価します。科学的な能力の基準を設定するのは、モデル開発者やデータベンダーではなく科学者です。 Terminal-Bench-Scienceは、スタンフォード大学の研究者らが主導し、世界中のさまざまな科学分野のドメインエキスパートや研究機関と協力して、Terminal-Benchのチームによって構築されたベンチマークです。これは、科学研究から抽出された多様で挑戦的な、専門家によってキュレーションされたワークフローを通じてAIエージェントの能力を測定します。Terminal-Bench-Scienceは、最先端のAIと共に進化する継続的なベンチマークであり、科学的ニーズとAI開発の間にフィードバックループを作成します。最初のリリースには、生命科学、物理科学、地球科学、数学、工学分野からの70のタスクが含まれています。評価された中で最も強力なモデルであるClaude Opus 5は、Terminal-Bench-Science 0.1で30%の解決率を達成しています。 Terminal-Bench-Science 0.1 リーダーボード 0% 25% 50% 75% 100% Claude Opus 5 Claude Code 30.0% GPT-5.6 Sol Codex 22.4% Claude Fable 5 Claude Code 21.4% Claude Opus 4.8 Claude Code 10.5% GPT-5.6 Terra Codex 8.6% GLM 5.3 Claude Code 8.1% Kimi K3 Claude Code 7.1% Grok 4.6 Grok Build 7.1% GPT-5.6 Luna Codex 3.3% Terminal-Bench-Science 0.1の70の科学ワークフロータスクにおける解決率 概要 Terminal-BenchがソフトウェアエンジニアリングにおけるAIエージェントの進歩を推進してきた一方で、Terminal-Bench-Scienceは科学分野に同じ野心をもたらします。私たちの目標は、科学研究の有用なアシスタントとなるような科学的能力を持つエージェントの開発を推進することです。これらのエージェントは、技術的に要求が高く時間のかかるワークフローを実行し、科学者が人間の判断が最も重要である研究課題の定義、仮説の形成、結果の解釈と検証、および発見の伝達といった科学の部分により多くの時間を費やすことを可能にするべきです。この役割において、AIエージェントは研究者が達成できることを拡張し、科学的発見を加速するのに役立ちます。これを達成するには、実際の科学的実践を反映し、能力の検証可能な証拠を提供し、AIの最前線と共に進化するベンチマークが必要です。 私たちは、実際の科学ワークフローから抽出されたベンチマークを必要としています。科学的能力は、教科書の問題や標準化された演習ではなく、実践的な科学者自身が貢献した実際の研究実践で評価されるべきです。Terminal-Bench-Scienceは、さまざまな分野の科学者に直接的な発言権と、彼らが関心を持つ問題に対するAIの進歩の基準を設定するための共有プラットフォームを提供します。科学における利害関係はあまりにも高く、そのベンチマークは外部の利益ではなく、科学コミュニティの優先事項を反映しなければなりません。 私たちは、科学的能力の検証可能な証拠を必要としています。信頼できる評価なしには、エージェントの能力が向上しているのか、あるいはその限界がどこに残っているのかを知ることはできません。Terminal-Bench-Scienceは、現実的な環境でエージェントを評価し、再現可能なタスク固有のテストで分析、シミュレーション、証明、コード、データ製品などの具体的な成果物を採点します。 私たちは、最前線に追いつくベンチマークを必要としています。科学的ベンチマークは、進歩を推進するメカニズムとしてではなく、発表する論文として扱われることが多すぎます。それらは一度リリースされると、モデルが進歩し、既知の限界が持続すると放棄されます。Terminal-Bench-Scienceは、AIの最前線と共に進化する継続的なベンチマークです。定期的なリリースを通じて、科学者は新しいワークフローを貢献し、既存のタスクを改善し、科学的ニーズとAI開発の間にフィードバックループを作成できます。 Terminal-Bench-Science フィードバックループ 科学コミュニティ <-> フロンティアAI <-> エージェント & モデル ワークフローを貢献 -> 評価 & 改善 -> 発見を加速 Terminal-Bench-Science フィードバックループ タスク Terminal-Bench-Science 0.1には、生命科学、物理科学、地球科学、数学、工学分野にわたる70のタスクが含まれています。タスクは、科学データ分析、統計的推論、シミュレーション、最適化、定理証明、画像再構成、信号処理、逆問題、センサーキャリブレーション、モデルフィッティング、分類、科学的機械学習に及びます。 Terminal-Bench-Science 0.1 タスクカバレッジ 生命科学 19 生物学 8 医学 & 健康 6 神経科学 4 生態学 & 進化 1 物理科学 17 天文学 & 宇宙論 6 物理学 5 材料科学 4 化学 2 地球科学 8 地球科学 5 大気 & 気候 1 海洋 & 海洋 1 環境 & 持続可能性 1 数学科学 17 応用数学 & 科学計算 6 オペレーションズリサーチ & 最適化 5 形式数学 & 定理証明 3 統計学 3 工学科学 9 機械 & 航空宇宙工学 5 電気 & 電子工学 2 化学 & プロセス工学 1 土木 & 構造工学 1 合計 70 タスク 0 2 4 6 8 10 5つの科学分野にわたる70の専門家キュレーションタスク タスクは、GitHub上のオープンプロセスを通じて研究者から提供され、Discordの#tb-scienceチャンネルで議論とフィードバックが行われます。貢献は提案から始まり、レビュー担当者が各アイデアを議論し、フィードバックを残し、ベンチマークで測定する価値のある科学的に根拠のあるワークフローであると判断されたものを承認します。承認された提案はプルリクエストとして実装され、レビュー担当者は各タスクが客観的に検証可能で、AIエージェントにとって真に挑戦的で、今日の最先端システムが容易に解決できるものではないことを確認します。マージするには、ドメインレビュー担当者が科学的妥当性と現実性を評価し、技術レビュー担当者がタスクの構築と検証を検査し、バーレイザーが最終的な品質チェックを実行します。920件の提案のうち、464件が実装のために承認され、386件のプルリクエストが開かれましたが、Terminal-Bench-Science 0.1に到達したのは70のタスクのみでした。この選択性は、科学的に興味深く、最先端のエージェントにとって挑戦的で、厳密な評価のために十分に指定されたタスクを作成することがいかに難しいかを反映しています。提案、プルリクエスト、レビューを横断した進捗状況は、公開タスクダッシュボードで追跡されます。 Terminal-Bench-Science 0.1 貢献 0 250 500 750 1000 タスク提案 920 (100.0%) 承認された提案 464 (50.4%) タスクプルリクエスト 386 (42.0%) 受理されたタスク 70 (7.6%) 920件のタスク提案からTerminal-Bench-Science 0.1に70件が掲載 提案、レビュー、またはプルリクエストからの22カ国にわたる376人の貢献者 結果 Terminal-Bench-Science 0.1は、科学研究のためのAIエージェントの進歩に大きな余地を残しています。評価された各モデルは、70の全タスクでタスクごとに3回の独立した試行を実行しました。Claude Codeを搭載したClaude Opus 5が30.0%で最高の解決率を達成し、続いてGPT-5.6 Sol with Codexが22.4%、Claude Fable 5 with Claude Codeが21.4%でした。Claude Opus 4.8は10.5%で中間に位置します。GPT-5.6 Terra、Kimi K3、Grok 4.6はすべて10%未満のタスクを解決します。GLM 5.3は8.1%で最も強力なオープンモデルであり、GPT-5.6 Lunaは3.3%で最下位です。 Terminal-Bench-Scienceは、Terminal-Bench 3.0と同程度にシステムを区別しますが、両方で評価されたすべてのモデルの解決率を10パーセントポイント以上低下させます。このギャップは意図的です。レビュー中、タスクは最新の最先端モデルに挑戦するように調整されました。 Terminal-Bench-Science vs. Terminal-Bench Terminal-Bench 2.1: 42.7% Terminal-Bench 3.0: 34.4% Terminal-Bench-Science 0.1: Opus 5 — 30.0% Terminal-Bench 3.0: GPT-5.6 Sol — 22.4% Terminal-Bench 3.0: Fable 5 — 83.8% Terminal-Bench-Science 0.1: Fable 5 — 21.4% Terminal-Bench 3.0: Opus 4.8 — 78.9% Terminal-Bench-Science 0.1: Opus 4.8 — 10.5% Terminal-Bench 3.0: GPT-5.6 Terra — 78.4% Terminal-Bench-Science 0.1: GPT-5.6 Terra — 8.6% Terminal-Bench 3.0: GPT-5.6 Luna — 75.7% Terminal-Bench-Science 0.1: GPT-5.6 Luna — 3.3% Terminal-Bench 2.1、Terminal-Bench 3.0、Terminal-Bench-Science 0.1における解決率 パフォーマンスは進歩の唯一の側面ではありません。コスト-解決率プロットは、70の全タスクにおける総評価コストと解決率を示しています。GPT-5.6 Luna、Kimi K3、GPT-5.6 Terraは、フロンティアの低コスト領域を占めています。GPT-5.6 SolとClaude Opus 5は、より高いコストで最高の解決率に達し、Opus 5は7.0kドルです。GPT-5.6 Solは、Claude Fable 5のパフォーマンスと同等ですが、コストは3分の1未満です(4.2kドル対14.2kドル)。トークン使用量は、異なるフロンティアを示しています。Claude Fable 5は、GPT-5.6 Solのパフォーマンスと同等でありながら、約