AI・機械学習
ARC-AGI リーダーボード
ARC-AGI Leaderboard (arcprize.org)
要約
ARC-AGI リーダーボードは、AIエージェントが新規のインタラクティブ環境にリアルタイムで適応する能力を評価するARC-AGI-3の進捗を追跡します。このリーダーボードは、タスクあたりのコストとパフォーマンスの関係を可視化し、効率性を重視しています。データは、推論システム、ベースLLM、Kaggleシステムなどの異なるアプローチに基づいた結果を示しています。
全文翻訳
ARC-AGI-3 リーダーボード
ARC-AGI-1
ARC-AGI-2
ARC-AGI-3
著者: 全著者
モデルタイプ: 全タイプ
モデル: 全モデル
リーダーボードの理解
ARC-AGIは、受動的な流動性知能を測定した初期バージョン(ARC-AGI-1および2)から進化し、ARC-AGI-3ではAIエージェントが新規のインタラクティブ環境にリアルタイムで適応する能力が試されます。
上記の散布図は、コスト・パー・タスクとパフォーマンスの関係という効率性の重要な指標を可視化しています。真の知能とは、問題を解決するだけでなく、最小限のリソースで効率的に解決することです。
データの解釈
推論システム トレンドライン
ソリューションは、異なる推論レベルで同じモデルを表す接続された点を示しています。これらのトレンドラインは、推論時間の増加がパフォーマンスにどのように影響するかを示しており、通常、思考時間が増加するにつれて漸近的な振る舞いを示します。
ベースLLM ソリューション
これらは、GPT-4.5やClaude 3.7のような標準的な言語モデルからのシングルショット推論を表しており、拡張された推論能力はありません。これらの点は、追加の推論強化なしでのモデルの生のパフォーマンスを示しています。
Kaggle システム ソリューション
これらは、Kaggleチャレンジからのコンペティショングレードの提出物を示しており、厳格な計算制約(120の評価タスクに対して50ドルのコンピューティング予算)の下で動作します。これらは、ARCプライズのために特別に設計された、目的指向で効率的な方法を表しています。
検証ポリシー
詳細については、当社のテストポリシーをご覧ください。
リーダーボードの内訳
注記
実行に10,000ドル未満かかったシステムのみが表示されます。
完全なテスト出力を生成できなかったモデルについては、残りのタスクは誤りとしてマークされました。
「プレビュー」とマークされた結果は非公式であり、不完全なテストに基づいている可能性があります。
1 ARC-AGI-2 スコアは、部分的なテスト結果と o1-pro 価格に基づいた推定値です。
2 Gemini 3 Pro の価格に基づいた暫定的なコスト推定値です。モデルはリリース後に再テストされます。