HN 日本語サマリー

← 一覧へ戻る
AI・機械学習

OpenAIのGPT-6 AstraがARC-AGI-3で達成したこと

OpenAI's GPT-6 Astra on ARC-AGI-3 (arcprize.org)

177 pointsby vignesh_warar113 コメント

要約

OpenAIのGPT-6 Astraが、ARC-AGI-3ベンチマークにおいて、標準ハーネスで62.7%(26,000ドル)、プロバイダーアダプターハーネスで99.9%(19,000ドル)という驚異的なスコアを達成しました。Astraは、未知の環境を記号的な世界モデルに変換し、独自のドメイン固有言語を開発することで、人間のベースラインをアクション効率で上回りました。

全文翻訳

OpenAIのGPT-6 AstraがARC-AGI-3で達成したこと Greg Kamradt著 2026年9月3日公開 OpenAIのGPT-6 AstraがARC-AGI-3で達成したこと 概要 GPT-6 Astraは、標準ハーネスで26,000ドルをかけARC-AGI-3セミプライベートで62.7%、プロバイダーアダプターハーネスで19,000ドルをかけ99.9%のスコアを達成しました。 標準ハーネスは、モデルが環境全体を通して保持したいノートを持ち越せるようにします。 プロバイダーアダプターハーネスは、リクエスト間で不透明な推論状態を保持し、長い会話のために圧縮を使用することで、モデルが以前の作業を再利用できるようにします。 GPT-6 Astraは、ARC-AGI-3におけるアクション効率で人間のベースラインを上回っています。テストされた人間のメディアンよりも少ないアクションで96%のレベルを解決しました。 GPT-6 Astraで観察された重要な行動は、未知の環境をコンパクトな記号的世界モデルに変換する能力でした。ゲームのメカニズムを論理的なルールとして表現し、状態を追跡しアクションを計画するために独自のドメイン固有言語の略語を開発しました。 ARC-AGI-3 ARC-AGI-3は、新しい抽象的なターンベース環境を通じてエージェント的な知能を研究するためのベンチマークです。エージェントは、明示的な指示なしにアクションを効果的に計画するために、探索し、目標を推測し、環境の内部モデルを構築する必要があります。 あなたもARC-AGI-3を自分でプレイできます。 ブラウザはインラインビデオをサポートしていません。 これらの環境にはコア知識の事前知識のみが含まれており、人間の参加者による制御されたテストを通じて難易度が調整されています。人間は環境の100%を解決できます。 ARC-AGIシリーズの目標は、現在の人工知能とAGIの間の「残差ギャップ」を測定することです。AGIを、人間ができるあらゆるスキルを、人間と同じ効率で獲得するシステムの能力と定義します。 ARC-AGI-3はARC-AGIベンチマークシリーズの第3世代です。ARC-AGI-1およびARC-AGI-2を超えたエージェント能力をテストします。各世代は前の世代を拡張します。最先端のAI機能が進歩するにつれて、私たちのベンチマークも進歩しなければなりません。 ARC-AGI-3は、エージェント知能の4つのコンポーネントをテストします。 探索:現実世界の環境では、情報はほとんど受動的に提供されません。エージェントは、周囲と相互作用することによって能動的に情報を取得する必要があります。 モデリング:エージェントは、生の観測を、将来の状態と結果を予測できる一般化可能なモデルに変換する必要があります。 目標設定:エージェントは、わずかな報酬のみでターゲットとなる将来の状態を特定する必要があります。 計画と実行:エージェントは、新しい情報が現れるにつれて、現在の状態から目標へのパスをマッピングし、コースを修正する必要があります。 Astraの結果 GPT-6 Astraは、標準ハーネスとプロバイダーアダプターハーネスの両方でARC-AGI-3で最先端のスコアを達成しました。より高い推論レベルは、Astraがゲームをより少ないアクションで解決するため、モデル呼び出しとトークンの総数を減らすため、一般的にコストが低くなります。 完全な結果を表示します。 標準ハーネスで、OpenAIのAstra(最大)はARC-AGI-3セミプライベートで62.7%、26,000ドルでスコアを記録しました。 プロバイダーアダプターハーネスでは、Astra(高)は99.9%、19,000ドルでスコアを記録しました。 どちらも最先端のスコアです。 完全なリーダーボードをご覧ください。 最大推論努力では、Astraはゲームをより効率的に解決し、より少ないアクションで済むため、他の推論努力レベルと比較して総コストが低くなります。 推論努力 | 標準ハーネス | プロバイダーアダプターハーネス ---|---|--- 最大 | 62.7%、26,098ドル | 98.6%、17,332ドル x高 | 59.3%、37,317ドル | 98.4%、18,147ドル 高 | 54.8%、40,705ドル | 99.9%、18,817ドル 中 | 38.6%、48,090ドル | 98.4%、19,285ドル 低 | 17.5%、38,166ドル | 98.0%、21,298ドル なし | 35.2%、49,791ドル | 96.7%、23,457ドル コスト比較のため、制御されたテスト中、人間の参加者には90分セッションあたり115ドル、完了したゲームあたり5ドルが支払われました。参加者はセッションあたり約9ゲームを試行し、ボーナス前で試行ゲームあたり約12.78ドルでした。この料金のほとんどは、AIとの比較に近い指標である、参加者の時間とテストを受ける意欲に支払われます。脳のエネルギーのみを見ると、それを電気料金として計算すると、セッションあたり約0.6セント、または試行ゲームあたり0.067セントに低下します。 分析 スコアを超えて、Astraのリプレイは、未知のゲームメカニズムを役立つ作業モデルにどのように変換するかを示しています。3つの発見が際立っていました。開発したコンパクトな代数的表記法、人間と比較したアクション効率、および構築したカスタムツールです。 カスタム代数的表記法 ARC-AGI-3をプレイする際、Astraはどの戦略ノートを持ち越したいかを選択します。オブジェクト、座標、ルール、未完了の計画を追跡しながら、環境のために生成したカスタムドメイン固有言語表記法も使用しました。他のモデルでも同様の行動が見られましたが、Astraのノートはその精度と情報密度で際立っていました。シーンをコンパクトなコードのような記号モデルに凝縮しました。オブジェクトの場所、それらの相互作用、そして正確にどの操作が必要で、どのような順序で行う必要があるかです。これは、完全なプログラミング言語ではなく、オンザフライの代数的略語です。 例: ゲームの状態:L8: hub q2 (8↓)。長さ:14=1… レベル、ローカル回転インデックス、メカニズムの長さを記録します。s5i5、フレーム219 複数ステップの計画:extend8 to3; retract10 to2; shorten8 to1 8色と10色メカニズムへの順序付けられた変更シーケンスを記録します。s5i5、フレーム219 コントロールと座標:9−=(39,4), rotate=(49,18), 14+=(59,11) 操作を実行するコントロールの座標に操作をマッピングします。s5i5、フレーム235 時間と位置:ターン5:P=(24,20), empty, facing west ターンカウンターをプレイヤーの位置、状態の保持、および向きと組み合わせます。wa30、フレーム708 Astraがs5i5をプレイし、オンザフライの代数的略語を使用して状態を追跡し、アクションを計画している様子。 人間とのアクション効率比較 ARC-AGI-3をリリースする前に、アクション効率の人間ベースライン、または単に人々が各環境をどれだけ早く解決したかを確立するために、一般市民約500人をテストしました。参加者はパズル解決の経験や能力で選ばれたわけではありません。 各レベルについて、「人間ベースライン」を、それを完了したプレイヤーの中央値アクション数を使用して定義しました。これにより、人間とAIのパフォーマンスを比較するための参照が得られます。より多くのアクションを必要とするAIはアクション効率が低く、より少ないアクションを必要とするAIはアクション効率が高くなります。 プロバイダーアダプターハーネスでは、Astra(最大)は96.0%のレベルで人間ベースラインよりも少ないアクションを使用し、平均でレベルあたり51.7%少ないアクションを使用しました。これは重要なマイルストーンです。これは、ARC-AGI-3のアクション効率の尺度によれば、Astraが人間のパリティに匹敵し、それを超えたことを意味します。 余談ですが、ARC-AGI-3をリリースする前に、アクション効率が人間とAIの間の分かれ道であり続けると仮説を立てました。AIが環境を解決した場合でも、人間よりも大幅に多くの探索(アクション)を必要とする可能性があると予想していました。それはブルートフォースアプローチには当てはまりますが、最先端のAIはよりバイナリのようなパターンを示します。最先端のAIがメカニズムを「理解」すると、一般的に人間の効率の範囲内で実行されます。 Astraのアクション効率と人間の比較 各点は、Astra(最大)が完了したレベルを表します。実線の下の点は、人間ベースラインよりも少ないアクションを示しています。 上記のプロットは、Astraが各レベルを完了するために使用したアクション数と、人間ベースラインを比較しています。これは、ARC-AGI-3が単なるタスク完了だけでなく、アクション効率を測定する理由を裏付けています。完了のみのスコアでは、Astraが