AI・機械学習
GPT-6 Astra、Artificial Analysisコーディングエージェントインデックスで大幅に進歩
GPT-6 Astra makes major gains in the Artificial Analysis Coding Agent Index (artificialanalysis.ai)
要約
Artificial Analysisによる最新ベンチマークによると、GPT-6 Astraはコーディングエージェントインデックスにおいて、Fable 5と同等の性能をより低コストで実現しました。知能インデックスでは、GPT-5.6 Solよりも少ないトークンで同等のパフォーマンスを示しましたが、価格の上昇によりコスト効率は低下しています。特に、GPT-6 Astraはトークン効率が大幅に向上し、コーディングタスクにおいてはコストパフォーマンスの面で優位に立っています。
全文翻訳
Artificial Analysis
すべての記事
2026年9月3日
GPT-6 AstraがArtificial Analysisコーディングエージェントインデックスで大幅に進歩し、低コストでFable 5と同等のスコアを獲得しました。インテリジェンスインデックスでは、同等のパフォーマンスでGPT-5.6 Solよりも少ないトークンを使用しますが、これは価格の上昇によって相殺されます。価格は、入力/出力トークン100万あたり$4/$20から$10/$50へと、GPT-5.6 Solの現在の価格の2.5倍になり、キャッシュ読み取りに対する90%の割引とキャッシュ書き込みに対する25%のプレミアムはそのままです。
私たちの2つの主要なインデックスでは、それぞれ異なる結果が見られます。Artificial Analysisコーディングエージェントインデックスでは、GPT-6 Astraはトークン効率の大幅な向上により、Fable 5と同等の性能を半額以下で実現しています。Artificial Analysisインテリジェンスインデックスでは、GPT-6 Astraは同等のパフォーマンスで前モデルよりもトークン効率が良いですが、これは価格の上昇によって相殺されています。
Artificial Analysisコーディングエージェントインデックス - 主要なポイント:
➤ トップモデルに匹敵: Codexにおいて、GPT-6 Astraはインデックスで67を記録しました。これはClaude Opus 5およびClaude CodeのFable 5、Muse CodeのMuse Spark 1.3とほぼ同等です。Claude CodeのFable 5.1が70でインデックスのトップです。
➤ GPT-5.6 Solより70%トークン効率向上: GPT-6 Astraはトークン効率において大幅な改善を見せ、CodexハーネスにおいてGPT-5.6 Sol (max)と比較して3分の1のトークン、Claude Opus 5 (xhigh)と比較して5分の1のトークンしか使用しません。モデルの様々な努力レベルがトークン効率のパレートフロンティアを占めています。
➤ コーディングエージェントインデックスのコスト効率フロンティアをリード: 最大努力レベルで、GPT-6 AstraはGPT-5.6 Sol (max)と同程度のコストでありながら、インデックスで2ポイント高くスコアしています。タスクあたりでは、モデルはClaude Fable 5の半額以下で同等のスコアを得られます。
Artificial Analysisインテリジェンスインデックス - 主要なポイント:
➤ インテリジェンスにおいてGPT-5.6 Solと並ぶ: GPT-6 Astraはインデックスで61を記録し、GPT-5.6 Solと同等のスコアです。これはClaude Fable 5.1 (max with fallback)より5ポイント低いです。また、Metaから新しくリリースされたMuse Spark 1.3 (max)にも後れを取っています。
➤ 出力トークンは約10%削減、価格上昇で相殺: GPT-6 Astraは、Intelligence Index vs Output Tokens per Taskにおいて新しいパレートフロンティアを定義しました。最大努力レベルでGPT-5.6 Solと比較して約10%のトークン使用量削減を実現しています。しかし、価格が2.5倍になったため、最大努力レベルでのタスクあたりのコストは前モデルより75%高くなっています。
➤ GPT-5.6 Solの半分の幻覚発生率: GPT-6 Astraは、AA-Omniscience(知識と幻覚のベンチマーク)で大幅なジャンプを見せました。これは、最大努力レベルでの幻覚発生率が92%から51%へと大幅に減少したことによるものです。一部のモデルとは異なり、この改善は精度の犠牲を伴わず、Astraは同時に精度を4ポイント向上させました。
➤ AA-Briefcase Eloで約80ポイント向上: GPT-6 Astraは、AA-Briefcase(最先端の長期間知識作業評価)で約80ポイント向上しました。モデルは、複数のタスクと数千のソースファイルを含む数週間にわたるプロジェクトでテストされます。Astraは、AA-Briefcaseにおいて、前モデルと比較してルーブリックスコアと分析品質Eloの両方で大幅な増加を示しました。一方で、プレゼンテーション品質Eloの低下が見られ、この分野ではGPT-5.6 Sol (max)が依然として全モデルをリードしています。
➤ その他の評価で進捗はまちまち: このモデルは、数学、科学、人文科学に重点を置いた長年の評価であるHumanity’s Last Examで6ポイントの向上を見せました。これは、OpenAIのデータセットから適応させた、44の職業にわたる経済的に価値のあるタスクを測定するベンチマークであるGDPval-AA v2で約80 Eloポイント低下したことで相殺されています。また、τ³-Banking(カスタマーサポート)、SciCode(科学ドメインのPython問題)、AA-LCR(大規模ドキュメントにおける長文コンテキスト推論)を含む様々な能力の評価で、2〜3ポイントの後退も見られます。
コーディングエージェントインデックスのコスト改善はトークン効率によって推進されており、最大努力レベルでGPT-5.6 Sol (max)と比較して約3倍のトークン削減が実現されています。GPT-6 Astraは、コーディングエージェントインデックス対タスクあたりのコストのパレートフロンティア上にあり、最大努力設定ではGPT-5.6 Sol (max)と同程度のコストでありながら、インデックスで2ポイント高くスコアしています。
GPT-6 Astraは、インテリジェンスインデックス対タスクあたりの出力トークンのパレートフロンティアを新たに定義しており、最大努力レベルでGPT-5.6 Solと比較して約10%の出力トークン削減を実現しています。GPT-6 Astraは最大努力レベルでGPT-5.6 Solより75%高価であり、インテリジェンスインデックス対コストあたりのパレートフロンティアでは、その前モデルの多くに後れを取っています。これは価格が2.5倍になったことによるもので、トークン使用量の削減によって一部相殺されています。
GPT-6 AstraはAA-Omniscienceで大幅なジャンプを見せており、これは最大努力レベルでの幻覚発生率が92%から51%へと大幅に低下し、精度がわずかに向上したことによるものです。モデルはエージェント型知識作業においてまちまちな進捗を示しており、AA-Briefcaseでは約80ポイント向上しましたが、GDPval-AA v2では同程度後退しています。AA-Briefcaseでは、Astraはルーブリックスコアと分析品質Eloの両方で大幅な増加を示しましたが、プレゼンテーション品質Eloは低下しました。
Artificial Analysisインテリジェンスインデックスv4.1.1の個々の評価の内訳。
www.artificialanalysis.aiで、GPT-6 Astraを他の主要モデルと比較してください。
最新情報を見る
Muse Spark 1.3: Metaがフロンティアに到達
MetaのMuse Spark 1.3の独立した分析とベンチマーク
2026年9月2日
GoogleがGemini 3.8 Flashをリリース、4ヶ月足らずで4番目のFlashモデルに
Gemini 3.8 FlashはArtificial Analysisインテリジェンスインデックスで59を記録し、インテリジェンス対コストあたりのタスクパレートフロンティアに到達しました。
2026年9月2日
Claude Fable 5.1がArtificial Analysisインテリジェンスインデックスのトップに
Anthropicの新しいフロンティアモデルは、最大努力レベルで66を記録し、エージェント型知識作業でリードしていますが、75%のキャッシュ読み取り価格引き下げはトークン使用量の増加を部分的にしか相殺しません。
2026年9月1日