AI・機械学習
Artificial Analysis Intelligence Index v4.2を発表
Artificial Analysis Intelligence Index v4.2 (artificialanalysis.ai)
要約
Artificial Analysisは、AIモデルの性能を評価するIntelligence Indexの最新版v4.2を発表しました。このアップデートでは、より複雑で現実的なタスク、プライベートテストセットの拡充、そしてモデルの不正行為を防ぐための重み付け調整が行われています。これにより、Indexは実際のユースケースにさらに近づき、最先端モデルの評価精度が向上しています。
全文翻訳
Artificial Analysis Intelligence Index v4.2を発表
Artificial Analysis
すべての記事
2026年9月4日
フロンティアのペースを維持するため、v5リリースの一部要素を先行してアップデートします。
Index v4.2は、より複雑で現実的なタスク、そして不正行為を防ぐためのプライベートテストセットを拡充しています。
Intelligence Index v4.2の変更点:
+ AA-Briefcase: プライベートテストセットを備えた、エージェント型知識作業の評価
+ SurgeのGDP.pdf: 4,592ページのPDFにわたる長文コンテキストの文書推論
- GPQA Diamond: 科学的推論評価で、既に飽和状態に達したため削除
さらに、不正行為を防ぐためのホールドアウトテストセットへの重み付けを増やし、グレーディングインフラストラクチャをアップグレードして堅牢性を向上させました。
このアップデートにより、Indexはより挑戦的で複雑、かつ現実的なタスクと不正行為を防ぐためのプライベートテストセットを備え、実際のユースケースに近づきました。
私たちは数ヶ月前からIndex v5の要素を計画・構築してきました。v4を1月にリリースしてから8ヶ月が経過しました。最近の主要モデルのリリースを通じてIndexを安定させるため、意図的にアップデートを控えていました。しかし、ここ数週間でフロンティアの進歩が非常に速いため、Indexがこれまで通りユーザーにとって関連性が高く有用であり続けるために、迅速な中間アップデートを提供することが重要だと感じています。
この中間アップデートに加えて、私たちのチームはIndex v5に懸命に取り組んでいます。近い将来、さらに段階的なリリースを計画しています。ご期待ください!
Intelligence Index v4.2の詳細な変更点:
➤ AA-Briefcaseの追加: プライベートホールドアウトテストセットを備えた社内評価であるAA-Briefcaseは、業界の専門家によって構築された複雑なプロジェクトにおける現実的なエージェント型知識作業タスクでモデルをテストします。モデルは、多くの連携タスクと数千の入力ソースファイルを持つ、数週間にわたる知識作業プロジェクトで評価されます。AA-Briefcaseは、ルーブリック評価とペアワイズ評価を組み合わせて、検証可能なタスクの成功度、分析の質、プレゼンテーションの質を評価し、知識作業における全体的なエージェント能力の包括的なビューを提供します。
➤ GDP.pdfの追加: Surge AIによって作成されたGDP.pdfは、100のPDFと10のドメインにわたるシングルターンのプロフェッショナル文書推論を評価します。モデルは、テキスト、表、グラフ、脚注、除外事項を含む4,592ページに分散した証拠を統合する必要があります。応答は、1,275の専門家作成の原子的な基準に対して採点されます。ヘッドラインのAll-pass Rateは、すべての基準が満たされた場合にのみタスクをクレジットします。
➤ 実世界の使用を測定し、不正行為を防ぐための重み付け: 現在、Indexの重み付けの40%はプライベートなホールドアウトテストセットです。これはv4.1の2倍の数値です。ホールドアウトデータには、AA-Briefcase、AA-Omniscience、CritPtのソリューションが含まれます。これにより、ラボが評価を不正に操作する能力が低下します。Index v5では、ホールドアウトの割合はさらに増加します。
➤ グレーディングインフラストラクチャの改善: AA-LCR v1.1では、グレーディングシステムプロンプトを追加し、解答キーのエラーや曖昧さを修正して、採点精度を向上させました。GDPval-AA v2およびAA-Briefcaseでは、サンプリングを改善し、Eloスケールを再固定したため、新しいモデルが追加されてもレーティングがより安定しました。SciCodeでは、グレーディングサンドボックスの堅牢性を改善し、遅いが正しいコードが失敗と見なされないようにしました。
主な結果:
➤ AnthropicとOpenAIがIndexをリード: AnthropicのClaude Fable 5.1がIndexをリードし、OpenAIのGPT-6 Astraがそれに続きます。GPT-6 AstraはGPT-5.6 Solと比較して4ポイント向上しています。Metaが3位のラボで、その後ろにSpaceXAI、Moonshot/Kimi、Z.AI、Googleが続きます。
➤ コスト対タスクのパレートフロンティアを4つのラボが共有: Anthropic、OpenAI、Meta、Z.AIが更新されたコスト対タスクフロンティアを占めています。
➤ GPT-6 Astraがアウトプットトークンフロンティアを支配: GPT-6 Astraは、インテリジェンスフロンティアに近いほぼすべての他のモデルよりもトークン効率が高いです。Claude Fable 5.1、Grok 4.5、Gemini 3.5 Flash-Liteが曲線の両端に位置しています(Indexで25未満のモデルは除外)。
GPT-6 Astraは、インテリジェンスフロンティアに近いほぼすべての他のモデルよりもトークン効率が高いです。Claude Fable 5.1、Grok 4.5、Gemini 3.5 Flash-Liteが曲線の両端に位置しています(Indexで25未満のモデルは除外)。
AnthropicのClaude Fable 5.1とOpus 5がAA-Briefcaseをリードし、GPT-6 AstraとMuse Spark 1.3がそれに続きます。GPT-6 Astraは、GPT-5.6 Solと比較して約85 Eloポイントの大幅な向上を示しています。
AA-Briefcaseは、プライベートホールドアウトテストセットを備えた最先端の社内評価です。この評価は、業界の専門家によって構築された複雑なプロジェクトにおける現実的なエージェント型知識作業タスクでモデルをテストします。モデルは、多くの連携タスクと数千の入力ソースファイルを持つ、数週間にわたる知識作業プロジェクトで評価されます。AA-Briefcaseは、ルーブリック評価とペアワイズ評価を組み合わせて、検証可能なタスクの成功度、分析の質、プレゼンテーションの質を評価し、知識作業における全体的なエージェント能力の包括的なビューを提供します。
OpenAIがGDP.pdfをリードしており、GPT-6 Astraが33.2%、GPT-5.6 Solが28.2%で、Claude Fable 5.1が26.2%でそれに続きます。
Surge AIによって作成されたGDP.pdfは、100のPDFと10のドメインにわたるシングルターンのプロフェッショナル文書推論を評価します。モデルは、テキスト、表、グラフ、脚注、除外事項を含む4,592ページに分散した証拠を統合する必要があります。応答は、1,275の専門家作成の原子的な基準に対して採点されます。ヘッドラインのAll-pass Rateは、すべての基準が満たされた場合にのみタスクをクレジットします。
モデルごとの詳細な内訳は以下の通りです。
Artificial Analysis Intelligence Index v4.2の詳細については、https://artificialanalysis.ai/methodology/intelligence-benchmarking を参照してください。
最新情報を見る
Benchmarking GPT-6 Astra
GPT-6 Astraは、Artificial Analysis Coding Agent Indexで大幅な向上を見せ、Fable 5と同等のスコアをより低いコストで達成しました。Intelligence Indexでは、同等のパフォーマンスでGPT-5.6 Solよりも少ないトークンを使用していますが、これはより高い価格によって相殺されています。
2026年9月3日
Muse Spark 1.3: Metaがフロンティアに到達
MetaのMuse Spark 1.3の独立した分析とベンチマーク。
2026年9月2日
GoogleはGemini 3.8 Flashをリリースしました。これは4ヶ月足らずで4番目のFlashモデルです。
Gemini 3.8 Flashは、Artificial Analysis Intelligence Indexで59を記録し、Intelligence vs. Cost per Task Paretoフロンティアに到達しました。
2026年9月2日