HN 日本語サマリー

← 一覧へ戻る
AI・機械学習

SpaceXAIのGrok 4.6、Artificial Analysis Intelligence Indexで61点を獲得

SpaceXAI's Grok 4.6 Scores 61 on the Artificial Analysis Intelligence Index (artificialanalysis.ai)

316 pointsby wertyk322 コメント

要約

SpaceXAIのGrok 4.6がArtificial Analysis Intelligence Indexで61点を記録し、GPT-5.6 Solと同等のフロンティアに位置づけられました。特に、低コストで優れたエージェント性能を発揮し、Claude Opus 5やClaude Fable 5といった最上位モデルに迫る結果を示しています。コストパフォーマンスに優れ、長期間にわたるエージェント作業タスクにおいても効率的な処理能力を示しています。

全文翻訳

Artificial AnalysisK全記事2026年8月12日SpaceXAIのGrok 4.6、Artificial Analysis Intelligence Indexで61点を獲得、GPT-5.6 Solと同等のフロンティアに、低コストで際立ったエージェント性能を発揮Grok 4.6は、リリースからわずか1ヶ月強でIntelligence IndexでGrok 4.5から5ポイント、Grok 4.3からは23ポイント向上しました。これにより、SpaceXAIはAnthropicに次いで、OpenAIと共にインテリジェンスのフロンティアに戻りました。主なポイント:➤ Grok 4.6がArtificial Analysis Intelligence Indexのフロンティアに加わる:61点を記録し、GPT-5.6 Sol(最大)と同等、Claude Opus 5(最大、63点)とClaude Fable 5(フォールバックあり最大、62点)に次ぎ、Kimi K3をわずかに上回っています。➤ 強力なエージェント性能:Grok 4.6は、Claude Opus 5に次ぐGDPval-AA v2 Elo 1753を達成し、Claude Fable 5およびQwen3.8 Maxとの信頼区間が重複しています。𝜏³-Bankingでは50.7%(Qwen3.8 Maxの51.3%と並びトップ2)、Terminal-Bench v2.1では88.4%(リーダーモデルと同等)を記録しました。➤ 低コストでフロンティアレベルのインテリジェンス:ヘッドライン価格はGrok 4.5から変更なく、100万入力/出力トークンあたり2ドル/6ドルです。これはClaude Opus 5(5ドル/25ドル)およびGPT-5.6 Sol(5ドル/30ドル)よりも60%以上低くなっています。タスクあたりのコストは0.84ドルで、Kimi K3と同等でありながらわずかに高いインテリジェンスを持ち、Intelligence vs. Cost per Task Paretoフロンティアに位置しています。➤ Grok 4.6は、長期間にわたるエージェントによる知識作業タスクのプライベートベンチマークであるAA-BriefcaseでFable 5ティアに位置し、Elo 1577を記録しました。これはClaude Opus 5ファミリーの後塵を拝していますが、タスク完了あたりのターン数(約53ターン、約0.5B入力トークン)はClaude Opus 5(最大、約103ターン、約2.0B入力トークン)の半分であり、顕著なターン効率を示しています。その他のモデル詳細:➤ コンテキストウィンドウは50万トークン(Grok 4.5から変更なし)➤ 価格は100万トークンあたり入力/出力で2ドル/6ドル。キャッシュヒットは100万トークンあたり0.5ドルに割引(Grok 4.5のキャッシュヒット0.3ドルから増加)エージェント性能Grok 4.6の最も強力な結果は、静的な推論よりもエージェントによる作業で得られました。実際の剤ント知識作業の主要な指標であるGDPval-AA v2では、Elo 1753を記録しました。これはClaude Opus 5に次ぐもので、信頼区間の重複を考慮するとClaude Fable 5およびQwen3.8 Maxと統計的に区別できません。このパターンはタスクタイプ全体に及びます。𝜏³-Banking(50.7%)は、ツール使用を伴うマルチターンのカスタマーサービスをテストし、Grok 4.6をトップ2に位置づけます。一方、Terminal-Bench v2.1(88.4%)は、ターミナルベースのソフトウェアタスクでリーダーと同等に評価されます。知識作業、カスタマーサービス、ターミナル使用のすべてで同時に競争力のあるモデルは少数です。価格設定と組み合わせると、これはGrok 4.6をIntelligence Indexのすべてのエージェント評価において、コスト対パフォーマンスのパレートフロンティアに位置づけます。コストフロンティアでのヘッドライン価格を世代間で一定に保つことは、インテリジェンスの向上が通常価格の上昇を伴うこの分野では珍しいことです。Grok 4.6は、Intelligence Indexで5ポイントの向上を、変更のない2ドル/6ドルの価格で提供します。タスクあたりの測定コスト0.84ドルは、その価格設定と妥当なトークン効率を反映しています。購入者にとって重要な比較は、2ポイント以内にスコアが近いモデル、つまり5ドル/25ドルのClaude Opus 5と5ドル/30ドルのGPT-5.6 Solとの比較です。Grok 4.6は、GPT-5.6 Solと実質的に同じIntelligence Indexスコアを、推論負荷の高いワークロードでコストを支配する出力トークン価格のわずかな割合で提供します。長期間にわたる知識作業Grok 4.6は、長期間にわたるエージェントによる知識作業タスクのプライベートベンチマークであるAA-BriefcaseにElo 1577でデビューします。これはFable 5ティアに位置し、Claude Opus 5ファミリーの後塵を拝していますが、単一の次元での強さが別の次元の弱さを相殺するのではなく、ルーブリック評価、プレゼンテーション品質、分析品質全体で一貫して高いパフォーマンスを発揮します。効率プロファイルもスコアと同様に注目に値します。Grok 4.6は、タスクを平均約53ターン、約0.5B入力トークンで解決します。これは、Claude Opus 5(最大)の約103ターン、約2.0B入力トークンと比較して、半分以下のターン数と4分の1の入力トークンで同等の回答に到達します。長期間のエージェント作業はコンテキストを急速に蓄積するため、同等の回答に半分以下のターン数と4分の1の入力トークンで到達できるモデルは、トークンあたりの価格をはるかに超えるコスト上の利点があります。全結果Artificial Analysis Intelligence Indexの個々の評価の詳細な内訳:Grok 4.6の詳細とベンチマークについては、Artificial Analysisをご覧ください:https://artificialanalysis.ai/models/grok-4-6最新情報を見るUpstage Solar Pro 4:ベンチマークと分析UpstageがSolar Pro 4をリリースAugust 12, 2026NVIDIA、Nemotron 3.5 Lightningをローンチオンデバイスでのスケーラブルなインテリジェンスにおいて効率的August 11, 2026AA-AnalystAgentを発表:実際のスプレッドシートとドキュメントに対する定量的分析のためのエージェントベンチマークAA-AnalystAgentは、14のビジネスおよび科学ドメインにわたる80のプライベート定量的分析質問に対してエージェントをテストします。各質問は、実際のソーススプレッドシートとドキュメントのフォルダから回答されます。各質問は5回実行され、ヘッドラインメトリックはpass^5(5回すべてで解決)です。なぜなら、時々しか正しくないアナリストエージェントは、依然として手動でチェックする必要があるからです。August 10, 2026