AI・機械学習
Opus 5がArtificial Analysisのインテリジェンスリーダーボードで現在1位
Opus 5 is currently #1 on Artificial Analysis Intelligence Leaderboard (artificialanalysis.ai)
要約
Artificial Analysisが公開したAIモデルのリーダーボードによると、Claude Opus 5がインテリジェンス部門でトップにランクインしました。このリーダーボードは、モデルの知能、速度、レイテンシ、価格、コンテキストウィンドウなどの主要なパフォーマンス指標を比較分析しています。Opus 5は、速度、レイテンシ、価格、コンテキストウィンドウといった他の指標でも上位に位置するモデルと比較され、総合的な性能が評価されています。
全文翻訳
Artificial AnalysisKモデルの比較: インテリジェンス、パフォーマンス&価格分析
Microevals Playground
品質、価格、出力速度、レイテンシ、コンテキストウィンドウなど、主要なパフォーマンス指標にわたるAIモデルの比較と分析。
詳細な指標を表示するには、いずれかのモデルをクリックしてください。
方法論に関する詳細については、FAQをご覧ください。
インテリジェンス
Claude Opus 5 (max) および Claude Opus 5 (xhigh) が最も高いインテリジェンスを持つモデルであり、それに Claude Fable 5 (with fallback) および GPT-5.6 Sol (max) が続きます。
出力速度 (トークン/秒)
Mercury 2 (939 t/s) および HyperNova 60B 2605 (436 t/s) が最も高速なモデルであり、それに Granite 4.0 H Small および Gemini 3.5 Flash-Lite が続きます。
レイテンシ (秒)
Gemini 2.5 Flash-Lite (0.35秒) および Command A+ (0.41秒) が最も低いレイテンシを持つモデルであり、それに Gemini 2.5 Flash および NVIDIA Nemotron 3 Nano が続きます。
価格 ($/M トークン)
Devstral 2 ($0.00) および North Mini Code ($0.00) が最も安価なモデルであり、それに Gemma 3 4B および Gemma 3 27B が続きます。
コンテキストウィンドウ
Llama 4 Scout (10M) および Grok 4.20 0309 (2M) が最も大きなコンテキストウィンドウを持つモデルであり、それに Gemini 1.5 Pro (May) および Grok 4.1 Fast が続きます。
ハイライト
インテリジェンス
Artificial Analysis Intelligence Index · 高いほど良い
速度
出力トークン/秒 · 高いほど良い
コスト/タスク
Intelligence Index タスクあたりの加重平均コスト (USD) · 低いほど良い
プロンプトオプション
インテリジェンス
Artificial Analysis Intelligence Index
コーディングインデックス
エージェンティックインデックス
Artificial Analysis Intelligence Index
Artificial Analysis Intelligence Index v4.1 は 9 つの評価を含みます: GDPval-AA v2, 𝜏³-Banking, Terminal-Bench v2.1, SciCode, Humanity's Last Exam, GPQA Diamond, CritPt, AA-Omniscience, AA-LCR
586 のうち 28 モデル
特定のプロバイダーからモデルを追加
推論モデルは電球アイコンで示されます
Artificial Analysis Intelligence Index
Artificial Analysis Intelligence Index v4.1 には以下が含まれます: GDPval-AA v2, 𝜏³-Banking, Terminal-Bench v2.1, SciCode, Humanity's Last Exam, GPQA Diamond, CritPt, AA-Omniscience, AA-LCR。
各評価の詳細と実行方法については、Intelligence Index の方法論をご覧ください。
オープンウェイト / プロプライエタリ
推論 / 非推論
テキストのみ / マルチモーダル入力
Artificial Analysis Intelligence Index by Open Weights / Proprietary
Artificial Analysis Intelligence Index v4.1 は 9 つの評価を含みます: GDPval-AA v2, 𝜏³-Banking, Terminal-Bench v2.1, SciCode, Humanity's Last Exam, GPQA Diamond, CritPt, AA-Omniscience, AA-LCR
586 のうち 28 モデル
特定のプロバイダーからモデルを追加
プロプライエタリ
オープンウェイト
オープンウェイト (商用利用制限あり)
推論モデルは電球アイコンで示されます
Artificial Analysis Intelligence Index
Artificial Analysis Intelligence Index v4.1 には以下が含まれます: GDPval-AA v2, 𝜏³-Banking, Terminal-Bench v2.1, SciCode, Humanity's Last Exam, GPQA Diamond, CritPt, AA-Omniscience, AA-LCR。
各評価の詳細と実行方法については、Intelligence Index の方法論をご覧ください。
オープンウェイト
モデルのウェイトが利用可能かどうかを示します。
商用利用が制限されているモデルは、「商用利用制限あり」と表示されます(通常、有料ライセンスの取得が必要です)。
インテリジェンスの内訳
インテリジェンス評価
Artificial Analysis によって個別に測定されたインテリジェンス評価 · 高いほど良い
22 のうち 18 評価
586 のうち 28 モデル
特定のプロバイダーからモデルを追加
GDPval-AA v2
エージェンティックな実世界のタスク (Elo-500)/2000
𝜏³-Banking
エージェンティックなツール使用
Terminal-Bench v2.1
エージェンティックなコーディングとターミナル使用
SciCode
コーディング
Humanity's Last Exam
推論と知識
GPQA Diamond
科学的推論
CritPt
物理学の推論
AA-Omniscience
精度
AA-Omniscience
非幻覚率
1 - 幻覚率
AA-LCR
長コンテキスト推論
AA-Briefcase
エージェンティックな知識作業、Elo
AutomationBench-AA
エージェンティックな SaaS ワークフロー
Harvey LAB-AA
法的エージェンティック作業、基準達成率
EnterpriseOps-Gym-AA
新規
エージェンティックなビジネスオペレーション
IFBench
指示追従
APEX-Agents-AA
長期間エージェンティックタスク
ITBench-AA
Kubernetes インシデントの根本原因分析
MMMU-Pro
視覚的推論
推論モデルは電球アイコンで示されます
インテリジェンス評価の関連性
モデルのインテリジェンスは一般的にユースケース間で転移しますが、特定の評価は特定のユースケースにより関連性が高い場合があります。
Artificial Analysis Intelligence Index
Artificial Analysis Intelligence Index v4.1 には以下が含まれます: GDPval-AA v2, 𝜏³-Banking, Terminal-Bench v2.1, SciCode, Humanity's Last Exam, GPQA Diamond, CritPt, AA-Omniscience, AA-LCR。
各評価の詳細と実行方法については、Intelligence Index の方法論をご覧ください。
AA-Briefcase
AA-Briefcase Elo
AA-Briefcase ルブリックスコア (%)
分析品質とプレゼンテーション Elo
AA-Briefcase Elo
AA-Briefcase Elo は、分析品質 Elo、プレゼンテーション Elo、およびルブリックスコアを統合した複合指標です。ルブリックパフォーマンスは、合成的なヘッドツーヘッドマッチを通じて Elo に変換されます。
Elo および 95% 信頼区間は 0 にクランプされます。
56 のうち 25 モデル
特定のプロバイダーからモデルを追加
推論モデルは電球アイコンで示されます
AA-Briefcase Elo
AA-Briefcase Elo は、分析品質 Elo、プレゼンテーション Elo、およびルブリックスコアを統合した複合指標です。ルブリックパフォーマンスは、合成的なヘッドツーヘッドマッチを通じて Elo に変換されます。
Elo および 95% 信頼区間は 0 にクランプされます。
AA-Omniscience
AA-Omniscience Index
AA-Omniscience Accuracy
AA-Omniscience Hallucination Rate
AA-Omniscience Index
AA-Omniscience Index (高いほど良い) は、知識の信頼性と幻覚を測定します。
正解を報酬とし、幻覚を罰し、回答を拒否してもペナルティはありません。
スコアは -100 から 100 の範囲で、0 は正解と不正解が同数であることを意味し、負のスコアは不正解の方が多いことを意味します。
456 のうち 27 モデル
特定のプロバイダーからモデルを追加
推論モデルは電球アイコンで示されます
AA-Omniscience Index
AA-Omniscience Index (高いほど良い) は、知識の信頼性と幻覚を測定します。
正解を報酬とし、幻覚を罰し、回答を拒否してもペナルティはありません。
スコアは -100 から 100 の範囲で、0 は正解と不正解が同数であることを意味し、負のスコアは不正解の方が多いことを意味します。
オープンネス
オープンネスインデックス
オープンネスインデックスの構成要素
オープンネス vs. インテリジェンス
Artificial Analysis Openness Index: スコア
オープンネスインデックスは、0 から 100 の正規化されたスケールでモデルのオープンネスを評価します (高いほどオープン)。
291 のうち 13 モデル
特定のプロバイダーからモデルを追加
推論モデルは電球アイコンで示されます
インテリジェンスインデックスの比較
インテリジェンスインデックス vs. コスト/タスク
インテリジェンスインデックス vs. 時間/タスク
インテリジェンスインデックス vs. 出力速度
インテリジェンスインデックス vs. エンドツーエンド応答時間
インテリジェンスインデックス vs. コスト/Intelligence Index タスク
Artificial Analysis Intelligence Index · Artificial Analysis Intelligence Index タスクあたりの加重平均コスト (USD)
586 のうち 28 モデル
最も魅力的な象限
Xiami
Google
Anthropic
MiniMax
OpenAI
NVIDIA
Alibaba
SpaceX AI
DeepSeek
Meta
Mistral
Z AI
Kimi
推論モデルは電球アイコンで示されます
コスト/Intelligence Index タスク
Intelligence Index タスクあたりの加重平均コスト。
各評価のコストは、入力、キャッシュヒット、キャッシュ書き込み、推論、回答トークンの価格から計算され、タスク数で割られ、Intelligence Index の重みで加重されます。
Artificial Analysis Intelligence Index
Artificial Analysis Intelligence Index v4.1 には以下が含まれます: GDPval-AA v2, 𝜏³-Banking, Terminal-Bench v2.1, SciCode, Humanity's Last Exam, GPQA Diamond, CritPt, AA-Omniscience, AA-LCR。
各評価の詳細と実行方法については、Intelligence Index の方法論をご覧ください。
トークン使用量
タスクあたりの出力トークン
インテリジェンスインデックス vs. タスクあたりの出力トークン
インテリジェンスインデックス トークン使用量
インテリジェンスインデックス vs. トークン使用量
タスクあたりの出力トークン数
Artificial Analysis Intelligence Index タスクあたりの加重平均出力トークン数
586 のうち 28 モデル
回答
推論
推論モデルは電球アイコンで示されます
タスクあたりの出力トークン数
タスクあたりの出力トークン数