HN 日本語サマリー

← 一覧へ戻る
AI・機械学習

Opus 5がArtificial Analysisのインテリジェンスリーダーボードで現在1位

Opus 5 is currently #1 on Artificial Analysis Intelligence Leaderboard (artificialanalysis.ai)

354 pointsby aarondong208 コメント

要約

Artificial Analysisが公開したAIモデルのリーダーボードによると、Claude Opus 5がインテリジェンス部門でトップにランクインしました。このリーダーボードは、モデルの知能、速度、レイテンシ、価格、コンテキストウィンドウなどの主要なパフォーマンス指標を比較分析しています。Opus 5は、速度、レイテンシ、価格、コンテキストウィンドウといった他の指標でも上位に位置するモデルと比較され、総合的な性能が評価されています。

全文翻訳

Artificial AnalysisKモデルの比較: インテリジェンス、パフォーマンス&価格分析 Microevals Playground 品質、価格、出力速度、レイテンシ、コンテキストウィンドウなど、主要なパフォーマンス指標にわたるAIモデルの比較と分析。 詳細な指標を表示するには、いずれかのモデルをクリックしてください。 方法論に関する詳細については、FAQをご覧ください。 インテリジェンス Claude Opus 5 (max) および Claude Opus 5 (xhigh) が最も高いインテリジェンスを持つモデルであり、それに Claude Fable 5 (with fallback) および GPT-5.6 Sol (max) が続きます。 出力速度 (トークン/秒) Mercury 2 (939 t/s) および HyperNova 60B 2605 (436 t/s) が最も高速なモデルであり、それに Granite 4.0 H Small および Gemini 3.5 Flash-Lite が続きます。 レイテンシ (秒) Gemini 2.5 Flash-Lite (0.35秒) および Command A+ (0.41秒) が最も低いレイテンシを持つモデルであり、それに Gemini 2.5 Flash および NVIDIA Nemotron 3 Nano が続きます。 価格 ($/M トークン) Devstral 2 ($0.00) および North Mini Code ($0.00) が最も安価なモデルであり、それに Gemma 3 4B および Gemma 3 27B が続きます。 コンテキストウィンドウ Llama 4 Scout (10M) および Grok 4.20 0309 (2M) が最も大きなコンテキストウィンドウを持つモデルであり、それに Gemini 1.5 Pro (May) および Grok 4.1 Fast が続きます。 ハイライト インテリジェンス Artificial Analysis Intelligence Index · 高いほど良い 速度 出力トークン/秒 · 高いほど良い コスト/タスク Intelligence Index タスクあたりの加重平均コスト (USD) · 低いほど良い プロンプトオプション インテリジェンス Artificial Analysis Intelligence Index コーディングインデックス エージェンティックインデックス Artificial Analysis Intelligence Index Artificial Analysis Intelligence Index v4.1 は 9 つの評価を含みます: GDPval-AA v2, 𝜏³-Banking, Terminal-Bench v2.1, SciCode, Humanity's Last Exam, GPQA Diamond, CritPt, AA-Omniscience, AA-LCR 586 のうち 28 モデル 特定のプロバイダーからモデルを追加 推論モデルは電球アイコンで示されます Artificial Analysis Intelligence Index Artificial Analysis Intelligence Index v4.1 には以下が含まれます: GDPval-AA v2, 𝜏³-Banking, Terminal-Bench v2.1, SciCode, Humanity's Last Exam, GPQA Diamond, CritPt, AA-Omniscience, AA-LCR。 各評価の詳細と実行方法については、Intelligence Index の方法論をご覧ください。 オープンウェイト / プロプライエタリ 推論 / 非推論 テキストのみ / マルチモーダル入力 Artificial Analysis Intelligence Index by Open Weights / Proprietary Artificial Analysis Intelligence Index v4.1 は 9 つの評価を含みます: GDPval-AA v2, 𝜏³-Banking, Terminal-Bench v2.1, SciCode, Humanity's Last Exam, GPQA Diamond, CritPt, AA-Omniscience, AA-LCR 586 のうち 28 モデル 特定のプロバイダーからモデルを追加 プロプライエタリ オープンウェイト オープンウェイト (商用利用制限あり) 推論モデルは電球アイコンで示されます Artificial Analysis Intelligence Index Artificial Analysis Intelligence Index v4.1 には以下が含まれます: GDPval-AA v2, 𝜏³-Banking, Terminal-Bench v2.1, SciCode, Humanity's Last Exam, GPQA Diamond, CritPt, AA-Omniscience, AA-LCR。 各評価の詳細と実行方法については、Intelligence Index の方法論をご覧ください。 オープンウェイト モデルのウェイトが利用可能かどうかを示します。 商用利用が制限されているモデルは、「商用利用制限あり」と表示されます(通常、有料ライセンスの取得が必要です)。 インテリジェンスの内訳 インテリジェンス評価 Artificial Analysis によって個別に測定されたインテリジェンス評価 · 高いほど良い 22 のうち 18 評価 586 のうち 28 モデル 特定のプロバイダーからモデルを追加 GDPval-AA v2 エージェンティックな実世界のタスク (Elo-500)/2000 𝜏³-Banking エージェンティックなツール使用 Terminal-Bench v2.1 エージェンティックなコーディングとターミナル使用 SciCode コーディング Humanity's Last Exam 推論と知識 GPQA Diamond 科学的推論 CritPt 物理学の推論 AA-Omniscience 精度 AA-Omniscience 非幻覚率 1 - 幻覚率 AA-LCR 長コンテキスト推論 AA-Briefcase エージェンティックな知識作業、Elo AutomationBench-AA エージェンティックな SaaS ワークフロー Harvey LAB-AA 法的エージェンティック作業、基準達成率 EnterpriseOps-Gym-AA 新規 エージェンティックなビジネスオペレーション IFBench 指示追従 APEX-Agents-AA 長期間エージェンティックタスク ITBench-AA Kubernetes インシデントの根本原因分析 MMMU-Pro 視覚的推論 推論モデルは電球アイコンで示されます インテリジェンス評価の関連性 モデルのインテリジェンスは一般的にユースケース間で転移しますが、特定の評価は特定のユースケースにより関連性が高い場合があります。 Artificial Analysis Intelligence Index Artificial Analysis Intelligence Index v4.1 には以下が含まれます: GDPval-AA v2, 𝜏³-Banking, Terminal-Bench v2.1, SciCode, Humanity's Last Exam, GPQA Diamond, CritPt, AA-Omniscience, AA-LCR。 各評価の詳細と実行方法については、Intelligence Index の方法論をご覧ください。 AA-Briefcase AA-Briefcase Elo AA-Briefcase ルブリックスコア (%) 分析品質とプレゼンテーション Elo AA-Briefcase Elo AA-Briefcase Elo は、分析品質 Elo、プレゼンテーション Elo、およびルブリックスコアを統合した複合指標です。ルブリックパフォーマンスは、合成的なヘッドツーヘッドマッチを通じて Elo に変換されます。 Elo および 95% 信頼区間は 0 にクランプされます。 56 のうち 25 モデル 特定のプロバイダーからモデルを追加 推論モデルは電球アイコンで示されます AA-Briefcase Elo AA-Briefcase Elo は、分析品質 Elo、プレゼンテーション Elo、およびルブリックスコアを統合した複合指標です。ルブリックパフォーマンスは、合成的なヘッドツーヘッドマッチを通じて Elo に変換されます。 Elo および 95% 信頼区間は 0 にクランプされます。 AA-Omniscience AA-Omniscience Index AA-Omniscience Accuracy AA-Omniscience Hallucination Rate AA-Omniscience Index AA-Omniscience Index (高いほど良い) は、知識の信頼性と幻覚を測定します。 正解を報酬とし、幻覚を罰し、回答を拒否してもペナルティはありません。 スコアは -100 から 100 の範囲で、0 は正解と不正解が同数であることを意味し、負のスコアは不正解の方が多いことを意味します。 456 のうち 27 モデル 特定のプロバイダーからモデルを追加 推論モデルは電球アイコンで示されます AA-Omniscience Index AA-Omniscience Index (高いほど良い) は、知識の信頼性と幻覚を測定します。 正解を報酬とし、幻覚を罰し、回答を拒否してもペナルティはありません。 スコアは -100 から 100 の範囲で、0 は正解と不正解が同数であることを意味し、負のスコアは不正解の方が多いことを意味します。 オープンネス オープンネスインデックス オープンネスインデックスの構成要素 オープンネス vs. インテリジェンス Artificial Analysis Openness Index: スコア オープンネスインデックスは、0 から 100 の正規化されたスケールでモデルのオープンネスを評価します (高いほどオープン)。 291 のうち 13 モデル 特定のプロバイダーからモデルを追加 推論モデルは電球アイコンで示されます インテリジェンスインデックスの比較 インテリジェンスインデックス vs. コスト/タスク インテリジェンスインデックス vs. 時間/タスク インテリジェンスインデックス vs. 出力速度 インテリジェンスインデックス vs. エンドツーエンド応答時間 インテリジェンスインデックス vs. コスト/Intelligence Index タスク Artificial Analysis Intelligence Index · Artificial Analysis Intelligence Index タスクあたりの加重平均コスト (USD) 586 のうち 28 モデル 最も魅力的な象限 Xiami Google Anthropic MiniMax OpenAI NVIDIA Alibaba SpaceX AI DeepSeek Meta Mistral Z AI Kimi 推論モデルは電球アイコンで示されます コスト/Intelligence Index タスク Intelligence Index タスクあたりの加重平均コスト。 各評価のコストは、入力、キャッシュヒット、キャッシュ書き込み、推論、回答トークンの価格から計算され、タスク数で割られ、Intelligence Index の重みで加重されます。 Artificial Analysis Intelligence Index Artificial Analysis Intelligence Index v4.1 には以下が含まれます: GDPval-AA v2, 𝜏³-Banking, Terminal-Bench v2.1, SciCode, Humanity's Last Exam, GPQA Diamond, CritPt, AA-Omniscience, AA-LCR。 各評価の詳細と実行方法については、Intelligence Index の方法論をご覧ください。 トークン使用量 タスクあたりの出力トークン インテリジェンスインデックス vs. タスクあたりの出力トークン インテリジェンスインデックス トークン使用量 インテリジェンスインデックス vs. トークン使用量 タスクあたりの出力トークン数 Artificial Analysis Intelligence Index タスクあたりの加重平均出力トークン数 586 のうち 28 モデル 回答 推論 推論モデルは電球アイコンで示されます タスクあたりの出力トークン数 タスクあたりの出力トークン数