AI・機械学習
Qwen3.8 Maxがエージェンティックインデックスで総合トップモデルにランクイン
Qwen3.8 Max now ranked as the best overall model by agentic index (artificialanalysis.ai)
要約
Artificial Analysisは、最新のインテリジェンスインデックスv4.1.1を発表し、Qwen3.8 Maxが総合モデルとして最高位にランクインしたことを明らかにしました。このインデックスは、AIモデルの知能、速度、コストを評価するもので、Qwen3.8 Maxは複数の評価項目で高いパフォーマンスを示しました。また、Claude Opus 5もエージェンティックな知識作業においてリーダーとして評価されています。
全文翻訳
Artificial AnalysisK独立したAI分析インテリジェンスインデックスv4.1.1インテリジェンスインデックスv4.1.1は、𝜏³-Bankingをv1.0.1に移行し、HLE、AA-LCR、AA-OmniscienceのグレーダーをGPT-5.6 Luna (medium)にアップグレードしました。ローンチエンドポイント精度インデックスプロバイダーのエンドポイントが、参照モデルと同じモデル品質を提供しているかどうかを測定します。ハイライトインテリジェンスArtificial Analysisインテリジェンスインデックス・高いほど良い速度出力トークン/秒・高いほど良いコスト/タスクインテリジェンスインデックスタスクあたりの加重平均コスト(USD)・低いほど良いパーソナライズされたモデルレコメンダーあなたの知能、速度、コストの優先順位に基づいたパーソナライズされた推奨事項を取得します。汎用作業、コーディング、カスタマーサポートなどのエージェントを探求する機能、価格設定、プラットフォームサポート全体でAIエージェントを比較します。プレミアムプランにアクセス拡張されたベンチマークデータ、カスタムビジュアライゼーション、業界レポートなどにアクセスできます。変更履歴方法論の更新・8月6日Artificial Analysisインテリジェンスインデックスv4.1.1新しい言語モデル評価・8月6日Ling 3.0 Tiny新しい記事公開・8月5日Muse Spark 1.2新しい言語モデル評価・8月5日Qwen3.8 Max新しい言語モデル評価・8月5日Ling-3.0-flash新しい言語モデル評価・8月5日Muse Spark 1.2 (xhigh)新しい記事公開・8月4日エンドポイント精度インデックスのローンチ:同じモデル、異なる精度新しい言語モデル評価・8月3日G9v3-39A5B新しい記事公開・7月31日DeepSeek V4 Flash 0731がArtificial Analysisインテリジェンスインデックスで50点を獲得、以前のDeepSeek V4 Flashを10点上回る新しい言語モデル評価・7月31日Celeris-1新しい言語モデル評価・7月31日DeepSeek V4 Flash 0731 (Reasoning, Max Effort)新しい記事公開・7月30日Inkling Smallが、パラメータ数の3分の1未満でArtificial AnalysisインテリジェンスインデックスでInklingに1点差で迫る方法論の更新・7月30日コスト/タスクの方法論を更新し、コスト見積もりにわずかな絶対値の増加をもたらしましたが、相対的な位置づけへの影響は最小限です。新しい言語モデル評価・7月30日Kimi K3 (low)新しい言語モデル評価・7月30日Inkling Small新しい記事公開・7月29日Agnes AIがAgnes 2.5 Pro Alphaをリリース新しい記事公開・7月24日Claude Opus 5:エージェンティックな知識作業における新しいリーダー新しい記事公開・7月24日Opus 5:より低いコスト/タスクでFable 5レベルの知能新しい言語モデル評価・7月24日Claude Opus 5 (Adaptive Reasoning, Low Effort)新しい言語モデル評価・7月24日Claude Opus 5 (Adaptive Reasoning, Medium Effort)さらに表示インテリジェンス当社の独立した評価に基づく主要AIモデルの知能Artificial Analysisインテリジェンスインデックス更新エージェンティックインデックス更新Artificial AnalysisインテリジェンスインデックスArtificial Analysisインテリジェンスインデックスv4.1.1には9つの評価が含まれています:GDPval-AA v2、𝜏³-Banking、Terminal-Bench v2.1、SciCode、Humanity's Last Exam、GPQA Diamond、CritPt、AA-Omniscience、AA-LCR595モデル中26件NEW特定のプロバイダーからモデルを追加推定(独立評価は近日公開予定)推論モデルは電球アイコンで示されますArtificial AnalysisインテリジェンスインデックスArtificial Analysisインテリジェンスインデックスv4.1.1には以下が含まれます:GDPval-AA v2、𝜏³-Banking、Terminal-Bench v2.1、SciCode、Humanity's Last Exam、GPQA Diamond、CritPt、AA-Omniscience、AA-LCR。各評価の詳細と実行方法については、インテリジェンスインデックスの方法論を参照してください。オープンウェイト/プロプライエタリ推論/非推論テキストのみ/マルチモーダル入力国別Artificial Analysisインテリジェンスインデックス(オープンウェイト/プロプライエタリ別)Artificial Analysisインテリジェンスインデックスv4.1.1には9つの評価が含まれています:GDPval-AA v2、𝜏³-Banking、Terminal-Bench v2.1、SciCode、Humanity's Last Exam、GPQA Diamond、CritPt、AA-Omniscience、AA-LCR595モデル中26件NEW特定のプロバイダーからモデルを追加推定(独立評価は近日公開予定)プロプライエタリオープンウェイト(商用利用制限あり)オープンウェイト推論モデルは電球アイコンで示されますArtificial AnalysisインテリジェンスインデックスArtificial Analysisインテリジェンスインデックスv4.1.1には以下が含まれます:GDPval-AA v2、𝜏³-Banking、Terminal-Bench v2.1、SciCode、Humanity's Last Exam、GPQA Diamond、CritPt、AA-Omniscience、AA-LCR。各評価の詳細と実行方法については、インテリジェンスインデックスの方法論を参照してください。オープンウェイトモデルのウェイトが利用可能かどうかを示します。商用利用が制限されている場合(通常は有料ライセンスの取得が必要)、モデルは「商用利用制限あり」と表示されます。コスト/タスク時間/タスク出力トークン/タスクコスト/インテリジェンスインデックス・タスクあたりの加重平均コスト(USD)トークンタイプ別にセグメント化されています。低いほど良い595モデル中26件NEW回答推論キャッシュ書き込みキャッシュヒット入力推論モデルは電球アイコンで示されますコスト/インテリジェンスインデックス・タスクあたりタスクあたりの加重平均コスト。各評価のコストは、入力、キャッシュヒット、キャッシュ書き込み、推論、回答トークンの価格から計算され、タスク数で割られ、インテリジェンスインデックスの重み付けがされます。インテリジェンスインデックス vs. コスト/タスクインテリジェンスインデックス vs. 時間/タスクインテリジェンスインデックス vs. 出力トークン/タスクインテリジェンスインデックス vs. コスト/インテリジェンスインデックス・タスクArtificial Analysisインテリジェンスインデックス・タスクあたりの加重平均コスト(USD)595モデル中26件NEW最も魅力的な象限パレート線XiaomiMetaGoogleAnthropicMiniMaxOpenAINVIDIAAlibabaSpaceXAIMistralZ AIKimiDeepSeek推論モデルは電球アイコンで示されますコスト/インテリジェンスインデックス・タスクあたりタスクあたりの加重平均コスト。各評価のコストは、入力、キャッシュヒット、キャッシュ書き込み、推論、回答トークンの価格から計算され、タスク数で割られ、インテリジェンスインデックスの重み付けがされます。Artificial AnalysisインテリジェンスインデックスArtificial Analysisインテリジェンスインデックスv4.1.1には以下が含まれます:GDPval-AA v2、𝜏³-Banking、Terminal-Bench v2.1、SciCode、Humanity's Last Exam、GPQA Diamond、CritPt、AA-Omniscience、AA-LCR。各評価の詳細と実行方法については、インテリジェンスインデックスの方法論を参照してください。フロンティア言語モデルの知能、経時変化Artificial Analysisインテリジェンスインデックスv4.1.1には9つの評価が含まれています:GDPval-AA v2、𝜏³-Banking、Terminal-Bench v2.1、SciCode、Humanity's Last Exam、GPQA Diamond、CritPt、AA-Omniscience、AA-LCR57モデル中14件NEWAnthropicOpenAIKimiAlibabaMetaSpaceXAIZ AIDeepSeekGoogleMiniMaxXiaomiThinking MachinesMistralCohereArtificial AnalysisインテリジェンスインデックスArtificial Analysisインテリジェンスインデックスv4.1.1には以下が含まれます:GDPval-AA v2、𝜏³-Banking、Terminal-Bench v2.1、SciCode、Humanity's Last Exam、GPQA Diamond、CritPt、AA-Omniscience、AA-LCR。各評価の詳細と実行方法については、インテリジェンスインデックスの方法論を参照してください。コーディングエージェントインデックスエンドツーエンドのソフトウェアエンジニアリングタスクにおける主要コーディングエージェントのパフォーマンス、コスト、実行時間インデックスコスト実行時間Artificial AnalysisコーディングエージェントインデックスDeepSWE、Terminal-Bench v2、SWE-Atlas-QnAの複合平均pass@1・高いほど良い色でモデルエージェント52モデル中15件NEW画像&ビデオ画像アリーナとビデオアリーナのリーダーボードからのトップモデル、95%信頼区間付きテキストから画像へ画像編集テキストからビデオへ画像からビデオへビデオ編集テキストから画像へリーダーボードブラインド投票によるEloスコア。完全なリーダーボードはこちらを参照してください。150モデル中15件NEW音声テキスト読み上げアリーナ、音声認識、音声間変換の評価からのトップモデルテキスト読み上げアリーナEloAA-WERインデックス(非ストリーミング)AA-WERストリーミングインデックス(最終文字起こし)音声間変換インデックステキスト読み上げアリーナリーダーボードブラインド投票によるEloスコア。完全なリーダーボードはこちらを参照してください。88モデル中15件NEW品質Eloユーザーからの応答によって決定されるモデルの相対Eloスコア。Artif