AI・機械学習
Mercury 2.5 LLMが毎秒770トークンを達成
Mercury 2.5 LLM hits 770 tokens per second (artificialanalysis.ai)
要約
Artificial Analysisによって評価されたMercury 2.5 LLMは、毎秒770トークンという高速な出力速度を記録しました。このモデルは、平均的な知能スコアを持つものの、価格と速度のバランスが取れており、260kトークンのコンテキストウィンドウをサポートしています。
全文翻訳
Artificial AnalysisKInception•プロプライエタリモデル•2026年9月リリースMercury 2.5 知能、パフォーマンス、価格分析比較試してみるAPIプロバイダーベンチマークモデル概要知能更新済み#91 / 17512Artificial Analysis Intelligence Index知能は4ユニット中2ユニット速度#2 / 175770.4出力トークン/秒速度は4ユニット中4ユニットコスト#21 / 175入力 $0.25出力 $0.75キャッシュ割引 90%$0.06Intelligence Indexタスクあたりのコストコストは4ユニット中2ユニット冗長性#14 / 17535M出力トークン(Intelligence Indexより)冗長性は4ユニット中2ユニット比較概要Mercury 2.5は知能は平均以下ですが、類似価格帯の他のモデルと比較すると価格は良好です。また、著しく高速で、かなり簡潔です。このモデルはテキスト入力をサポートし、テキストを出力し、260kトークンのコンテキストウィンドウを持っています。
Mercury 2.5はArtificial Analysis Intelligence Indexで12点を獲得し、比較対象モデル(中央値:13)の中で平均を下回っています。Intelligence Indexの評価では、35Mトークンを生成しましたが、これは中央値の85Mと比較してかなり簡潔です。
Mercury 2.5の価格は、1M入力トークンあたり$0.25(中程度の価格、中央値:$0.25)、1M出力トークンあたり$0.75(中程度の価格、中央値:$0.90)です。平均して、Intelligence IndexでMercury 2.5を評価するためのタスクあたりのコストは$0.06です。
毎秒770トークンという速度で、Mercury 2.5は著しく高速です(109)。
技術仕様
推論: はい
このページは、このモデルの推論バージョンを示しています。
推論機能のないバリアントも存在する可能性があります。
入力モダリティ: サポート: テキスト
出力モダリティ: サポート: テキスト
コンテキストウィンドウ: 260k
約390 A4ページ(サイズ12のArialフォント)
このクラスの175モデル
メトリクスは同じクラスのモデルと比較されます。
非推論モデル → 他の非推論モデルとのみ比較
推論モデル → 推論および非推論の両方で比較
オープンウェイトモデル → 同じサイズクラスの他のオープンウェイトモデルとのみ比較:Tiny: ≤4BパラメータSmall: 4B–40BパラメータMedium: 40B–150BパラメータLarge: >150Bパラメータ
プロプライエタリモデル → プロプライエタリおよびオープンウェイトモデルを同じ価格帯で比較、混合3:1の入出力価格比を使用:
<$0.15 / 1Mトークン
$0.15–$1 / 1Mトークン
>$1 / 1Mトークン
ハイライト
更新済み
知能
Artificial Analysis Intelligence Index · 高いほど良い
速度
出力トークン/秒 · 高いほど良い
コスト/タスク
Intelligence Indexタスクあたりの加重平均コスト(USD) · 低いほど良い
プロンプトオプション
知能
更新済み
Artificial Analysis Intelligence Index
Artificial Analysis Intelligence Index v4.3.2は、10の評価を含みます: AA-Briefcase v1.1, GDPval-AA v2.1, AutomationBench-AA, Terminal-Bench 4.0, SciCode, Humanity's Last Exam, GDP.pdf, CritPt, AA-Omniscience, AA-LCR v1.1
674モデル中28モデル
特定のプロバイダーからモデルを追加
Artificial Analysis Intelligence Index
Artificial Analysis Intelligence Index v4.3.2には、AA-Briefcase v1.1, GDPval-AA v2.1, AutomationBench-AA, Terminal-Bench 4.0, SciCode, Humanity's Last Exam, GDP.pdf, CritPt, AA-Omniscience, AA-LCR v1.1が含まれます。各評価の詳細と実行方法については、Intelligence Indexの方法論を参照してください。
オープンウェイト / プロプライエタリ
推論 / 非推論
テキストのみ / マルチモーダル入力
Artificial Analysis Intelligence Index by Open Weights / Proprietary
Artificial Analysis Intelligence Index v4.3.2は、10の評価を含みます: AA-Briefcase v1.1, GDPval-AA v2.1, AutomationBench-AA, Terminal-Bench 4.0, SciCode, Humanity's Last Exam, GDP.pdf, CritPt, AA-Omniscience, AA-LCR v1.1
674モデル中28モデル
特定のプロバイダーからモデルを追加
プロプライエタリ
オープンウェイト
オープンウェイト(商用利用制限あり)
Artificial Analysis Intelligence Index
Artificial Analysis Intelligence Index v4.3.2には、AA-Briefcase v1.1, GDPval-AA v2.1, AutomationBench-AA, Terminal-Bench 4.0, SciCode, Humanity's Last Exam, GDP.pdf, CritPt, AA-Omniscience, AA-LCR v1.1が含まれます。各評価の詳細と実行方法については、Intelligence Indexの方法論を参照してください。
オープンウェイト
モデルのウェイトが利用可能かどうかを示します。「商用利用制限あり」は、商用利用が条件によって制限されている場合、「非商用」は、ライセンスが商用利用を禁止している場合です。
機能インデックス
特定の機能や業界におけるモデルのパフォーマンスを測定します。
金融・会計
戦略・オペレーション
法律
エンジニアリング
経済学
Artificial Analysis Finance & Accounting Index
7つの評価を含みます: AA-Omniscience, GDPval-AA v2.1, AA-Briefcase v1.1, Humanity's Last Exam, AutomationBench-AA, AA-LCR v1.1, GDP.pdf · 高いほど良い
171モデル中28モデル
特定のプロバイダーからモデルを追加
ベンチマーク
知能評価
Artificial Analysisによって独立して測定された知能評価 · 高いほど良い
コーディング
エージェント
ツール使用
プライベートデータセット
ユーザーインタラクション
金融
医療
法律
知能インデックス
長コンテキスト
マルチモーダル
指示追従
忠実性
ライティング
ビジネス
さらに表示
26の評価中18
674モデル中28モデル
特定のプロバイダーからモデルを追加
AA-Briefcase v1.1
更新済み
エージェント型知識業務、(Elo-500)/2000
GDPval-AA v2.1
更新済み
エージェント型実世界タスク、(Elo-500)/2000
AutomationBench-AA
更新済み
エージェント型SaaSワークフロー
Terminal-Bench 4.0
新規
エージェント型コーディングとターミナル使用
SciCode
コーディング
Humanity's Last Exam
推論と知識
GDP.pdf
新規
専門文書推論、全合格
CritPt
審査中
物理学推論
AA-Omniscience Accuracy
知識
AA-Omniscience Non-Hallucination Rate
1 - ハルシネーション率
AA-LCR v1.1
長コンテキスト推論
Harvey LAB-AA
法律エージェント業務、基準合格率
EnterpriseOps-Gym-AA
エージェント型ビジネスオペレーション
AA-Analyst
スプレッドシートとドキュメントの定量的分析
𝜏³-Banking
エージェント型ツール使用
ITBench-AA
Kubernetesインシデント根本原因分析
MMMU-Pro
視覚推論
MLCR-AA
新規
医療長コンテキスト推論
知能評価の関連性
モデルの知能は一般的にユースケース全体に翻訳されますが、特定の評価は特定のユースケースにより関連性が高い場合があります。
Artificial Analysis Intelligence Index
Artificial Analysis Intelligence Index v4.3.2には、AA-Briefcase v1.1, GDPval-AA v2.1, AutomationBench-AA, Terminal-Bench 4.0, SciCode, Humanity's Last Exam, GDP.pdf, CritPt, AA-Omniscience, AA-LCR v1.1が含まれます。各評価の詳細と実行方法については、Intelligence Indexの方法論を参照してください。
AA-Briefcase v1.1
更新済み
AA-Briefcase Elo
AA-Briefcase Rubric Score (%)
Analytical Quality & Presentation Elo
AA-Briefcase Elo
AA-Briefcase v1.1は、Artificial Analysisによって開発されたエージェント型知識業務ベンチマークです。AA-Briefcase Eloは、ルーブリック合格率、分析品質Elo、プレゼンテーションEloを統合した複合メトリックです · 高いほど良い
192モデル中28モデル
特定のプロバイダーからモデルを追加
AA-Briefcase Elo
AA-Briefcase Eloは、分析品質Elo、プレゼンテーションElo、ルーブリック合格率を統合した複合メトリックであり、ルーブリックパフォーマンスは合成ヘッドツーヘッドマッチを通じてEloに変換されます。Eloおよび95%信頼区間は0にクランプされます。
AA-Omniscience
AA-Omniscience Index
AA-Omniscience Accuracy
AA-Omniscience Hallucination Rate
AA-Omniscience Index
AA-Omniscience Index (高いほど良い) は、知識の信頼性とハルシネーションを測定します。正しい回答を評価し、ハルシネーションを罰し、回答を拒否しても罰はありません。スコアは-100から100の範囲で、0は正しい回答と間違った回答が同数であることを意味し、負のスコアは間違った回答が多いことを意味します。
549モデル中28モデル
特定のプロバイダーからモデルを追加
AA-Omniscience Index
AA-Omniscience Index (高いほど良い) は、知識の信頼性とハルシネーションを測定します。正しい回答を評価し、ハルシネーションを罰し、回答を拒否しても罰はありません。スコアは-100から100の範囲で、0は正しい回答と間違った回答が同数であることを意味し、負のスコアは間違った回答が多いことを意味します。
知能インデックスの比較
知能インデックス vs. タスクあたりのコスト
知能インデックス vs. タスクあたりの時間
知能インデックス vs. 出力速度
知能インデックス vs. エンドツーエンド応答時間
知能インデックス vs. Intelligence Indexタスクあたりのコスト