HN 日本語サマリー

← 一覧へ戻る
AI・機械学習

Mercury 2.5 LLMが毎秒770トークンを達成

Mercury 2.5 LLM hits 770 tokens per second (artificialanalysis.ai)

25 pointsby Retro_Dev9 コメント

要約

Artificial Analysisによって評価されたMercury 2.5 LLMは、毎秒770トークンという高速な出力速度を記録しました。このモデルは、平均的な知能スコアを持つものの、価格と速度のバランスが取れており、260kトークンのコンテキストウィンドウをサポートしています。

全文翻訳

Artificial AnalysisKInception•プロプライエタリモデル•2026年9月リリースMercury 2.5 知能、パフォーマンス、価格分析比較試してみるAPIプロバイダーベンチマークモデル概要知能更新済み#91 / 17512Artificial Analysis Intelligence Index知能は4ユニット中2ユニット速度#2 / 175770.4出力トークン/秒速度は4ユニット中4ユニットコスト#21 / 175入力 $0.25出力 $0.75キャッシュ割引 90%$0.06Intelligence Indexタスクあたりのコストコストは4ユニット中2ユニット冗長性#14 / 17535M出力トークン(Intelligence Indexより)冗長性は4ユニット中2ユニット比較概要Mercury 2.5は知能は平均以下ですが、類似価格帯の他のモデルと比較すると価格は良好です。また、著しく高速で、かなり簡潔です。このモデルはテキスト入力をサポートし、テキストを出力し、260kトークンのコンテキストウィンドウを持っています。 Mercury 2.5はArtificial Analysis Intelligence Indexで12点を獲得し、比較対象モデル(中央値:13)の中で平均を下回っています。Intelligence Indexの評価では、35Mトークンを生成しましたが、これは中央値の85Mと比較してかなり簡潔です。 Mercury 2.5の価格は、1M入力トークンあたり$0.25(中程度の価格、中央値:$0.25)、1M出力トークンあたり$0.75(中程度の価格、中央値:$0.90)です。平均して、Intelligence IndexでMercury 2.5を評価するためのタスクあたりのコストは$0.06です。 毎秒770トークンという速度で、Mercury 2.5は著しく高速です(109)。 技術仕様 推論: はい このページは、このモデルの推論バージョンを示しています。 推論機能のないバリアントも存在する可能性があります。 入力モダリティ: サポート: テキスト 出力モダリティ: サポート: テキスト コンテキストウィンドウ: 260k 約390 A4ページ(サイズ12のArialフォント) このクラスの175モデル メトリクスは同じクラスのモデルと比較されます。 非推論モデル → 他の非推論モデルとのみ比較 推論モデル → 推論および非推論の両方で比較 オープンウェイトモデル → 同じサイズクラスの他のオープンウェイトモデルとのみ比較:Tiny: ≤4BパラメータSmall: 4B–40BパラメータMedium: 40B–150BパラメータLarge: >150Bパラメータ プロプライエタリモデル → プロプライエタリおよびオープンウェイトモデルを同じ価格帯で比較、混合3:1の入出力価格比を使用: <$0.15 / 1Mトークン $0.15–$1 / 1Mトークン >$1 / 1Mトークン ハイライト 更新済み 知能 Artificial Analysis Intelligence Index · 高いほど良い 速度 出力トークン/秒 · 高いほど良い コスト/タスク Intelligence Indexタスクあたりの加重平均コスト(USD) · 低いほど良い プロンプトオプション 知能 更新済み Artificial Analysis Intelligence Index Artificial Analysis Intelligence Index v4.3.2は、10の評価を含みます: AA-Briefcase v1.1, GDPval-AA v2.1, AutomationBench-AA, Terminal-Bench 4.0, SciCode, Humanity's Last Exam, GDP.pdf, CritPt, AA-Omniscience, AA-LCR v1.1 674モデル中28モデル 特定のプロバイダーからモデルを追加 Artificial Analysis Intelligence Index Artificial Analysis Intelligence Index v4.3.2には、AA-Briefcase v1.1, GDPval-AA v2.1, AutomationBench-AA, Terminal-Bench 4.0, SciCode, Humanity's Last Exam, GDP.pdf, CritPt, AA-Omniscience, AA-LCR v1.1が含まれます。各評価の詳細と実行方法については、Intelligence Indexの方法論を参照してください。 オープンウェイト / プロプライエタリ 推論 / 非推論 テキストのみ / マルチモーダル入力 Artificial Analysis Intelligence Index by Open Weights / Proprietary Artificial Analysis Intelligence Index v4.3.2は、10の評価を含みます: AA-Briefcase v1.1, GDPval-AA v2.1, AutomationBench-AA, Terminal-Bench 4.0, SciCode, Humanity's Last Exam, GDP.pdf, CritPt, AA-Omniscience, AA-LCR v1.1 674モデル中28モデル 特定のプロバイダーからモデルを追加 プロプライエタリ オープンウェイト オープンウェイト(商用利用制限あり) Artificial Analysis Intelligence Index Artificial Analysis Intelligence Index v4.3.2には、AA-Briefcase v1.1, GDPval-AA v2.1, AutomationBench-AA, Terminal-Bench 4.0, SciCode, Humanity's Last Exam, GDP.pdf, CritPt, AA-Omniscience, AA-LCR v1.1が含まれます。各評価の詳細と実行方法については、Intelligence Indexの方法論を参照してください。 オープンウェイト モデルのウェイトが利用可能かどうかを示します。「商用利用制限あり」は、商用利用が条件によって制限されている場合、「非商用」は、ライセンスが商用利用を禁止している場合です。 機能インデックス 特定の機能や業界におけるモデルのパフォーマンスを測定します。 金融・会計 戦略・オペレーション 法律 エンジニアリング 経済学 Artificial Analysis Finance & Accounting Index 7つの評価を含みます: AA-Omniscience, GDPval-AA v2.1, AA-Briefcase v1.1, Humanity's Last Exam, AutomationBench-AA, AA-LCR v1.1, GDP.pdf · 高いほど良い 171モデル中28モデル 特定のプロバイダーからモデルを追加 ベンチマーク 知能評価 Artificial Analysisによって独立して測定された知能評価 · 高いほど良い コーディング エージェント ツール使用 プライベートデータセット ユーザーインタラクション 金融 医療 法律 知能インデックス 長コンテキスト マルチモーダル 指示追従 忠実性 ライティング ビジネス さらに表示 26の評価中18 674モデル中28モデル 特定のプロバイダーからモデルを追加 AA-Briefcase v1.1 更新済み エージェント型知識業務、(Elo-500)/2000 GDPval-AA v2.1 更新済み エージェント型実世界タスク、(Elo-500)/2000 AutomationBench-AA 更新済み エージェント型SaaSワークフロー Terminal-Bench 4.0 新規 エージェント型コーディングとターミナル使用 SciCode コーディング Humanity's Last Exam 推論と知識 GDP.pdf 新規 専門文書推論、全合格 CritPt 審査中 物理学推論 AA-Omniscience Accuracy 知識 AA-Omniscience Non-Hallucination Rate 1 - ハルシネーション率 AA-LCR v1.1 長コンテキスト推論 Harvey LAB-AA 法律エージェント業務、基準合格率 EnterpriseOps-Gym-AA エージェント型ビジネスオペレーション AA-Analyst スプレッドシートとドキュメントの定量的分析 𝜏³-Banking エージェント型ツール使用 ITBench-AA Kubernetesインシデント根本原因分析 MMMU-Pro 視覚推論 MLCR-AA 新規 医療長コンテキスト推論 知能評価の関連性 モデルの知能は一般的にユースケース全体に翻訳されますが、特定の評価は特定のユースケースにより関連性が高い場合があります。 Artificial Analysis Intelligence Index Artificial Analysis Intelligence Index v4.3.2には、AA-Briefcase v1.1, GDPval-AA v2.1, AutomationBench-AA, Terminal-Bench 4.0, SciCode, Humanity's Last Exam, GDP.pdf, CritPt, AA-Omniscience, AA-LCR v1.1が含まれます。各評価の詳細と実行方法については、Intelligence Indexの方法論を参照してください。 AA-Briefcase v1.1 更新済み AA-Briefcase Elo AA-Briefcase Rubric Score (%) Analytical Quality & Presentation Elo AA-Briefcase Elo AA-Briefcase v1.1は、Artificial Analysisによって開発されたエージェント型知識業務ベンチマークです。AA-Briefcase Eloは、ルーブリック合格率、分析品質Elo、プレゼンテーションEloを統合した複合メトリックです · 高いほど良い 192モデル中28モデル 特定のプロバイダーからモデルを追加 AA-Briefcase Elo AA-Briefcase Eloは、分析品質Elo、プレゼンテーションElo、ルーブリック合格率を統合した複合メトリックであり、ルーブリックパフォーマンスは合成ヘッドツーヘッドマッチを通じてEloに変換されます。Eloおよび95%信頼区間は0にクランプされます。 AA-Omniscience AA-Omniscience Index AA-Omniscience Accuracy AA-Omniscience Hallucination Rate AA-Omniscience Index AA-Omniscience Index (高いほど良い) は、知識の信頼性とハルシネーションを測定します。正しい回答を評価し、ハルシネーションを罰し、回答を拒否しても罰はありません。スコアは-100から100の範囲で、0は正しい回答と間違った回答が同数であることを意味し、負のスコアは間違った回答が多いことを意味します。 549モデル中28モデル 特定のプロバイダーからモデルを追加 AA-Omniscience Index AA-Omniscience Index (高いほど良い) は、知識の信頼性とハルシネーションを測定します。正しい回答を評価し、ハルシネーションを罰し、回答を拒否しても罰はありません。スコアは-100から100の範囲で、0は正しい回答と間違った回答が同数であることを意味し、負のスコアは間違った回答が多いことを意味します。 知能インデックスの比較 知能インデックス vs. タスクあたりのコスト 知能インデックス vs. タスクあたりの時間 知能インデックス vs. 出力速度 知能インデックス vs. エンドツーエンド応答時間 知能インデックス vs. Intelligence Indexタスクあたりのコスト