HN 日本語サマリー

← 一覧へ戻る
AI・機械学習

MiMo-v2.6-Pro: 知能、パフォーマンス、価格分析

MiMo-v2.6-Pro: Intelligence, Performance and Price Analysis (artificialanalysis.ai)

13 pointsby theanonymousone3 コメント

要約

MiMo-v2.6-Proは、オープンウェイトモデルの中で知能と価格のバランスに優れたモデルです。テキスト、画像、音声、ビデオ入力をサポートし、1Mトークンのコンテキストウィンドウを持ちます。知能指数では11446モデル中1位、速度でも11412モデル中12位と高いパフォーマンスを示しますが、やや冗長な出力傾向があります。価格は比較的高めですが、その性能を考慮すると妥当な範囲と評価されています。

全文翻訳

MiMo-V2.6-Proは、知能とパフォーマンスにおいて、同サイズの他のオープンウェイトモデルと比較して、非常に優れたモデルです。また、著しく高速ですが、やや冗長な傾向があります。このモデルは、テキスト、画像、音声、ビデオ入力をサポートし、テキストを出力し、1Mトークンのコンテキストウィンドウを備えています。 MiMo-V2.6-Proは、Artificial Analysis Intelligence Indexで46点を獲得し、比較対象モデル(中央値:18)の中で平均を大きく上回っています。Intelligence Indexの評価では、140Mトークンを生成しましたが、これは中央値の140Mと比較してやや冗長です。 MiMo-V2.6-Proの価格は、1M入力トークンあたり0.43ドル(やや高価、中央値:0.30ドル)、1M出力トークンあたり0.87ドル(中程度、中央値:1.13ドル)です。Intelligence Indexの評価にかかった総費用は206.66ドルでした。 125トークン/秒という速度は、著しく高速です(中央値:75)。 技術仕様 理由付け:はい このページは、このモデルの理由付けバージョンを示しています。理由付けを行わないバリアントも存在する可能性があります。 入力モダリティ:サポート:テキスト、画像、音声、ビデオ 出力モダリティ:サポート:テキスト コンテキストウィンドウ:1M(約1500ページ、A4サイズ、Arialフォント12ポイント) 総パラメータ数:1.0T アクティブパラメータ数:42B 推論中にトークンあたりアクティブなパラメータ数: ライセンス:MIT モデルウェイト:Hugging Face このクラスの114モデル メトリクスは、同じクラスのモデルと比較されます。 理由付けを行わないモデル → 理由付けを行わないモデルのみと比較 理由付けモデル → 理由付けモデルと理由付けを行わないモデルの両方で比較 オープンウェイトモデル → 同じサイズクラスの他のオープンウェイトモデルのみと比較: Tiny:≤4Bパラメータ Small:4B–40Bパラメータ Medium:40B–150Bパラメータ Large:>150Bパラメータ プロプライエタリモデル → プロプライエタリモデルとオープンウェイトモデルを同じ価格帯で比較、混合3:1入力/出力価格比を使用: <0.15ドル/1Mトークン 0.15ドル–1ドル/1Mトークン >1ドル/1Mトークン ハイライト 更新済み 知能 Artificial Analysis Intelligence Index · 高いほど良い 速度 出力トークン/秒 · 高いほど良い コスト タスクあたりのコスト(USD)の加重平均 · 低いほど良い プロンプトオプション 知能 更新済み Artificial Analysis Intelligence Index Artificial Analysis Intelligence Index v4.3.2は、10の評価を含みます:AA-Briefcase v1.1、GDPval-AA v2.1、AutomationBench-AA、Terminal-Bench 4.0、SciCode、Humanity's Last Exam、GDP.pdf、CritPt、AA-Omniscience、AA-LCR v1.1 28/656モデル 特定のプロバイダーからモデルを追加 Artificial Analysis Intelligence Index Artificial Analysis Intelligence Index v4.3.2には、AA-Briefcase v1.1、GDPval-AA v2.1、AutomationBench-AA、Terminal-Bench 4.0、SciCode、Humanity's Last Exam、GDP.pdf、CritPt、AA-Omniscience、AA-LCR v1.1が含まれます。各評価の詳細と実行方法については、Intelligence Indexの方法論を参照してください。 オープンウェイト / プロプライエタリ 理由付け / 理由付けを行わない テキストのみ / マルチモーダル入力 Artificial Analysis Intelligence Index by Open Weights / Proprietary Artificial Analysis Intelligence Index v4.3.2は、10の評価を含みます:AA-Briefcase v1.1、GDPval-AA v2.1、AutomationBench-AA、Terminal-Bench 4.0、SciCode、Humanity's Last Exam、GDP.pdf、CritPt、AA-Omniscience、AA-LCR v1.1 28/656モデル 特定のプロバイダーからモデルを追加 プロプライエタリ オープンウェイト オープンウェイト(商用利用制限あり) Artificial Analysis Intelligence Index Artificial Analysis Intelligence Index v4.3.2には、AA-Briefcase v1.1、GDPval-AA v2.1、AutomationBench-AA、Terminal-Bench 4.0、SciCode、Humanity's Last Exam、GDP.pdf、CritPt、AA-Omniscience、AA-LCR v1.1が含まれます。各評価の詳細と実行方法については、Intelligence Indexの方法論を参照してください。 オープンウェイト モデルウェイトが利用可能かどうかを示します。「商用利用制限あり」とラベル付けされているモデルは、商用利用が条件によって制限されており、「非商用」とラベル付けされているモデルは、ライセンスが商用利用を禁止しています。 キャパビリティインデックス 特定の能力と業界におけるモデルのパフォーマンスを測定します。 金融・会計 戦略・オペレーション 法務 エンジニアリング 経済学 Artificial Analysis Finance & Accounting Index 7つの評価を含みます:AA-Omniscience、GDPval-AA v2.1、AA-Briefcase v1.1、Humanity's Last Exam、AutomationBench-AA、AA-LCR v1.1、GDP.pdf · 高いほど良い 28/153モデル 特定のプロバイダーからモデルを追加 ベンチマーク 知能評価 Artificial Analysisによって独立して測定された知能評価 · 高いほど良い コーディング エージェント ツール使用 プライベートデータセット ユーザーインタラクション 金融 医療 法務 知能指数 長コンテキスト マルチモーダル 指示追従 忠実性 ライティング ビジネス その他 18/26評価 28/656モデル 特定のプロバイダーからモデルを追加 AA-Briefcase v1.1 更新済み エージェント知識ワーク(Elo-500)/2000 GDPval-AA v2.1 更新済み エージェント実世界タスク(Elo-500)/2000 AutomationBench-AA 更新済み エージェントSaaSワークフロー Terminal-Bench 4.0 新規 エージェントコーディングとターミナル使用 SciCode コーディング Humanity's Last Exam 推論と知識 GDP.pdf 新規 専門文書推論、全合格 CritPt 物理学推論 AA-Omniscience 精度 AA-Omniscience 非ハルシネーション率 AA-LCR v1.1 長コンテキスト推論 Harvey LAB-AA 法務エージェントワーク、基準合格率 EnterpriseOps-Gym-AA エージェントビジネスオペレーション AA-Analyst 表計算ソフトとドキュメントの定量的分析 𝜏³-Banking エージェントツール使用 ITBench-AA Kubernetesインシデント根本原因分析 MMMU-Pro 視覚推論 MLCR-AA 新規 医療長コンテキスト推論 知能評価の関連性 モデルの知能は一般的にユースケース全体に翻訳されますが、特定の評価は特定のユースケースにより関連性が高い場合があります。 Artificial Analysis Intelligence Index Artificial Analysis Intelligence Index v4.3.2には、AA-Briefcase v1.1、GDPval-AA v2.1、AutomationBench-AA、Terminal-Bench 4.0、SciCode、Humanity's Last Exam、GDP.pdf、CritPt、AA-Omniscience、AA-LCR v1.1が含まれます。各評価の詳細と実行方法については、Intelligence Indexの方法論を参照してください。 AA-Briefcase v1.1 更新済み AA-Briefcase Elo AA-Briefcase Rubric Score (%) Analytical Quality & Presentation Elo AA-Briefcase Elo AA-Briefcase Eloは、分析品質Elo、プレゼンテーションElo、およびルーブリック合格率を統合した複合メトリックであり、ルーブリックパフォーマンスは合成ヘッドツーヘッドマッチを通じてEloに変換されます。Eloと95%信頼区間は0にクランプされます。 28/174モデル 特定のプロバイダーからモデルを追加 AA-Briefcase Elo AA-Briefcase Eloは、分析品質Elo、プレゼンテーションElo、およびルーブリック合格率を統合した複合メトリックであり、ルーブリックパフォーマンスは合成ヘッドツーヘッドマッチを通じてEloに変換されます。Eloと95%信頼区間は0にクランプされます。 AA-Omniscience AA-Omniscience Index AA-Omniscience Accuracy AA-Omniscience Hallucination Rate AA-Omniscience Index AA-Omniscience Index(高いほど良い)は、知識の信頼性とハルシネーションを測定します。正解を報酬とし、ハルシネーションを罰し、回答を拒否することに罰はありません。スコアは-100から100の範囲で、0は正解と不正解が同数であることを意味し、負のスコアは不正解が多いことを意味します。 28/531モデル 特定のプロバイダーからモデルを追加 AA-Omniscience Index AA-Omniscience Index(高いほど良い)は、知識の信頼性とハルシネーションを測定します。正解を報酬とし、ハルシネーションを罰し、回答を拒否することに罰はありません。スコアは-100から100の範囲で、0は正解と不正解が同数であることを意味し、負のスコアは不正解が多いことを意味します。 Openness Index Openness Ind