HN 日本語サマリー

← 一覧へ戻る
AI・機械学習

Kimi K3の知能、パフォーマンス、価格分析

Kimi K3 Intelligence, Performance and Price Analysis (artificialanalysis.ai)

8 pointsby theanonymousone0 コメント

要約

Artificial AnalysisによるKimi K3モデルの性能と価格に関する分析記事です。知能、速度、価格、冗長性などの指標で他のモデルと比較し、Kimi K3は知能面で優れているものの、価格が高めで速度は平均以下であると評価されています。また、1Mトークンのコンテキストウィンドウやテキスト・画像入力をサポートする技術仕様も解説されています。

全文翻訳

Kimi K3知能、パフォーマンス、価格分析 Artificial AnalysisKKimi•プロプライエタリモデル•2026年7月リリース Kimi K3 知能、パフォーマンス、価格分析 APIプロバイダーベンチマーク モデル概要 知能 更新済み #4 / 18957 Artificial Analysis Intelligence Index 知能で4ユニット中4ユニットを獲得。 速度 #90 / 18962.0 1秒あたりの出力トークン数 速度で2ユニット中4ユニットを獲得。 価格 #127 / 189 入力 1Mトークンあたり3.00ドル 出力 1Mトークンあたり15.00ドル 価格で3ユニット中4ユニットを獲得。 キャッシュヒット価格 #77 / 189 1Mトークンあたり0.30ドル (-90%) キャッシュヒット価格で3ユニット中4ユニットを獲得。 冗長性 #63 / 189 130M 知能インデックスからの出力トークン数 冗長性で4ユニット中4ユニットを獲得。 比較概要 Kimi K3は知能面で主要なモデルの一つですが、類似価格帯の他のモデルと比較するとやや高価です。また、平均よりも遅く、非常に冗長です。このモデルはテキストと画像入力をサポートし、テキストを出力し、1Mトークンのコンテキストウィンドウを持っています。 Kimi K3はArtificial Analysis Intelligence Indexで57点を獲得し、比較対象モデルの平均30点を大きく上回っています。Intelligence Indexの評価では、130Mトークンを生成しましたが、これは平均63Mと比較して非常に冗長です。 Kimi K3の価格は、1M入力トークンあたり3.00ドル(平均1.75ドルでやや高価)、1M出力トークンあたり15.00ドル(平均8.40ドルでやや高価)です。Intelligence Indexの評価にかかった総費用は2690.80ドルでした。 1秒あたり62トークンという速度は、平均73トークンよりも遅いです。 技術仕様 推論 はい このページは、このモデルの推論バージョンを示しています。 推論機能のないバリアントも存在する可能性があります。 入力モダリティ サポート: テキスト、画像 出力モダリティ サポート: テキスト コンテキストウィンドウ 1M 約1573ページ A4サイズ、12pt Arialフォント このクラスの189モデル メトリクスは同じクラスのモデルと比較されます: 推論機能のないモデル → 他の推論機能のないモデルのみと比較 推論モデル → 推論機能の有無にかかわらず比較 オープンウェイトモデル → 同じサイズクラスの他のオープンウェイトモデルのみと比較: Tiny: ≤4Bパラメータ Small: 4B–40Bパラメータ Medium: 40B–150Bパラメータ Large: >150Bパラメータ プロプライエタリモデル → プロプライエタリおよびオープンウェイトモデルを、入力/出力価格比3:1のブレンドを使用して、同じ価格帯で比較: 1Mトークンあたり0.15ドル未満 1Mトークンあたり0.15ドル~1ドル 1Mトークンあたり1ドル超 ハイライト 更新済み 知能 Artificial Analysis Intelligence Index 更新済み コーディングインデックス エージェンティックインデックス Artificial Analysis Intelligence Index Artificial Analysis Intelligence Index v4.1は、9つの評価を含みます: GDPval-AA v2, 𝜏³-Banking, Terminal-Bench v2.1, SciCode, Humanity's Last Exam, GPQA Diamond, CritPt, AA-Omniscience, AA-LCR 576モデル中27モデル 特定のプロバイダーからモデルを追加 推論モデルは電球アイコンで示されます Artificial Analysis Intelligence Index Artificial Analysis Intelligence Index v4.1には、GDPval-AA v2, 𝜏³-Banking, Terminal-Bench v2.1, SciCode, Humanity's Last Exam, GPQA Diamond, CritPt, AA-Omniscience, AA-LCRが含まれます。 特定のプロバイダーからモデルを追加 プロプライエタリ オープンウェイト オープンウェイト(商用利用制限あり) 推論モデルは電球アイコンで示されます Artificial Analysis Intelligence Index Artificial Analysis Intelligence Index v4.1には、GDPval-AA v2, 𝜏³-Banking, Terminal-Bench v2.1, SciCode, Humanity's Last Exam, GPQA Diamond, CritPt, AA-Omniscience, AA-LCRが含まれます。 特定のプロバイダーからモデルを追加 オープンウェイト モデルのウェイトが利用可能かどうかを示します。「商用利用制限あり」とラベル付けされているモデルは、ウェイトは利用可能ですが、商用利用が制限されています(通常、有料ライセンスの取得が必要です)。 知能の内訳 知能評価 Artificial Analysisによって個別に測定された知能評価 · 高いほど良い 576モデル中27モデル 特定のプロバイダーからモデルを追加 GDPval-AA v2 エージェンティックな実世界のタスク、(Elo-500)/2000 𝜏³-Banking エージェンティックなツール使用 Terminal-Bench v2.1 エージェンティックなコーディングとターミナル使用 SciCode コーディング Humanity's Last Exam 推論と知識 GPQA Diamond 科学的推論 CritPt 物理学の推論 AA-Omniscience Accuracy 知識 AA-Omniscience Non-Hallucination Rate 1 - ハルシネーション率 AA-LCR 長文コンテキスト推論 AA-Briefcase 新規 エージェンティックな知識作業、Elo AutomationBench-AA 新規 エージェンティックなSaaSワークフロー Harvey LAB-AA 新規 法務エージェントワーク、タスク全通過率 EnterpriseOps-Gym-AA 新規 エージェンティックなビジネスオペレーション IFBench 指示追従 APEX-Agents-AA 長期間エージェンティックタスク ITBench-AA Kubernetesインシデントの根本原因分析 MMMU-Pro 視覚的推論 推論モデルは電球アイコンで示されます。 知能評価の関連性 モデルの知能は一般的にユースケース全体に翻訳されますが、特定の評価は特定のユースケースにより関連性が高い場合があります。 Artificial Analysis Intelligence Index Artificial Analysis Intelligence Index v4.1には、GDPval-AA v2, 𝜏³-Banking, Terminal-Bench v2.1, SciCode, Humanity's Last Exam, GPQA Diamond, CritPt, AA-Omniscience, AA-LCRが含まれます。 AA-Briefcase 新規 AA-Briefcase Elo AA-Briefcase Rubric Score (%) Analytical Quality & Presentation Elo AA-Briefcase Elo AA-Briefcase Eloは、ルーブリックの合格率、分析品質Elo、プレゼンテーションEloを統合した複合メトリックです · 高いほど良い 49モデル中17モデル 特定のプロバイダーからモデルを追加 推論モデルは電球アイコンで示されます AA-Briefcase Elo AA-Briefcase Eloは、分析品質Elo、プレゼンテーションElo、ルーブリックの合格率を統合した複合メトリックであり、ルーブリックのパフォーマンスは合成的なヘッドツーヘッドマッチを通じてEloに変換されます。Eloおよび95%信頼区間は0にクランプされます。 AA-Omniscience AA-Omniscience Index AA-Omniscience Accuracy AA-Omniscience Hallucination Rate AA-Omniscience Index AA-Omniscience Index(高いほど良い)は、知識の信頼性とハルシネーションを測定します。正解を報酬とし、ハルシネーションを罰し、回答を拒否してもペナルティはありません。スコアは-100から100の範囲で、0は正解と不正解が同数であることを意味し、負のスコアは不正解が多いことを意味します。 446モデル中27モデル 特定のプロバイダーからモデルを追加 推論モデルは電球アイコンで示されます AA-Omniscience Index AA-Omniscience Index(高いほど良い)は、知識の信頼性とハルシネーションを測定します。正解を報酬とし、ハルシネーションを罰し、回答を拒否してもペナルティはありません。スコアは-100から100の範囲で、0は正解と不正解が同数であることを意味し、負のスコアは不正解が多いことを意味します。 知能対コストの比較 知能対タスクあたりのコスト 知能対時間あたりのタスク 知能対速度 知能対エンドツーエンド応答時間 知能対知能インデックスあたりのコスト Artificial Analysis Intelligence Index · 知能インデックスタスクあたりの加重平均コスト(USD) 576モデル中27モデル 最も魅力的な象限 Kimi Google Anthropic Z AI OpenAI DeepSeek SpaceX AI NVIDIA MiniMax Meta 推論モデルは電球アイコンで示されます。 知能インデックスあたりのコスト 知能インデックスタスクあたりの加重平均コスト。各評価のコストは、入力、キャッシュヒット、キャッシュ書き込み、推論、回答トークンの価格から計算され、