HN 日本語サマリー

← 一覧へ戻る
AI・機械学習

Grok Build 0.1:知能、パフォーマンス、価格分析

Grok Build 0.1: Intelligence, Performance and Price Analysis (artificialanalysis.ai)

13 pointsby himata41136 コメント

要約

Grok Build 0.1 0616は、Artificial Analysisの評価によると、そのクラスのモデルの中で「知能」が非常に高く(Intelligence Index 40)、価格も競争力があります(入力トークン1Mあたり1.00ドル、出力トークン1Mあたり2.00ドル)。平均より高速な処理能力を持つ一方で、非常に冗長な出力が特徴です。このモデルはテキストと画像の入力をサポートし、テキストを出力し、256kトークンのコンテキストウィンドウを備えています。

全文翻訳

Artificial AnalysisxAI・プロプライエタリモデル Grok Build 0.1 0616 知能、パフォーマンス、価格分析 APIプロバイダー ベンチマーク モデル概要 知能 更新済み #27 / 155 Artificial Analysis Intelligence Index 知能は4ユニット中4ユニット。 速度 #53 / 155 93.3 出力トークン/秒 速度は4ユニット中3ユニット。 価格 #4 / 155 入力 $1.00 / 1Mトークン 出力 $2.00 / 1Mトークン 価格は4ユニット中1ユニット。 キャッシュヒット価格 #32 / 155 $0.20 (-80%) USD / 1Mトークン キャッシュヒット価格は4ユニット中2ユニット。 冗長性 #25 / 155 130M Intelligence Indexからの出力トークン 冗長性は4ユニット中4ユニット。 比較概要 Grok Build 0.1 0616は、知能において主要なモデルの一つであり、同価格帯の他のモデルと比較して価格も手頃です。また、平均よりも高速ですが、非常に冗長です。このモデルはテキストと画像の入力をサポートし、テキストを出力し、256kトークンのコンテキストウィンドウを備えています。 Grok Build 0.1 0616はArtificial Analysis Intelligence Indexで40点を獲得し、比較可能なモデルの平均(29)をはるかに上回っています。Intelligence Indexの評価時、130Mトークンを生成しましたが、これは平均の93Mトークンと比較して非常に冗長です。 Grok Build 0.1 0616の価格は、入力トークン1Mあたり$1.00(競争力のある価格、平均:$1.50)および出力トークン1Mあたり$2.00(競争力のある価格、平均:$8.00)です。合計で、Grok Build 0.1 0616をIntelligence Indexで評価するのに$375.01かかりました。 毎秒93トークンという速度は、Grok Build 0.1 0616が平均(86)よりも高速であることを示しています。 技術仕様 推論機能 はい このページは、このモデルの推論バージョンを示しています。 非推論バリアントも存在する可能性があります。 入力モダリティ サポート:テキスト、画像 出力モダリティ サポート:テキスト コンテキストウィンドウ 256k 約384ページのA4サイズ(Arialフォント12ポイント) このクラスの155モデル メトリクスは、同じクラスのモデルと比較されます: 非推論モデル → 他の非推論モデルとのみ比較 推論モデル → 推論モデルと非推論モデルの両方で比較 オープンウェイトモデル → 同じサイズクラスの他のオープンウェイトモデルとのみ比較: Tiny: ≤4Bパラメーター Small: 4B–40Bパラメーター Medium: 40B–150Bパラメーター Large: >150Bパラメーター プロプライエタリモデル → 同じ価格帯のプロプライエタリモデルとオープンウェイトモデルの両方で比較(入力/出力価格比3:1のブレンドを使用): 1Mトークンあたり$0.15未満 1Mトークンあたり$0.15〜$1 1Mトークンあたり$1超 ハイライト 更新済み 知能 Artificial Analysis Intelligence Index・高いほど良い 現在利用不可 速度 出力トークン/秒・高いほど良い 新規 タスクあたりのコスト Intelligence Indexタスクあたりの加重平均コスト(USD)・低いほど良い 現在利用不可 プロンプトオプション 知能 更新済み Artificial Analysis Intelligence Index 更新済み Coding Index Agentic Index Artificial Analysis Intelligence Index Artificial Analysis Intelligence Index v4.1は9つの評価を組み込んでいます:GDPval-AA v2、τ³-Banking、Terminal-Bench v2.1、SciCode、Humanity's Last Exam、GPQA Diamond、CritPt、AA-Omniscience、AA-LCR 541モデル中27モデル 特定のプロバイダーからモデルを追加 現在利用不可 電球アイコンは推論モデルを示します Artificial Analysis Intelligence Index Artificial Analysis Intelligence Index v4.1には以下が含まれます:GDPval-AA v2、τ³-Banking、Terminal-Bench v2.1、SciCode、Humanity's Last Exam、GPQA Diamond、CritPt、AA-Omniscience、AA-LCR。各評価の内訳や実行方法を含む詳細については、Intelligence Indexの方法論を参照してください。 オープンウェイト/プロプライエタリ 推論/非推論 オープンウェイト/プロプライエタリ別 Artificial Analysis Intelligence Index Artificial Analysis Intelligence Index v4.1は9つの評価を組み込んでいます:GDPval-AA v2、τ³-Banking、Terminal-Bench v2.1、SciCode、Humanity's Last Exam、GPQA Diamond、CritPt、AA-Omniscience、AA-LCR 541モデル中27モデル 特定のプロバイダーからモデルを追加 現在利用不可 プロプライエタリ オープンウェイト オープンウェイト(商用利用制限あり) 電球アイコンは推論モデルを示します Artificial Analysis Intelligence Index Artificial Analysis Intelligence Index v4.1には以下が含まれます:GDPval-AA v2、τ³-Banking、Terminal-Bench v2.1、SciCode、Humanity's Last Exam、GPQA Diamond、CritPt、AA-Omniscience、AA-LCR。各評価の内訳や実行方法を含む詳細については、Intelligence Indexの方法論を参照してください。 オープンウェイト モデルのウェイトが利用可能かどうかを示します。商用利用が制限されている場合(通常、有料ライセンスの取得が必要)、モデルは「商用利用制限あり」とラベル付けされます。 知能評価 Artificial Analysisが独自に測定した知能評価・高いほど良い 19評価中15評価 541モデル中27モデル 特定のプロバイダーからモデルを追加 GDPval-AA v2 更新済み エージェントによる実世界作業タスク、(Elo-500)/2000 τ³-Banking 新規 エージェントによるツール使用 Terminal-Bench v2.1 新規 エージェントによるコーディングとターミナル使用 SciCode コーディング Humanity's Last Exam 推論と知識 GPQA Diamond 科学的推論 CritPt 物理学推論 AA-Omniscience Accuracy 知識 AA-Omniscience Non-Hallucination Rate 1 - 幻覚率 AA-LCR 長文コンテキスト推論 AA-Briefcase 新規 エージェントによる知識作業、(Elo-500)/2000 IFBench 指示に従う能力 APEX-Agents-AA 長期間のエージェントタスク ITBench-AA Kubernetesインシデントの根本原因分析 MMMU-Pro 視覚的推論 電球アイコンは推論モデルを示します。 知能評価の関連性 モデルの知能は通常、ユースケース全体に適用されますが、特定の評価は特定のユースケースにより関連性が高い場合があります。 Artificial Analysis Intelligence Index Artificial Analysis Intelligence Index v4.1には以下が含まれます:GDPval-AA v2、τ³-Banking、Terminal-Bench v2.1、SciCode、Humanity's Last Exam、GPQA Diamond、CritPt、AA-Omniscience、AA-LCR。各評価の内訳や実行方法を含む詳細については、Intelligence Indexの方法論を参照してください。 AA-Briefcase 新規 AA-Briefcase Elo AA-Briefcase ルーブリックスコア(%) 分析品質とプレゼンテーションのElo AA-Briefcase Elo AA-Briefcaseは、Artificial Analysisによって開発されたエージェントによる知識作業のベンチマークです。AA-Briefcase Eloは、ルーブリック合格率、分析品質Elo、プレゼンテーションEloを集約した複合メトリックです。ルーブリックのパフォーマンスは、合成された直接対決のマッチを介してEloに変換されます。Eloと95%信頼区間の範囲は0で固定されます。 541モデル中27モデル 特定のプロバイダーからモデルを追加 現在利用不可 電球アイコンは推論モデルを示します AA-Briefcase Elo AA-Briefcase Eloは、分析品質Elo、プレゼンテーションElo、およびルーブリック合格率を集約した複合メトリックで、ルーブリックパフォーマンスは合成された直接対決のマッチを介してEloに変換されます。Eloおよび95%信頼区間の範囲は0で固定されます。 オープン性 オープン性インデックス オープン性インデックスのコンポーネント オープン性と知能 Artificial Analysis Openness Index: スコア オープン性インデックスは、モデルのオープン性を0から100の正規化されたスケールで評価します(高いほどオープン)。 541モデル中27モデル 特定のプロバイダーからモデルを追加 電球アイコンは推論モデルを示します Intelligence Indexの比較 知能とタスクあたりのコスト 新規 知能とタスクあたりの時間 新規 知能と出力速度 知能とエンドツーエンドの応答時間 知能とIntelligence Indexタスクあたりのコスト Artificial Analysis Intelligence Index・Artificial Analysis Intelligence Indexタスクあたりの加重平均コスト(USD) 541モデル中27モデル 最も魅力的な象限 xAI Google Anthropic Z AI OpenAI DeepSeek Kimi NVIDIA MiniMax Alibaba 電球アイコンは推論モデルを示します。 Intelligence Indexタスクあたりのコスト Intelligence Indexタスクあたりの加重平均コスト。各評価のコストは、入力、キャッシュヒット、キャッシュ書き込み、推論、回答トークンの価格から計算され、タスク数で割られ、Intelligence Indexの重みで加重されます。 Artificial Analysis Intelligence Index Artificial Analysis Intelligence Index v4.1には以下が含まれます:GDPval-AA v2、τ³-Banking、Terminal-Bench v2.1、SciCode、Humanity's Last Exam、GPQA Diamond、CritPt、AA-Omniscience、AA-LCR。各評価の内訳や実行方法を含む詳細については、Intelligence Indexの方法論を参照してください。 トークン使用量 更新済み タスクあたりの出力トークン 新規 知能とタスクあたりの出力トークン 新規 Intelligence Indexトークン使用量 知能とトークン使用量 Intelligence Indexタスクあたりの出力トークン