HN 日本語サマリー

← 一覧へ戻る
AI・機械学習

Grok 4.7 インテリジェンス、パフォーマンス、価格分析

Grok 4.7 Intelligence, Performance and Price Analysis (artificialanalysis.ai)

11 pointsby theanonymousone1 コメント

要約

Grok 4.7 (xhigh) は、Artificial Analysis Intelligence Index で46点を獲得し、比較対象モデルの中では平均を大きく上回るインテリジェンスを示しています。しかし、その処理速度は遅く、出力トークン数も非常に多いという特徴があります。価格は入力トークンあたり$2.00、出力トークンあたり$6.00で、同価格帯のモデルと比較して妥当ですが、インテリジェンス評価タスク全体では$4967.35のコストがかかりました。このモデルは、テキストと画像の入力をサポートし、500kトークンのコンテキストウィンドウを備えています。

全文翻訳

Artificial Analysis KSpaceXAI • Grok 4.7xhigh • プロプライエタリモデル • 2026年9月リリース Grok 4.7 (xhigh) インテリジェンス、パフォーマンス、価格分析 比較 試す API プロバイダー ベンチマーク モデル概要 インテリジェンス 更新済み #16 / 2024 6 Artificial Analysis Intelligence Index インテリジェンスのために4ユニット中4ユニット。 速度 #151 / 2023 9.3 1秒あたりの出力トークン数 速度のために4ユニット中1ユニット。 コスト #75 / 202 イン $2.00 アウト $6.00 キャッシュ割引 75% $3.74 インテリジェンスインデックスタスクあたりのコスト コストのために4ユニット中4ユニット。 冗長性 #84 / 202 240M インテリジェンスインデックスからの出力トークン数 冗長性のために4ユニット中4ユニット。 比較概要 Grok 4.7 (xhigh) は、インテリジェンスにおいて主要なモデルの1つであり、同価格帯の他のモデルと比較して妥当な価格です。また、著しく遅く、非常に冗長でもあります。このモデルは、テキストと画像の入力をサポートし、テキストを出力し、500kトークンのコンテキストウィンドウを持っています。 Grok 4.7 (xhigh) は、Artificial Analysis Intelligence Index で46点を獲得し、比較対象モデル(中央値:24)の中で平均を大きく上回っています。Intelligence Index を評価する際、240Mトークンを生成しましたが、これは中央値の94Mと比較して非常に冗長です。 Grok 4.7 (xhigh) の価格は、1M入力トークンあたり$2.00(中程度の価格、中央値:$2.00)および1M出力トークンあたり$6.00(中程度の価格、中央値:$10.00)です。Intelligence Index で Grok 4.7 (xhigh) を評価するために、合計で$4967.35かかりました。 1秒あたり39トークンで、Grok 4.7 (xhigh) は著しく遅いです(73)。 技術仕様 推論 はい このページは、このモデルの推論バージョンを示しています。推論しないバリアントも存在する可能性があります。 入力モダリティ サポート:テキストと画像 出力モダリティ サポート:テキスト コンテキストウィンドウ 500k 約750枚のA4用紙(12ポイントのArialフォントサイズ) 202モデルがこのクラスに属します メトリクスは同じクラスのモデルと比較されます: 推論しないモデル → 他の推論しないモデルとのみ比較 推論モデル → 推論および推論しないモデル全体で比較 オープンウェイトモデル → 同じサイズクラスの他のオープンウェイトモデルとのみ比較: Tiny:≤4Bパラメータ Small:4B–40Bパラメータ Medium:40B–150Bパラメータ Large:>150Bパラメータ プロプライエタリモデル → プロプライエタリおよびオープンウェイトモデル全体で、ブレンドされた3:1の入力/出力価格比を使用して比較: < $0.15 / 1M トークン $0.15–$1 / 1M トークン >$1 / 1M トークン ハイライト 更新済み インテリジェンス Artificial Analysis Intelligence Index · 高いほど良い 速度 1秒あたりの出力トークン数 · 高いほど良い コスト タスクあたりのコスト(加重平均コスト、USD)/ Intelligence Index タスク · 低いほど良い プロンプトオプション インテリジェンス 更新済み Artificial Analysis Intelligence Index Artificial Analysis Intelligence Index v4.3.2 は10の評価を含みます:AA-Briefcase v1.1、GDPval-AA v2.1、AutomationBench-AA、Terminal-Bench 4.0、SciCode、Humanity's Last Exam、GDP.pdf、CritPt、AA-Omniscience、AA-LCR v1.1 27 / 655 モデル 特定のプロバイダーからモデルを追加 Artificial Analysis Intelligence Index Artificial Analysis Intelligence Index v4.3.2 には以下が含まれます:AA-Briefcase v1.1、GDPval-AA v2.1、AutomationBench-AA、Terminal-Bench 4.0、SciCode、Humanity's Last Exam、GDP.pdf、CritPt、AA-Omniscience、AA-LCR v1.1。各評価の詳細および実行方法については、Intelligence Index methodology を参照してください。 オープンウェイト / プロプライエタリ 推論 / 非推論 テキストのみ / マルチモーダル入力 Artificial Analysis Intelligence Index by Open Weights / Proprietary Artificial Analysis Intelligence Index v4.3.2 は10の評価を含みます:AA-Briefcase v1.1、GDPval-AA v2.1、AutomationBench-AA、Terminal-Bench 4.0、SciCode、Humanity's Last Exam、GDP.pdf、CritPt、AA-Omniscience、AA-LCR v1.1 27 / 655 モデル 特定のプロバイダーからモデルを追加 プロプライエタリ オープンウェイト(商用利用制限あり) オープンウェイト モデルのウェイトが利用可能かどうかを示します。「商用利用制限あり」は、商用利用が条件によって制限されている場合、「非商用」は、ライセンスが商用利用を禁止している場合です。 機能インデックス 特定の機能や業界におけるモデルのパフォーマンスを測定します。 ファイナンス&アカウンティング 戦略&オペレーション 法務 エンジニアリング 経済学 Artificial Analysis Finance & Accounting Index 7つの評価を含みます:AA-Omniscience、GDPval-AA v2.1、AA-Briefcase v1.1、Humanity's Last Exam、AutomationBench-AA、AA-LCR v1.1、GDP.pdf · 高いほど良い 27 / 152 モデル 特定のプロバイダーからモデルを追加 ベンチマーク インテリジェンス評価 Artificial Analysis によって独立して測定されたインテリジェンス評価 · 高いほど良い コーディング エージェンティック ツール使用 プライベートデータセット ユーザーインタラクション ファイナンス 医療 法務 インテリジェンスインデックス ロングコンテキスト マルチモーダル 指示追従 忠実性 ライティング ビジネス その他を見る 18 / 26 評価 27 / 655 モデル 特定のプロバイダーからモデルを追加 AA-Briefcase v1.1 更新済み エージェンティック知識ワーク、(Elo-500)/2000 GDPval-AA v2.1 更新済み エージェンティック実世界タスク、(Elo-500)/2000 AutomationBench-AA 更新済み エージェンティックSaaSワークフロー Terminal-Bench 4.0 新規 エージェンティックコーディング&ターミナル使用 SciCode コーディング Humanity's Last Exam 推論と知識 GDP.pdf 新規 プロフェッショナル文書推論、全合格 CritPt 物理学の推論 AA-Omniscience Accuracy 知識 AA-Omniscience Non-Hallucination Rate 1 - ハルシネーション率 AA-LCR v1.1 ロングコンテキスト推論 Harvey LAB-AA 法務エージェンティックワーク、基準合格率 EnterpriseOps-Gym-AA エージェンティックビジネスオペレーション AA-Analyst スプレッドシートとドキュメントに関する定量的分析 𝜏³-Banking エージェンティックツール使用 ITBench-AA Kubernetesインシデント根本原因分析 MMMU-Pro 視覚的推論 MLCR-AA 新規 医療ロングコンテキスト推論 インテリジェンス評価の関連性 モデルのインテリジェンスは一般的にユースケース全体に翻訳されますが、特定の評価は特定のユースケースにより関連性が高い場合があります。 Artificial Analysis Intelligence Index Artificial Analysis Intelligence Index v4.3.2 には以下が含まれます:AA-Briefcase v1.1、GDPval-AA v2.1、AutomationBench-AA、Terminal-Bench 4.0、SciCode、Humanity's Last Exam、GDP.pdf、CritPt、AA-Omniscience、AA-LCR v1.1。各評価の詳細および実行方法については、Intelligence Index methodology を参照してください。 AA-Briefcase v1.1 更新済み AA-Briefcase Elo AA-Briefcase Rubric Score (%) Analytical Quality & Presentation Elo AA-Briefcase Elo AA-Briefcase v1.1 は、Artificial Analysis によって開発されたエージェンティック知識ワークベンチマークです。AA-Briefcase Elo は、ルーブリック合格率、分析品質 Elo、およびプレゼンテーション Elo を集計した複合メトリックです · 高いほど良い 27 / 173 モデル 特定のプロバイダーからモデルを追加 AA-Briefcase Elo AA-Briefcase Elo は、分析品質 Elo、プレゼンテーション Elo、およびルーブリック合格率を集計した複合メトリックであり、ルーブリックパフォーマンスは合成ヘッドツーヘッドマッチを通じてEloに変換されます。Elo および 95% 信頼区間は 0 にクランプされます。 AA-Omniscience AA-Omniscience Index AA-Omniscience Accuracy AA-Omniscience Hallucination Rate AA-Omniscience Index AA-Omniscience Index(高いほど良い)は、知識の信頼性とハルシネーションを測定します。正解を報酬とし、ハルシネーションを罰し、回答を拒否することにペナルティはありません。スコアは-100から100の範囲で、0は正解と不正解の数が同数であることを意味し、負のスコアは不正解が正解より多いことを意味します。 27 / 530 モデル 特定のプロバイダーからモデルを追加 AA-Omniscience Index AA-Omniscience Index(高いほど良い)は、知識の信頼性とハルシネーションを測定します。正解を報酬とし、ハルシネーションを罰し、回答を拒否することにペナルティはありません。スコアは-100から100の範囲で、0は正解と不正解の数が同数であることを意味し、負のスコアは不正解が正解より多いことを意味します。 インテリジェンスインデックスの比較 インテリジェンスインデックス vs. タスクあたりのコスト インテリジェンスインデックス vs. タスクあたりの時間 インテリジェンスインデックス vs. 出力速度 インテリジェンスインデックス vs. エンドツーエンド応答