HN 日本語サマリー

← 一覧へ戻る
AI・機械学習

Claude Sonnet 5 – ベンチマーク結果

Claude Sonnet 5 – benchmark results (artificialanalysis.ai)

29 pointsby lucamark14 コメント

要約

Claude Sonnet 5 (Adaptive Reasoning, Max Effort) は、Intelligence Indexで上位の成績を収めているものの、類似価格帯の他のモデルと比較して高価であると評価されています。平均よりも高速ですが、非常に冗長な出力を生成します。このモデルはテキストと画像の入力に対応し、テキストを出力し、1Mトークンのコンテキストウィンドウを持っています。

全文翻訳

Artificial Analysis Anthropic•Proprietary model•Released June 2026 Claude Sonnet 5 (Adaptive Reasoning, Max Effort) 知能、性能、価格分析 APIプロバイダー ベンチマーク モデル概要 知能 更新済み #5 / 157 53 Artificial Analysis Intelligence Index 知能は4ユニット中4。 速度 #53 / 157 90.8 1秒あたりの出力トークン数 速度は4ユニット中3。 価格 #101 / 157 入力 $3.00 1Mトークンあたり 出力 $15.00 1Mトークンあたり 価格は4ユニット中3。 キャッシュ価格 #56 / 157 書き込み $3.75 1Mトークンあたり ヒット $0.30 (-90%) 1Mトークンあたり キャッシュ価格は4ユニット中3。 冗長性 #38 / 157 300M Intelligence Indexからの出力トークン 冗長性は4ユニット中4。 比較概要 Claude Sonnet 5 (Adaptive Reasoning, Max Effort) は、知能において主要なモデルの一つですが、同価格帯の他のモデルと比較するとやや高価です。また、平均より高速ですが、非常に冗長です。このモデルはテキストと画像の入力に対応し、テキストを出力し、1Mトークンのコンテキストウィンドウを持っています。 Claude Sonnet 5 (Adaptive Reasoning, Max Effort) は、Artificial Analysis Intelligence Indexで53点を獲得しており、同等のモデル(平均29点)を大きく上回っています。Intelligence Indexの評価では、平均87Mトークンと比較して非常に冗長な300Mトークンを生成しました。 Claude Sonnet 5 (Adaptive Reasoning, Max Effort) の価格は、入力1Mトークンあたり3.00ドル(やや高価、平均: 1.60ドル)、出力1Mトークンあたり15.00ドル(やや高価、平均: 8.10ドル)です。合計で、Intelligence IndexでClaude Sonnet 5 (Adaptive Reasoning, Max Effort) を評価するのに6015.18ドルかかりました。 1秒あたり91トークンで、Claude Sonnet 5 (Adaptive Reasoning, Max Effort) は平均(74)よりも高速です。 技術仕様 推論 はい このページには、このモデルの推論バージョンが表示されています。 非推論バリアントも存在する可能性があります。 入力モダリティ サポート: テキスト、画像 出力モダリティ サポート: テキスト コンテキストウィンドウ 1M 約1500枚のA4ページ、フォントサイズ12のArial このクラスの157モデル メトリクスは同クラスのモデルと比較されます: 非推論モデル → 他の非推論モデルのみと比較 推論モデル → 推論モデルと非推論モデルの両方と比較 オープンウェイトモデル → 同じサイズクラスの他のオープンウェイトモデルのみと比較: Tiny: ≤4Bパラメーター Small: 4B–40Bパラメーター Medium: 40B–150Bパラメーター Large: >150Bパラメーター プロプライエタリモデル → 同じ価格帯のプロプライエタリモデルとオープンウェイトモデルの両方と比較(3:1の入出力価格比をブレンド): <1Mトークンあたり0.15ドル 1Mトークンあたり0.15ドル~1ドル 1Mトークンあたり1ドル以上 ハイライト 更新済み 知能 Artificial Analysis Intelligence Index · 高い方が良い 現在利用できません 速度 1秒あたりの出力トークン数 · 高い方が良い 新規 タスクあたりのコスト Intelligence Indexタスクあたりの加重平均コスト (USD) · 低い方が良い 現在利用できません プロンプトオプション 知能 更新済み Artificial Analysis Intelligence Index 更新済み コーディングインデックス エージェンティックインデックス Artificial Analysis Intelligence Index Artificial Analysis Intelligence Index v4.1には9つの評価が含まれます: GDPval-AA v2, 𝜏³-Banking, Terminal-Bench v2.1, SciCode, Humanity's Last Exam, GPQA Diamond, CritPt, AA-Omniscience, AA-LCR 549モデル中27モデル 特定のプロバイダーからモデルを追加 現在利用できません 推論モデルは電球アイコンで示されます Artificial Analysis Intelligence Index Artificial Analysis Intelligence Index v4.1には以下が含まれます: GDPval-AA v2, 𝜏³-Banking, Terminal-Bench v2.1, SciCode, Humanity's Last Exam, GPQA Diamond, CritPt, AA-Omniscience, AA-LCR。各評価の内訳や実行方法など、Intelligence Indexの詳しい方法論についてはこちらをご覧ください。 オープンウェイト/プロプライエタリ 推論/非推論 テキストのみ/マルチモーダル入力 Artificial Analysis Intelligence Index (オープンウェイト/プロプライエタリ別) Artificial Analysis Intelligence Index v4.1には9つの評価が含まれます: GDPval-AA v2, 𝜏³-Banking, Terminal-Bench v2.1, SciCode, Humanity's Last Exam, GPQA Diamond, CritPt, AA-Omniscience, AA-LCR 549モデル中27モデル 特定のプロバイダーからモデルを追加 現在利用できません プロプライエタリ オープンウェイト オープンウェイト (商業利用制限あり) 推論モデルは電球アイコンで示されます Artificial Analysis Intelligence Index Artificial Analysis Intelligence Index v4.1には以下が含まれます: GDPval-AA v2, 𝜏³-Banking, Terminal-Bench v2.1, SciCode, Humanity's Last Exam, GPQA Diamond, CritPt, AA-Omniscience, AA-LCR。各評価の内訳や実行方法など、Intelligence Indexの詳しい方法論についてはこちらをご覧ください。 オープンウェイト モデルのウェイトが利用可能かどうかを示します。ウェイトが利用可能であっても商業利用が制限されている場合(通常は有料ライセンスの取得が必要)、モデルは「商業利用制限あり」と表示されます。 知能の内訳 知能評価 Artificial Analysisが独立して測定した知能評価 · 高い方が良い 19評価中15評価 549モデル中27モデル 特定のプロバイダーからモデルを追加 GDPval-AA v2 更新済み エージェンティックな実世界タスク、(Elo-500)/2000 𝜏³-Banking 新規 エージェンティックなツール使用 Terminal-Bench v2.1 新規 エージェンティックなコーディングとターミナル使用 SciCode コーディング Humanity's Last Exam 推論と知識 GPQA Diamond 科学的推論 CritPt 物理推論 AA-Omniscience Accuracy 知識 AA-Omniscience Non-Hallucination Rate 1 - ハルシネーション率 AA-LCR 長文コンテキスト推論 AA-Briefcase 新規 エージェンティックな知識作業、(Elo-500)/2000 IFBench 指示追従 APEX-Agents-AA 長期間のエージェンティックタスク ITBench-AA Kubernetesインシデントの根本原因分析 MMMU-Pro 視覚的推論 推論モデルは電球アイコンで示されます。 知能評価の関連性 モデルの知能は一般的にユースケース全体にわたって通用しますが、特定の評価は特定のユースケースにより関連性が高い場合があります。 Artificial Analysis Intelligence Index Artificial Analysis Intelligence Index v4.1には以下が含まれます: GDPval-AA v2, 𝜏³-Banking, Terminal-Bench v2.1, SciCode, Humanity's Last Exam, GPQA Diamond, CritPt, AA-Omniscience, AA-LCR。各評価の内訳や実行方法など、Intelligence Indexの詳しい方法論についてはこちらをご覧ください。 AA-Briefcase 新規 AA-Briefcase Elo AA-Briefcase ルーブリックスコア (%) 分析品質とプレゼンテーションのElo AA-Briefcase Elo AA-Briefcaseは、Artificial Analysisが開発したエージェンティックな知識作業のベンチマークです。AA-Briefcase Eloは、ルーブリック合格率、分析品質Elo、プレゼンテーションEloを統合した複合指標です。 · 高い方が良い 549モデル中27モデル 特定のプロバイダーからモデルを追加 現在利用できません 推論モデルは電球アイコンで示されます AA-Briefcase Elo AA-Briefcase Eloは、分析品質Elo、プレゼンテーションElo、ルーブリック合格率を統合した複合指標で、ルーブリックのパフォーマンスは合成的な直接対決マッチングを通じてEloに変換されます。Eloと95%信頼区間の下限は0に固定されます。 オープンネス オープンネスインデックス オープンネスインデックスの構成要素 オープンネス vs. 知能 Artificial Analysis Openness Index: スコア オープンネスインデックスは、モデルのオープンネスを0から100の正規化されたスケールで評価します(高いほどオープン) 549モデル中27モデル 特定のプロバイダーからモデルを追加 推論モデルは電球アイコンで示されます 知能インデックスの比較 知能 vs. タスクあたりのコスト 新規 知能 vs. タスクあたりの時間 新規 知能 vs. 出力速度 知能 vs. エンドツーエンドの応答時間 知能 vs. Intelligence Indexタスクあたりのコスト Artificial Analysis Intelligence Index · Artificial Analysis Intelligence Indexタスクあたりの加重平均コスト (USD) 549モデル中27モデル 最も魅力的な象限 Anthropic Google Z AI OpenAI DeepSeek xAI Kimi NVIDIA MiniMax Alibaba 推論モデルは電球アイコンで示されます。 Intelligence Indexタスクあたりのコスト Intelligence Indexタスクあたりの加重平均コスト。各評価のコストは、入力、キャッシュヒット、キャッシュ書き込み、推論、回答トークンの価格から計算され、タスク数で割られ、そのIntelligence Indexの重みで加重されます。 Artificial Analysis Intelligence Index Artificial Analysis Intelligence Index v4.1には以下が含まれます: GDPval-AA v2, 𝜏³-Banking, Terminal-Bench v2.1, SciCode, Humanity's Last Exam, GPQA Diamond, CritPt, AA-Omniscience, AA-LCR。Intelligence Indexの詳しい方法論についてはこちらをご覧ください。