AI・機械学習
Claude Sonnet 5 – ベンチマーク結果
Claude Sonnet 5 – benchmark results (artificialanalysis.ai)
要約
Claude Sonnet 5 (Adaptive Reasoning, Max Effort) は、Intelligence Indexで上位の成績を収めているものの、類似価格帯の他のモデルと比較して高価であると評価されています。平均よりも高速ですが、非常に冗長な出力を生成します。このモデルはテキストと画像の入力に対応し、テキストを出力し、1Mトークンのコンテキストウィンドウを持っています。
全文翻訳
Artificial Analysis
Anthropic•Proprietary model•Released June 2026
Claude Sonnet 5 (Adaptive Reasoning, Max Effort) 知能、性能、価格分析
APIプロバイダー ベンチマーク モデル概要
知能
更新済み
#5 / 157
53
Artificial Analysis Intelligence Index
知能は4ユニット中4。
速度
#53 / 157
90.8
1秒あたりの出力トークン数
速度は4ユニット中3。
価格
#101 / 157
入力
$3.00
1Mトークンあたり
出力
$15.00
1Mトークンあたり
価格は4ユニット中3。
キャッシュ価格
#56 / 157
書き込み
$3.75
1Mトークンあたり
ヒット
$0.30 (-90%)
1Mトークンあたり
キャッシュ価格は4ユニット中3。
冗長性
#38 / 157
300M
Intelligence Indexからの出力トークン
冗長性は4ユニット中4。
比較概要
Claude Sonnet 5 (Adaptive Reasoning, Max Effort) は、知能において主要なモデルの一つですが、同価格帯の他のモデルと比較するとやや高価です。また、平均より高速ですが、非常に冗長です。このモデルはテキストと画像の入力に対応し、テキストを出力し、1Mトークンのコンテキストウィンドウを持っています。
Claude Sonnet 5 (Adaptive Reasoning, Max Effort) は、Artificial Analysis Intelligence Indexで53点を獲得しており、同等のモデル(平均29点)を大きく上回っています。Intelligence Indexの評価では、平均87Mトークンと比較して非常に冗長な300Mトークンを生成しました。
Claude Sonnet 5 (Adaptive Reasoning, Max Effort) の価格は、入力1Mトークンあたり3.00ドル(やや高価、平均: 1.60ドル)、出力1Mトークンあたり15.00ドル(やや高価、平均: 8.10ドル)です。合計で、Intelligence IndexでClaude Sonnet 5 (Adaptive Reasoning, Max Effort) を評価するのに6015.18ドルかかりました。
1秒あたり91トークンで、Claude Sonnet 5 (Adaptive Reasoning, Max Effort) は平均(74)よりも高速です。
技術仕様
推論
はい
このページには、このモデルの推論バージョンが表示されています。
非推論バリアントも存在する可能性があります。
入力モダリティ
サポート: テキスト、画像
出力モダリティ
サポート: テキスト
コンテキストウィンドウ
1M
約1500枚のA4ページ、フォントサイズ12のArial
このクラスの157モデル
メトリクスは同クラスのモデルと比較されます:
非推論モデル → 他の非推論モデルのみと比較
推論モデル → 推論モデルと非推論モデルの両方と比較
オープンウェイトモデル → 同じサイズクラスの他のオープンウェイトモデルのみと比較:
Tiny: ≤4Bパラメーター
Small: 4B–40Bパラメーター
Medium: 40B–150Bパラメーター
Large: >150Bパラメーター
プロプライエタリモデル → 同じ価格帯のプロプライエタリモデルとオープンウェイトモデルの両方と比較(3:1の入出力価格比をブレンド):
<1Mトークンあたり0.15ドル
1Mトークンあたり0.15ドル~1ドル
1Mトークンあたり1ドル以上
ハイライト
更新済み
知能
Artificial Analysis Intelligence Index · 高い方が良い
現在利用できません
速度
1秒あたりの出力トークン数 · 高い方が良い
新規
タスクあたりのコスト
Intelligence Indexタスクあたりの加重平均コスト (USD) · 低い方が良い
現在利用できません
プロンプトオプション
知能
更新済み
Artificial Analysis Intelligence Index
更新済み
コーディングインデックス
エージェンティックインデックス
Artificial Analysis Intelligence Index
Artificial Analysis Intelligence Index v4.1には9つの評価が含まれます: GDPval-AA v2, 𝜏³-Banking, Terminal-Bench v2.1, SciCode, Humanity's Last Exam, GPQA Diamond, CritPt, AA-Omniscience, AA-LCR
549モデル中27モデル
特定のプロバイダーからモデルを追加
現在利用できません
推論モデルは電球アイコンで示されます
Artificial Analysis Intelligence Index
Artificial Analysis Intelligence Index v4.1には以下が含まれます: GDPval-AA v2, 𝜏³-Banking, Terminal-Bench v2.1, SciCode, Humanity's Last Exam, GPQA Diamond, CritPt, AA-Omniscience, AA-LCR。各評価の内訳や実行方法など、Intelligence Indexの詳しい方法論についてはこちらをご覧ください。
オープンウェイト/プロプライエタリ
推論/非推論
テキストのみ/マルチモーダル入力
Artificial Analysis Intelligence Index (オープンウェイト/プロプライエタリ別)
Artificial Analysis Intelligence Index v4.1には9つの評価が含まれます: GDPval-AA v2, 𝜏³-Banking, Terminal-Bench v2.1, SciCode, Humanity's Last Exam, GPQA Diamond, CritPt, AA-Omniscience, AA-LCR
549モデル中27モデル
特定のプロバイダーからモデルを追加
現在利用できません
プロプライエタリ
オープンウェイト
オープンウェイト (商業利用制限あり)
推論モデルは電球アイコンで示されます
Artificial Analysis Intelligence Index
Artificial Analysis Intelligence Index v4.1には以下が含まれます: GDPval-AA v2, 𝜏³-Banking, Terminal-Bench v2.1, SciCode, Humanity's Last Exam, GPQA Diamond, CritPt, AA-Omniscience, AA-LCR。各評価の内訳や実行方法など、Intelligence Indexの詳しい方法論についてはこちらをご覧ください。
オープンウェイト
モデルのウェイトが利用可能かどうかを示します。ウェイトが利用可能であっても商業利用が制限されている場合(通常は有料ライセンスの取得が必要)、モデルは「商業利用制限あり」と表示されます。
知能の内訳
知能評価
Artificial Analysisが独立して測定した知能評価 · 高い方が良い
19評価中15評価
549モデル中27モデル
特定のプロバイダーからモデルを追加
GDPval-AA v2
更新済み
エージェンティックな実世界タスク、(Elo-500)/2000
𝜏³-Banking
新規
エージェンティックなツール使用
Terminal-Bench v2.1
新規
エージェンティックなコーディングとターミナル使用
SciCode
コーディング
Humanity's Last Exam
推論と知識
GPQA Diamond
科学的推論
CritPt
物理推論
AA-Omniscience Accuracy
知識
AA-Omniscience Non-Hallucination Rate
1 - ハルシネーション率
AA-LCR
長文コンテキスト推論
AA-Briefcase
新規
エージェンティックな知識作業、(Elo-500)/2000
IFBench
指示追従
APEX-Agents-AA
長期間のエージェンティックタスク
ITBench-AA
Kubernetesインシデントの根本原因分析
MMMU-Pro
視覚的推論
推論モデルは電球アイコンで示されます。
知能評価の関連性
モデルの知能は一般的にユースケース全体にわたって通用しますが、特定の評価は特定のユースケースにより関連性が高い場合があります。
Artificial Analysis Intelligence Index
Artificial Analysis Intelligence Index v4.1には以下が含まれます: GDPval-AA v2, 𝜏³-Banking, Terminal-Bench v2.1, SciCode, Humanity's Last Exam, GPQA Diamond, CritPt, AA-Omniscience, AA-LCR。各評価の内訳や実行方法など、Intelligence Indexの詳しい方法論についてはこちらをご覧ください。
AA-Briefcase
新規
AA-Briefcase Elo
AA-Briefcase ルーブリックスコア (%)
分析品質とプレゼンテーションのElo
AA-Briefcase Elo
AA-Briefcaseは、Artificial Analysisが開発したエージェンティックな知識作業のベンチマークです。AA-Briefcase Eloは、ルーブリック合格率、分析品質Elo、プレゼンテーションEloを統合した複合指標です。 · 高い方が良い
549モデル中27モデル
特定のプロバイダーからモデルを追加
現在利用できません
推論モデルは電球アイコンで示されます
AA-Briefcase Elo
AA-Briefcase Eloは、分析品質Elo、プレゼンテーションElo、ルーブリック合格率を統合した複合指標で、ルーブリックのパフォーマンスは合成的な直接対決マッチングを通じてEloに変換されます。Eloと95%信頼区間の下限は0に固定されます。
オープンネス
オープンネスインデックス
オープンネスインデックスの構成要素
オープンネス vs. 知能
Artificial Analysis Openness Index: スコア
オープンネスインデックスは、モデルのオープンネスを0から100の正規化されたスケールで評価します(高いほどオープン)
549モデル中27モデル
特定のプロバイダーからモデルを追加
推論モデルは電球アイコンで示されます
知能インデックスの比較
知能 vs. タスクあたりのコスト
新規
知能 vs. タスクあたりの時間
新規
知能 vs. 出力速度
知能 vs. エンドツーエンドの応答時間
知能 vs. Intelligence Indexタスクあたりのコスト
Artificial Analysis Intelligence Index · Artificial Analysis Intelligence Indexタスクあたりの加重平均コスト (USD)
549モデル中27モデル
最も魅力的な象限
Anthropic
Google
Z AI
OpenAI
DeepSeek
xAI
Kimi
NVIDIA
MiniMax
Alibaba
推論モデルは電球アイコンで示されます。
Intelligence Indexタスクあたりのコスト
Intelligence Indexタスクあたりの加重平均コスト。各評価のコストは、入力、キャッシュヒット、キャッシュ書き込み、推論、回答トークンの価格から計算され、タスク数で割られ、そのIntelligence Indexの重みで加重されます。
Artificial Analysis Intelligence Index
Artificial Analysis Intelligence Index v4.1には以下が含まれます: GDPval-AA v2, 𝜏³-Banking, Terminal-Bench v2.1, SciCode, Humanity's Last Exam, GPQA Diamond, CritPt, AA-Omniscience, AA-LCR。Intelligence Indexの詳しい方法論についてはこちらをご覧ください。