AI・機械学習
Sonnet 5.5
要約
Anthropicは、Claude 5.5ファミリーの第二弾として、Claude Sonnet 5.5を発表しました。このモデルは、Claude Sonnet 5と比較して30%以上高速かつ低コストで動作し、日常的なタスク、バグ修正、ドキュメント作成などで優れた性能を発揮します。特にコーディング能力が大幅に向上しており、Opus 5.5に匹敵する性能をより低コストで実現します。
全文翻訳
Claude Sonnet 5.5の紹介、Claude 5.5ファミリーの第二弾です。Claude Sonnet 5よりも明確にアップグレードされており、30%以上高速に動作し、ほとんどの作業で最大30%コストが削減されます。
Sonnet 5.5は、Claude Opus 5.5を補完する、より高速で低コストなモデルです。Opus 5.5が慎重な判断を必要とする複雑な作業のために構築されているのに対し、Sonnet 5.5は、範囲が明確な日常的なタスク、バグ修正、洗練されたドキュメント、スライド、スプレッドシートの作成に最も強みを発揮します。デザインに対しても鋭い目を持ち合わせています。高ボリュームかつコストに敏感なアプリケーション向けに構築されたClaude Haiku 5.5は、今後数週間でClaude 5.5ファミリーに加わる予定です。
Sonnet 5.5は、Sonnet 5と比較して以下の点で改善されています。
パフォーマンス。Sonnet 5.5は、エージェント型コーディング評価であるTerminal-Bench 4.0で70.6%のスコアを獲得しました。Sonnet 5のスコアは10.3%でした。さまざまな職業における実際の作業をテストするGDPval-AAでは、Opus 5.5より2ポイント下回りました。また、長期間の作業や画像理解にも強く、スクリーンショットのみからPokémon Redをクリアした初のSonnetモデルです。
コラボレーション。Opus 5.5と同様に、Sonnet 5.5は以前の世代のモデルよりも明確に記述します。初期のテスターは、Sonnet 5よりもコラボレーションのパートナーとして優れていると評しました。その速度は、複雑さの低いタスクでの迅速なイテレーションにも適しています。
コスト。Sonnet 5.5は、Sonnet 5と同じ価格設定です。入力トークン100万件あたり2ドル、出力トークン100万件あたり10ドル、キャッシュ読み取り100万件あたり0.20ドルですが、通常、同じ作業を行うために必要なトークン数ははるかに少なくなります。当社のテストでは、前世代と比較してタスクあたりのコストが最大30%削減されました。
速度。Sonnet 5.5は、Sonnet 5よりも30%以上高速に出力を生成するため、これまでのSonnetモデルの中で最速です。
アライメントと安全性。自動化された行動監査において、Sonnet 5.5は、アライメントのほとんどの指標でSonnet 5を改善または同等でした。サイバーセキュリティ機能はOpus 5と同等であるため、最も高性能なモデル向けに開発したサイバーセキュリティ対策とフォールバック機能を搭載してリリースされる初のSonnetモデルです。生物学に関する安全性はSonnet 5と同じです。どちらの安全性対策も、ハイリスクな要求の狭い範囲を対象としており、通常のソフトウェア開発やほとんどのライフサイエンスの作業には影響しません。
パフォーマンス
Sonnet 5.5は、いくつかのドメインでSonnet 5を改善しており、場合によっては劇的に改善しています。いくつかの評価では、Sonnet 5.5(Max effort)はOpus 5.5と同等のパフォーマンスを発揮することさえあります。しかし、ベンチマークスコアはモデルの能力の一側面しか捉えていません。当社のテストおよび外部テスターのテストでは、Opus 5.5は、持続的な判断を必要とする複雑でオープンエンドな作業において、依然として明らかに強力です。
Sonnet 5.5
Sonnet 5
Opus 5.5
GPT-6 Sol
エージェント型コーディング
Terminal-Bench 4.0
エージェント型コーディング
Terminal-Bench 4.0
70.6%
10.3%
66.4%¹
—
エージェント型コーディング
FrontierCode 1.1 (Main)
エージェント型コーディング
FrontierCode 1.1 (Main)
46.2%
Max²
42.4%
54.4%
49.3%
52.1%
Xhigh
エージェント型コーディング
CursorBench 4.0
エージェント型コーディング
CursorBench 4.0
55.5%
34.1%
57.8%
—
知識ワーク
GDPval-AA v2.1³
知識ワーク
GDPval-AA v2.1³
1844
1449
1846
1487⁴
知識ワーク
AA-Briefcase v1.1³
知識ワーク
AA-Briefcase v1.1³
1811
1359
1822
1483⁴
学際的推論
Humanity’s Last Exam
学際的推論
Humanity’s Last Exam
64.5%
with tools
54.9%
with tools
67.7%
with tools
—
コンピューター操作
OSWorld 2.1
コンピューター操作
OSWorld 2.1
80.1%
partial
57.0%
partial
81.8%
partial
—
ビジュアルチャート認識
Chartography
ビジュアルチャート認識
Chartography
61.6%
no tools
15.6%
no tools
64.4%
no tools
53.6%⁴
no tools
評価の実行方法の詳細については、Sonnet 5.5システムカードを参照してください。
以下のチャートは、各努力レベルにおけるモデルのスコアとタスクあたりのコストをプロットしたものです。努力レベルが上がるにつれて、モデルは通常より長く作業するため、タスクあたりのコストは高くなりますが、一般的にスコアも高くなります。チャートの左上隅に近いほど、1ドルあたりの能力が高くなります。
いくつかのベンチマークでは、Sonnet 5.5(LowまたはMedium effort)は、タスクあたりのコストの10分の1程度でSonnet 5の最高スコアを上回っています。Opus 5.5を最もよく補完するのは、タスクあたりのコストが低い低努力設定で実行する場合です。高設定では、同等のコストで同等のパフォーマンスを発揮できます。
エージェント型ターミナルコーディング
エージェント型コーディング: FrontierCode
エージェント型コーディング: CursorBench
知識ワーク: AA-Briefcase
エージェント型ターミナルコーディング
エージェント型コーディング: FrontierCode
エージェント型コーディング: CursorBench
知識ワーク: AA-Briefcase
Terminal-Bench 4.0
精度 vs. コスト
Sonnet 5.5
Opus 5.5
Sonnet 5
GPT-5.6 Sol
0
10
20
30
40
50
60
70
スコア (%)
12510
コスト/試行 (USD, 対数スケール)
Low
Med
High
Xhigh
Max
Terminal-Bench 4.0は、コマンドラインインターフェース内で、モデルが複雑な複数ステップのプロフェッショナルタスクをどの程度完了できるかを測定します。ClaudeアプリのデフォルトであるMedium effortでは、Sonnet 5.5は、タスクあたりのコストの10分の1未満で、Sonnet 5の最高スコアをはるかに上回ります。
Terminal-BenchとOpenAIはGPT-6 Solのパフォーマンスを公表していないため、ここではGPT-5.6 Solのパフォーマンスを報告します。
FrontierCode v1.1, main set
精度 vs. コスト
Sonnet 5.5
Opus 5.5
Sonnet 5
GPT-6 Sol
30
35
40
45
50
55
0
スコア (%)
0.25
0.50
1
2
5
10
20
タスクあたりのコスト (USD, 対数スケール)
Low
Med
High
Xhigh
Max
FrontierCodeは、エージェントのコード変更がマージされるかどうかを測定します。Claude PlatformのデフォルトであるHigh effortでは、Sonnet 5.5は、タスクあたりのコストの5分の1程度でGPT-6 Solの最高スコアに匹敵します。²
CursorBench 4.0
精度 vs. コスト
Sonnet 5.5
Opus 5.5
Sonnet 5
GPT-5.6 Sol
20
30
40
50
60
0
スコア (%)
0.50
1
2
5
10
タスクあたりのコスト (USD, 対数スケール)
Low
Med
High
Xhigh
Max
CursorBenchは、実際のCursorセッションから取られた曖昧な複数ファイルタスクでコーディングエージェントを評価します。Low effortのSonnet 5.5は、タスクあたりのコストの10分の1未満でSonnet 5の最高スコアを上回ります。
CursorBench 4.0はGPT-6 Solのパフォーマンスを公表していないため、ここではGPT-5.6 Solのパフォーマンスを報告します。
AA-Briefcase v1.1
精度 vs. コスト
Sonnet 5.5
Opus 5.5
Sonnet 5
GPT-6 Sol
900
1100
1300
1500
1700
1900
0
Elo
0.10
0.20
0.50
1
2
5
10
20
タスクあたりのコスト (USD, 対数スケール)
Low
Med
High
Xhigh
Max
AA-Briefcase、長期間の知識ワークの新しいベンチマークでは、Medium effortのSonnet 5.5は、タスクあたりのコストの9分の1程度でSonnet 5の最高スコアを上回っています。³
コーディング
Sonnet 5.5のパフォーマンスの向上は、特にコーディングにおいて顕著です。FrontierCodeのHigh effortでは、Sonnet 5と同じ設定で10ポイント高く、タスクあたりのコストは約15分の1です。実際のCursorコーディングセッションからのタスクでモデルをテストするCursorBenchでは、その最高スコアはOpus 5.5の約2ポイント以内です。
初期テスターは、Sonnet 5.5がコードベースをどれだけ迅速に理解できるかを高く評価しました。また、その効率性にも驚かされました。直接比較テストでは、Sonnet 5よりも多くのツール呼び出しをまとめてバッチ処理したため、ステップ数が少なくなり、コストも削減されました。
Epic Games
EveryCode
RabbitSpaceXAI
Base44
UnityCreator
Epic Games
EveryCode
RabbitSpaceXAI
Base44
UnityCreator
引用
「Epicの初期テストでは、Claude Sonnet 5.5は上位モデルに期待される品質基準を満たし、システム設計監査とデータフローレビューでその能力を発揮しました。新しいモデルは、ゲームシステムアーキテクチャのために数万行のコードを処理し、応答を迅速に保ち、数時間にわたるタスクを処理し、あまり指示的でないプロンプトで成果を上げました。」
会社
Epic Games
著者
Daniel Vogel, Chief Operating Officer
引用
「Claude Sonnet 5.5は素晴らしいです。コーディングが速く、イテレーションワークフローで迅速に指示できます。しかし、必要であれば長時間作業することもできます。Opus 5.5の自然なライティングのアップグレードの一部を備えており、より楽しく作業できます。」
会社
Every
著者
Tyler Nishida, Designer
引用
「Claude Sonnet 5.5は、複雑さの異なるレベルでSonnet 5よりも優れた判断力を示し、出力トークンを大幅に少なく消費します。Sonnet 5がWeb検索に頼りすぎる傾向と高いトークン使用量は、この新しいモデルでは両方ともなくなりました。簡単なレビューと中程度のレビューを移行する予定で、今後数週間でさらに移行します。」
会社
CodeRabbit
著者
David Loker, VP of AI
引用
「Claude Sonnet 5.5は、CursorBench 4.0で55.5%という最先端レベルのパフォーマンスを発揮し、Opus 5.5に次ぐものです。パフォーマンスとコストのバランスを取りたい開発者にとって、ヒットすると考えています。」
会社
SpaceXAI
著者
Sualeh Asif, Director of ML
引用
「118件の実際のアプリビルド全体で、Claude Sonnet 5.5はOpusと同等のスコアのアプリを生成しました。