HN 日本語サマリー

← 一覧へ戻る
AI・機械学習

Sonnet 5.5

Sonnet 5.5 (anthropic.com)

883 pointsby D2OQZG8l5BI1S06614 コメント

要約

Anthropicは、Claude 5.5ファミリーの第二弾として、Claude Sonnet 5.5を発表しました。このモデルは、Claude Sonnet 5と比較して30%以上高速かつ低コストで動作し、日常的なタスク、バグ修正、ドキュメント作成などで優れた性能を発揮します。特にコーディング能力が大幅に向上しており、Opus 5.5に匹敵する性能をより低コストで実現します。

全文翻訳

Claude Sonnet 5.5の紹介、Claude 5.5ファミリーの第二弾です。Claude Sonnet 5よりも明確にアップグレードされており、30%以上高速に動作し、ほとんどの作業で最大30%コストが削減されます。 Sonnet 5.5は、Claude Opus 5.5を補完する、より高速で低コストなモデルです。Opus 5.5が慎重な判断を必要とする複雑な作業のために構築されているのに対し、Sonnet 5.5は、範囲が明確な日常的なタスク、バグ修正、洗練されたドキュメント、スライド、スプレッドシートの作成に最も強みを発揮します。デザインに対しても鋭い目を持ち合わせています。高ボリュームかつコストに敏感なアプリケーション向けに構築されたClaude Haiku 5.5は、今後数週間でClaude 5.5ファミリーに加わる予定です。 Sonnet 5.5は、Sonnet 5と比較して以下の点で改善されています。 パフォーマンス。Sonnet 5.5は、エージェント型コーディング評価であるTerminal-Bench 4.0で70.6%のスコアを獲得しました。Sonnet 5のスコアは10.3%でした。さまざまな職業における実際の作業をテストするGDPval-AAでは、Opus 5.5より2ポイント下回りました。また、長期間の作業や画像理解にも強く、スクリーンショットのみからPokémon Redをクリアした初のSonnetモデルです。 コラボレーション。Opus 5.5と同様に、Sonnet 5.5は以前の世代のモデルよりも明確に記述します。初期のテスターは、Sonnet 5よりもコラボレーションのパートナーとして優れていると評しました。その速度は、複雑さの低いタスクでの迅速なイテレーションにも適しています。 コスト。Sonnet 5.5は、Sonnet 5と同じ価格設定です。入力トークン100万件あたり2ドル、出力トークン100万件あたり10ドル、キャッシュ読み取り100万件あたり0.20ドルですが、通常、同じ作業を行うために必要なトークン数ははるかに少なくなります。当社のテストでは、前世代と比較してタスクあたりのコストが最大30%削減されました。 速度。Sonnet 5.5は、Sonnet 5よりも30%以上高速に出力を生成するため、これまでのSonnetモデルの中で最速です。 アライメントと安全性。自動化された行動監査において、Sonnet 5.5は、アライメントのほとんどの指標でSonnet 5を改善または同等でした。サイバーセキュリティ機能はOpus 5と同等であるため、最も高性能なモデル向けに開発したサイバーセキュリティ対策とフォールバック機能を搭載してリリースされる初のSonnetモデルです。生物学に関する安全性はSonnet 5と同じです。どちらの安全性対策も、ハイリスクな要求の狭い範囲を対象としており、通常のソフトウェア開発やほとんどのライフサイエンスの作業には影響しません。 パフォーマンス Sonnet 5.5は、いくつかのドメインでSonnet 5を改善しており、場合によっては劇的に改善しています。いくつかの評価では、Sonnet 5.5(Max effort)はOpus 5.5と同等のパフォーマンスを発揮することさえあります。しかし、ベンチマークスコアはモデルの能力の一側面しか捉えていません。当社のテストおよび外部テスターのテストでは、Opus 5.5は、持続的な判断を必要とする複雑でオープンエンドな作業において、依然として明らかに強力です。 Sonnet 5.5 Sonnet 5 Opus 5.5 GPT-6 Sol エージェント型コーディング Terminal-Bench 4.0 エージェント型コーディング Terminal-Bench 4.0 70.6% 10.3% 66.4%¹ — エージェント型コーディング FrontierCode 1.1 (Main) エージェント型コーディング FrontierCode 1.1 (Main) 46.2% Max² 42.4% 54.4% 49.3% 52.1% Xhigh エージェント型コーディング CursorBench 4.0 エージェント型コーディング CursorBench 4.0 55.5% 34.1% 57.8% — 知識ワーク GDPval-AA v2.1³ 知識ワーク GDPval-AA v2.1³ 1844 1449 1846 1487⁴ 知識ワーク AA-Briefcase v1.1³ 知識ワーク AA-Briefcase v1.1³ 1811 1359 1822 1483⁴ 学際的推論 Humanity’s Last Exam 学際的推論 Humanity’s Last Exam 64.5% with tools 54.9% with tools 67.7% with tools — コンピューター操作 OSWorld 2.1 コンピューター操作 OSWorld 2.1 80.1% partial 57.0% partial 81.8% partial — ビジュアルチャート認識 Chartography ビジュアルチャート認識 Chartography 61.6% no tools 15.6% no tools 64.4% no tools 53.6%⁴ no tools 評価の実行方法の詳細については、Sonnet 5.5システムカードを参照してください。 以下のチャートは、各努力レベルにおけるモデルのスコアとタスクあたりのコストをプロットしたものです。努力レベルが上がるにつれて、モデルは通常より長く作業するため、タスクあたりのコストは高くなりますが、一般的にスコアも高くなります。チャートの左上隅に近いほど、1ドルあたりの能力が高くなります。 いくつかのベンチマークでは、Sonnet 5.5(LowまたはMedium effort)は、タスクあたりのコストの10分の1程度でSonnet 5の最高スコアを上回っています。Opus 5.5を最もよく補完するのは、タスクあたりのコストが低い低努力設定で実行する場合です。高設定では、同等のコストで同等のパフォーマンスを発揮できます。 エージェント型ターミナルコーディング エージェント型コーディング: FrontierCode エージェント型コーディング: CursorBench 知識ワーク: AA-Briefcase エージェント型ターミナルコーディング エージェント型コーディング: FrontierCode エージェント型コーディング: CursorBench 知識ワーク: AA-Briefcase Terminal-Bench 4.0 精度 vs. コスト Sonnet 5.5 Opus 5.5 Sonnet 5 GPT-5.6 Sol 0 10 20 30 40 50 60 70 スコア (%) 12510 コスト/試行 (USD, 対数スケール) Low Med High Xhigh Max Terminal-Bench 4.0は、コマンドラインインターフェース内で、モデルが複雑な複数ステップのプロフェッショナルタスクをどの程度完了できるかを測定します。ClaudeアプリのデフォルトであるMedium effortでは、Sonnet 5.5は、タスクあたりのコストの10分の1未満で、Sonnet 5の最高スコアをはるかに上回ります。 Terminal-BenchとOpenAIはGPT-6 Solのパフォーマンスを公表していないため、ここではGPT-5.6 Solのパフォーマンスを報告します。 FrontierCode v1.1, main set 精度 vs. コスト Sonnet 5.5 Opus 5.5 Sonnet 5 GPT-6 Sol 30 35 40 45 50 55 0 スコア (%) 0.25 0.50 1 2 5 10 20 タスクあたりのコスト (USD, 対数スケール) Low Med High Xhigh Max FrontierCodeは、エージェントのコード変更がマージされるかどうかを測定します。Claude PlatformのデフォルトであるHigh effortでは、Sonnet 5.5は、タスクあたりのコストの5分の1程度でGPT-6 Solの最高スコアに匹敵します。² CursorBench 4.0 精度 vs. コスト Sonnet 5.5 Opus 5.5 Sonnet 5 GPT-5.6 Sol 20 30 40 50 60 0 スコア (%) 0.50 1 2 5 10 タスクあたりのコスト (USD, 対数スケール) Low Med High Xhigh Max CursorBenchは、実際のCursorセッションから取られた曖昧な複数ファイルタスクでコーディングエージェントを評価します。Low effortのSonnet 5.5は、タスクあたりのコストの10分の1未満でSonnet 5の最高スコアを上回ります。 CursorBench 4.0はGPT-6 Solのパフォーマンスを公表していないため、ここではGPT-5.6 Solのパフォーマンスを報告します。 AA-Briefcase v1.1 精度 vs. コスト Sonnet 5.5 Opus 5.5 Sonnet 5 GPT-6 Sol 900 1100 1300 1500 1700 1900 0 Elo 0.10 0.20 0.50 1 2 5 10 20 タスクあたりのコスト (USD, 対数スケール) Low Med High Xhigh Max AA-Briefcase、長期間の知識ワークの新しいベンチマークでは、Medium effortのSonnet 5.5は、タスクあたりのコストの9分の1程度でSonnet 5の最高スコアを上回っています。³ コーディング Sonnet 5.5のパフォーマンスの向上は、特にコーディングにおいて顕著です。FrontierCodeのHigh effortでは、Sonnet 5と同じ設定で10ポイント高く、タスクあたりのコストは約15分の1です。実際のCursorコーディングセッションからのタスクでモデルをテストするCursorBenchでは、その最高スコアはOpus 5.5の約2ポイント以内です。 初期テスターは、Sonnet 5.5がコードベースをどれだけ迅速に理解できるかを高く評価しました。また、その効率性にも驚かされました。直接比較テストでは、Sonnet 5よりも多くのツール呼び出しをまとめてバッチ処理したため、ステップ数が少なくなり、コストも削減されました。 Epic Games EveryCode RabbitSpaceXAI Base44 UnityCreator Epic Games EveryCode RabbitSpaceXAI Base44 UnityCreator 引用 「Epicの初期テストでは、Claude Sonnet 5.5は上位モデルに期待される品質基準を満たし、システム設計監査とデータフローレビューでその能力を発揮しました。新しいモデルは、ゲームシステムアーキテクチャのために数万行のコードを処理し、応答を迅速に保ち、数時間にわたるタスクを処理し、あまり指示的でないプロンプトで成果を上げました。」 会社 Epic Games 著者 Daniel Vogel, Chief Operating Officer 引用 「Claude Sonnet 5.5は素晴らしいです。コーディングが速く、イテレーションワークフローで迅速に指示できます。しかし、必要であれば長時間作業することもできます。Opus 5.5の自然なライティングのアップグレードの一部を備えており、より楽しく作業できます。」 会社 Every 著者 Tyler Nishida, Designer 引用 「Claude Sonnet 5.5は、複雑さの異なるレベルでSonnet 5よりも優れた判断力を示し、出力トークンを大幅に少なく消費します。Sonnet 5がWeb検索に頼りすぎる傾向と高いトークン使用量は、この新しいモデルでは両方ともなくなりました。簡単なレビューと中程度のレビューを移行する予定で、今後数週間でさらに移行します。」 会社 CodeRabbit 著者 David Loker, VP of AI 引用 「Claude Sonnet 5.5は、CursorBench 4.0で55.5%という最先端レベルのパフォーマンスを発揮し、Opus 5.5に次ぐものです。パフォーマンスとコストのバランスを取りたい開発者にとって、ヒットすると考えています。」 会社 SpaceXAI 著者 Sualeh Asif, Director of ML 引用 「118件の実際のアプリビルド全体で、Claude Sonnet 5.5はOpusと同等のスコアのアプリを生成しました。