HN 日本語サマリー

← 一覧へ戻る
AI・機械学習

Claude Sonnet 5

Claude Sonnet 5 (anthropic.com)

1188 pointsby marinesebastian733 コメント

要約

Anthropicは、これまでのSonnetモデルの中で最もエージェント的な能力を持つ「Claude Sonnet 5」を発表しました。Sonnet 5は、計画立案、ツールの使用、自律的な実行においてOpus 4.8に近い性能を発揮しつつ、低価格で提供されます。既存のSonnet 4.6と比較して、推論、ツール使用、コーディング、知識作業といったエージェント性能の重要な側面で大幅な改善が見られ、安全性の評価でも全体的に好ましくない動作の発生率が低いとされています。

全文翻訳

プロダクト Claude Sonnet 5を発表 2026年6月30日 Claude Sonnet 5は、これまでのSonnetモデルの中で最もエージェント的になるように構築されています。わずか数ヶ月前までは、より大規模で高価なモデルが必要だったレベルで、計画を立て、ブラウザやターミナルなどのツールを使用し、自律的に実行できます。 多くの開発者にとって、エージェントAIの時代はSonnetクラスのモデルで始まりました。Claude Sonnet 3.5、3.6、3.7は、コーディングとツール使用において目覚ましいスキルを示した最初のモデルでした。しかし、最近では、エージェント能力の最も明確な進歩はOpusクラスのモデルに見られました。 Sonnet 5はその差を縮めます。その性能はOpus 4.8に近いですが、価格は低くなっています。推論、ツール使用、コーディング、知識作業といったエージェント性能の重要な側面において、前身であるSonnet 4.6と比較して大幅な改善が見られます。 Sonnet 5の様々な評価におけるスコアを、Sonnet 4.6およびOpus 4.8(参考として、より汎用的なモデル)と比較したものです。Claude Sonnet 5システムカードには、より広範な評価が詳細に報告されています。 当社の安全性評価では、Sonnet 5がSonnet 4.6よりも全体的に望ましくない動作の発生率が低く、エージェントのコンテキストで一般により安全に使用できることが判明しました。評価では、現在のOpusモデルと比較して、サイバーセキュリティタスクを実行する能力がはるかに低いことも示されています。 本日より、Claude Sonnet 5はすべてのプランで利用可能です。FreeおよびProプランのデフォルトモデルであり、Max、Team、Enterpriseユーザーも利用できます。Claude CodeおよびClaude Platformでも利用可能で、2026年8月31日まで、入力トークン100万あたり2ドル、出力トークン100万あたり10ドルの導入価格で提供され、その後は入力トークン100万あたり3ドル、出力トークン100万あたり15ドルで提供されます。開発者はClaude API経由でclaude-sonnet-5を使用できます。 Claude Sonnet 5の操作 以下のグラフは、エージェント検索評価BrowseCompとコンピュータ使用評価OSWorld-VerifiedにおけるSonnet 5とSonnet 4.6およびOpus 4.8の様々な努力レベルでのパフォーマンスを比較しています。Sonnet 5(オレンジ色の線)はSonnet 4.6(灰色の線)を明確に上回っています。Opus 4.8(黄色の線)はこれらのタスクでより高い精度を得るための依然として選択すべきモデルですが、Sonnet 5は以前に利用可能だったものよりもはるかに高品質な低価格オプションを開発者に提供します。Sonnet 5とOpus 4.8の間で、ユーザーは努力レベルを調整して、コストとパフォーマンスの適切なバランスを見つけることができます。 エージェント検索 エージェントのコンピュータ使用 様々な努力レベルでのコストパフォーマンス曲線。以前の最高のSonnetモデル(Sonnet 4.6)はOpus 4.8には遠く及びませんでした。現在、Sonnet 5とOpus 4.8は単一の範囲をカバーし、Sonnet 5は低コストで優れた機能を提供し、Opus 4.8は高価格でより高い精度を提供します。グラフはSonnet 5が入力トークン100万あたり3ドル、出力トークン100万あたり15ドルで価格設定されていることを示しています。さらに、8月31日までの導入価格(入力2ドル/MTok、出力10ドル/MTok)では、Sonnet 5の実質的なコストはここに示されているよりもさらに低くなります。Opus 4.8は入力5ドル/MTok、出力25ドル/MTokで価格設定されています。xhigh = 超高努力レベル。 様々な努力レベルでのコストパフォーマンス曲線。以前の最高のSonnetモデル(Sonnet 4.6)はOpus 4.8には遠く及びませんでした。現在、Sonnet 5とOpus 4.8は単一の範囲をカバーし、Sonnet 5は低コストで優れた機能を提供し、Opus 4.8は高価格でより高い精度を提供します。グラフはSonnet 5が入力トークン100万あたり3ドル、出力トークン100万あたり15ドルで価格設定されていることを示しています。さらに、8月31日までの導入価格(入力2ドル/MTok、出力10ドル/MTok)では、Sonnet 5の実質的なコストはここに示されているよりもさらに低くなります。Opus 4.8は入力5ドル/MTok、出力25ドル/MTokで価格設定されています。xhigh = 超高努力レベル。 アーリーアクセスパートナーからのフィードバックは一貫しています。Sonnet 5は以前のモデルよりもはるかにエージェント的です。テスターは、以前のSonnetモデルでは途中で止まってしまった複雑なタスクをどのように完了させるか、明示的に要求しなくても自身の出力をどのようにチェックするか、そしてこれらすべてのエージェント的な作業を魅力的な価格でどのように行うかを説明しています。 Claude Sonnet 5は、多段階のソフトウェアエンジニアリング作業において、強力な実行レイヤーをエージェントに提供します。煩雑な技術的コンテキスト全体で、継続的なコーディング、ツール使用、デバッグをうまく処理し、特にフォローアップと技術的根拠が重要なワークフローで非常に役立ちました。 Claude Sonnet 5に、Salesforceアカウントの階層を更新し、エンタープライズ連絡先にローンチ発表を送信するという2つのタスクを与えたところ、最初から最後まで完了しました。以前は途中で停止していました。日々の自動化には、これは当たり前のことです。 Claude Sonnet 5は、より少ない労力でより多くのことを成し遂げます。同じ出力品質で、そこに至るまでのステップが少なくなります。また、安全でない要求をクリーンかつ一貫して拒否します。Lovableでは、何百万ものビルダーに強力なツールを提供しています。拒否すべきときに拒否できるモデルは、構築できるモデルと同じくらい重要です。 Claude Sonnet 5を、最も困難な実際のプルリクエストの数十に対して実行したところ、それぞれをテスト済みで検証済みの結果まで単独で実行しました。これにより、エンジニアは判断、決定、最終的な承認に集中できるようになりました。 Claude Sonnet 5にバグを調査するよう依頼しました。プロンプトなしで、再現テストを作成し、修正を実装し、その後、変更なしでバグが戻ることを確認するためにそれをスタッシュしました。これらすべてが1回のパスで行われました。 Claude Sonnet 5を使用すると、エージェントは計画通りに進み、当社の慣例に従い、クリーンな多段階の変更を出荷し、すべてを効率的なコストで行います。 Claude Sonnet 5は、ブラウンフィールドコード(競合状態、隠れたテスト、誰も触りたくない部分)で最高の性能を発揮します。障害を実際の根本原因までたどり、症状をパッチするのではなく、永続的な修正を出荷します。 Claude Sonnet 5は、Eveの原告弁護士のタスクのパレート最適解に位置しています。法律調査と分析で最も明確な利益が見られ、移行の選択を容易にする価格性能比です。 ClickHouseエージェントはライブデータを探索し、その場で洞察を生成するため、新しいモデルをテストする際にはインサイト取得までの時間が重要です。Claude Sonnet 5はより厳密なステップで推論し、ユーザーをより早く回答に導きます。その速さは、お客様が実感できる違いです。 Paceでは、当社のコンピュータ使用エージェントが、当社の運用チームがすでに使用しているシステムで、保険ワークフロー(申請受付、FNOL、損失実行)を実行します。Claude Sonnet 5は一貫して正しい行動を迅速に実行し、それが実際の保険業務で求められるものです。 01 / 10 安全性評価 展開前の安全性評価では、Sonnet 5がSonnet 4.6よりも全体的に改善されていることがわかりました。エージェントの安全性に関しては、悪意のあるリクエストを拒否し、プロンプトインジェクション攻撃におけるハイジャックの試みに抵抗する能力が向上しています。このモデルは、Sonnet 4.6よりも幻覚や追従の発生率が低いことを示しています。誤用への協力や欺瞞など、幅広い誤った動作をテストする自動行動監査では、Sonnet 5は全体的に低い(つまり、より安全な)スコアを記録しました。しかし、この評価では、より高性能なOpus 4.8やClaude Mythos Previewと比較して、誤った動作の発生率がやや高いことが示されました。 様々な状況やコンテキストにおける非常に広範な望ましくない動作をテストする自動行動監査における誤った動作の発生率(完全なリストと各特定の動作の結果については、Sonnet 5システムカードのセクション6.4を参照)。Sonnet 5は、Sonnet 4.6よりも全体的に誤った動作の発生率が低いことを示していますが、Mythos PreviewおよびOpus 4.8よりも高いです。 Sonnet 5はサイバーセキュリティタスクについて意図的にトレーニングしていません。いくつかのルーチンで無害なサイバータスクを実行できますが、ソフトウェアエクスプロイトの開発など、潜在的に危険なサイバースキルをテストする評価では、Opus 4.8やMythos 5などのモデルよりも大幅に劣る性能を示します。Firefoxブラウザの脆弱性に対するエクスプロイトを開発するモデルの能力をテストした1つの評価のスコアを以下のグラフに示します。Sonnet 5は完全な動作するエクスプロイトを開発できませんでした。