AI・機械学習
Claude Opus 5.5を発表
Claude Opus 5.5 (anthropic.com)
要約
Anthropicは、性能が向上し、コストが40%削減された新しい大規模言語モデル「Claude Opus 5.5」を発表しました。このモデルは、複雑なコーディングタスクや、生物学・サイバーセキュリティ分野での利用において、安全性と効率性を大幅に向上させています。今後は、Claude Sonnet 5.5およびHaiku 5.5もリリース予定です。
全文翻訳
Claude Opus 5.5を導入します。これは、当社の新しいClaude 5.5ファミリーの最初のモデルです。ほとんどの作業においてClaude Fable 5.1と同等の性能を発揮し、運用コストはOpus 5よりも40%低くなっています。
Claude Opus 5.5は、私たちがフロンティアのペース配分を呼びかけて以来、最初のリリースです。リリース前に、Frontier DesignやMETRを含む外部評価者によってテストされました。当社が実施する最も包括的なアライメントテストである自動行動監査において、Opus 5.5はこれまでにテストされた中で最も強力なパフォーマンスを発揮するモデルです。また、最も高性能なモデルのために開発された安全対策も備えています。
Opus 5.5から期待できる改善点の一部を以下に示します。
パフォーマンス。Opus 5.5はOpus 5から大幅な進歩を遂げています。新しい最先端モデルであり、初期テスターは最も複雑な作業でパフォーマンスが大幅に向上したことを確認しています。あるテスターは、68万行のコード移行を1日未満で完了しました。これは、エンジニアリングチームが数週間かかる作業でした。ソフトウェアの非効率性を発見・修正することに優れており、ウェブアプリの全ページのロード時間を短縮するように依頼したところ、Opus 5.5は40件中39件で成功しましたが、Opus 5はより小さな改善にとどまり、アプリの動作も変更してしまいました。別のテスターは、複数のClaudeモデルに単一のプロンプトからゲームを構築させましたが、Opus 5.5はグラフィックスの強度と洗練度において他のどのモデルよりも高いスコアを獲得しました。
安全性。Opus 5.5は、数千のシミュレーションシナリオでClaudeをテストするアライメントスイートである当社の自動行動監査において、これまでにテストされたどのモデルよりも最高のスコアを達成しています。最近のモデルと比較して、元に戻すのが難しいアクションを実行したり、与えられた境界外で動作したりする可能性がはるかに低く、プロンプトインジェクションに対してOpus 5よりも耐性があります。また、長いタスク、不可能なタスク、および実際のインシデントに基づいたシナリオをカバーするようにアライメントテストを拡大しましたが、依然として限界はあります。評価の詳細については、Opus 5.5システムカードをご覧ください。
Opus 5.5は生物学およびサイバーセキュリティにおいてClaude Mythos 5.1に匹敵するため、Claude Fable 5.1と同様の安全対策を施して展開しています。認定された組織は、生物学研究にOpus 5.5を使用するために、当社のライフサイエンス検証プログラムに本日申し込むことができます。今後数週間で、サイバー検証プログラムへのアクセスも拡大し、認定されたサイバーセキュリティ実務家が業務にOpus 5.5を使用できるようになります。
コストと速度。Opus 5.5はOpus 5よりもサービス提供に必要なコンピューティングリソースが少なく、その価格設定にもそれが反映されています。当社のテストによると、デフォルト設定では一般的なワークロードでOpus 5よりも40%安価になります。入力および出力トークンは100万トークンあたり4ドルと20ドルで、Opus 5より20%安価です。キャッシュ読み取り(エージェント型およびコーディング作業コストの大部分を占める)は、100万トークンあたり0.20ドルで、Opus 5より60%安価です。Opus 5.5は、Opus 5よりも30%以上高速に出力を生成します。
価格の引き下げに加えて、Pro、Max、Team、およびシートベースのEnterpriseプランで5時間利用制限を増やしています。また、サブスクリプションユーザーにはレートリセットを提供しており、いつでも好きな時に使用できるようになりました。
コミュニケーション。Opus 5.5は、以前のモデルよりも自然にコミュニケーションをとります。初期テスターは、その文章がより明確で理解しやすいと感じており、Opus 5に関する一般的なフィードバックの一部に対応しています。最も重要な情報を前面に出し、そのスタイルは長時間のセッションでより良い作業パートナーとなります。ある初期テスターは、「私が書くように書く」と述べています。当社自身の使用においても、これによりOpus 5.5の作業が理解しやすく、チェックしやすくなりました。これは実用的な利点であると同時に安全上の利点でもあります。
Claude Sonnet 5.5とClaude Haiku 5.5は、今後数週間でリリースされ、パフォーマンス、効率性、安全性の面で多くの同じ改善が施されます。
パフォーマンスとコスト効率
当社のベンチマークでは、Claude Opus 5.5はエージェント型コーディング、コンピューター使用、および知識作業においてリードしています。とはいえ、これらのレベルの能力では、ベンチマークの差は実際の差をガイドする信頼性が低下していることがわかっています。当社自身の使用では、Opus 5.5とClaude Fable 5.1の差は、これらのスコアが示すよりも狭いです。
Opus 5.5
Fable 5.1
Opus 5
GPT-6 Astra
GPT-5.6 Sol
エージェント型コーディング
Terminal-Bench 4.0¹
エージェント型コーディング
Terminal-Bench 4.0¹
66.4%
55.8%
52.3%
57.9%
37.3%
エージェント型コーディング
FrontierCode v1.1 (Main)
エージェント型コーディング
FrontierCode v1.1 (Main)
54.4%
50.3%
48.0%
53.3%
47.5%
エージェント型コーディング
CursorBench 4.0
エージェント型コーディング
CursorBench 4.0
57.8%
51.8%
46.6%
—
41.7%
知識作業
GDPval-AA v2.1
知識作業
GDPval-AA v2.1
1846
1735
1708
1542
1588
ビジネスワークフロー
AutomationBench²
ビジネスワークフロー
AutomationBench²
40.0%
31.4%
26.9%
41.4%
28.8%
学際的推論
Humanity's Last Exam
学際的推論
Humanity's Last Exam
67.7% (ツール使用)
65.6% (ツール使用)
63.6% (ツール使用)
57.2% (ツール使用)
—
エージェント型科学研究
Terminal-Bench-Science 0.1³
エージェント型科学研究
Terminal-Bench-Science 0.1³
58.7%
52.6%
29.0%
64.6%
22.4%
コンピューター使用
OSWorld 2.0
コンピューター使用
OSWorld 2.0
81.8% (部分)
80.7% (部分)
74.0% (部分)
——
視覚的チャート認識
Chartography
視覚的チャート認識
Chartography
89.0% (ツール使用)
88.4% (ツール使用)
83.4% (ツール使用)
——
特に断りのない限り、すべてのClaude Opus 5.5の結果はアダプティブシンキングを最大努力で使用しています。Terminal-Bench 4.0の結果は、Claude Opus 5.5はxhigh effort、GPT-6 Astraはhigh effortで報告されており、それぞれモデルの最高スコアを表します。Claude Opus 5.5は、本番の安全対策を有効にして評価されました。安全対策が介入した場合、サイバーセキュリティタスクはClaude Opus 4.8によって、生物学およびフロンティアLLM開発タスクはClaude Opus 5によって完了されました。これは、これらのベンチマークにおけるClaude Opus 5.5のパフォーマンスを低下させる可能性があります。
¹ Terminal-Bench 4.0: 標準誤差はClaude Opus 5.5で±2.6ポイント、他のClaudeモデルで±1.6~2ポイントです。公開リーダーボード(5試行/タスク、Claude Codeハーネス)はClaude Opus 5を51.8%と報告しており、当社のセットアップはノイズの範囲内で52.3%と再現しています。GPT-6 AstraおよびGPT-5.6 Solの数値はOpenAIの報告によるものです。
² AutomationBench: AutomationBenchの結果はZapierによって実行および報告されました。これらの実行はフォールバックモデルなしで行われたため、安全対策の介入は失敗と見なされ、Claude Opus 5.5が実際には達成するであろうスコアよりも低いスコアになりました。Claude Opus 5.5の結果は、初期アクセス中のZapier自身の評価によるものです。Opus 5、GPT-5.6 Sol、およびGPT-6 Astraの結果はZapierの公開リーダーボードによるものです。
³ Terminal-Bench-Science 0.1: 標準誤差はモデルあたり±3.5~5ポイントです。公開リーダーボード(3試行/タスク、Claude Codeハーネス)はClaude Opus 5を30.0%と報告しており、当社のセットアップはノイズの範囲内で29.0%と再現しています。GPT-6 Astraの数値はOpenAIの報告によるものです。
Opus 5.5の利点が非常に明確なのは効率性です。Opus 5よりもトークンあたりのコストが低く、タスクあたりのトークン使用量も少ないため、コストが40%削減されます。
価格設定
価格/100万トークン
Claude Opus 5.5
Claude Opus 5
キャッシュ読み取り
$0.20
$0.50
入力トークン
$4
$5
出力トークン
$20
$25
キャッシュ書き込み
$5
$6.25
Opus 5.5の高速モードは、Claude CodeおよびClaudeプラットフォームでも利用可能で、最大2.5倍の速度です。入力トークンは100万あたり8ドル、出力トークンは100万あたり40ドルです。
コーディング
Opus 5.5は、コードベース全体の移行や監査のような長くて広範囲なジョブに特に優れています。初期テスターは、20万行のコードベースを3時間未満で監査および修正するためにそれを使用しましたが、Opus 5は20時間以上かかり、トークンを2.5倍使用しました。社内テストでは、Opus 5.5とFable 5.1に、ウェブトラフィック負荷をサーバー間で分散するために広く使用されているソフトウェアであるHAProxyをCからRustに翻訳するように依頼しました。どちらの書き換えもHAProxy自身の回帰テストのほぼすべてに合格しましたが、Opus 5.5はFable 5.1の12時間に対して9.5時間で完了し、コストは51%削減されました。
Opus 5.5は、わずかなコストでエージェント型コーディングにおいてフロンティアの結果をもたらします。FrontierCodeでのデフォルトの努力レベルでは、タスクあたりのコストの約20%でGPT-6 Astraを上回ります。Terminal Bench 4.0では、コストの約40%でAstraと同等であり、CursorBenchではコストの約3分の1でGPT-5.6 Solを11ポイント上回ります。
エージェント型ターミナルコーディング
エージェント型コーディング: Frontie