HN 日本語サマリー

← 一覧へ戻る
AI・機械学習

Claude Opus 5

Claude Opus 5 (anthropic.com)

66 pointsby meetpateltech7 コメント

要約

Anthropicは、新しいAIモデル「Claude Opus 5」を発表しました。これは、同社の最先端モデルであるClaude Fable 5に匹敵する知能を持ちながら、半額で利用できるコスト効率の高いモデルです。特にコーディングや知識作業の評価で高い性能を示し、日常的な利用に適した効率性と信頼性を備えています。

全文翻訳

製品発表 Claude Opus 5の紹介 2026年7月24日 Claude Opus 5が本日より利用可能になりました。これは、Claude Fable 5の最先端の知能に迫る、思慮深くプロアクティブなモデルでありながら、価格は半額です。 Frontier-BenchやGDPval-AAのようなコーディングおよび知識作業の評価において、Opus 5は新たな最先端技術ですが、サイバーセキュリティタスクにおいてはMythos 5の後塵を拝しています。 Opus 5は日常的な使用のために設計されており、他のモデルよりも効率的に動作します。Claude Maxの新しいデフォルトモデルであり、Claude Proの最も強力なモデルです。 パフォーマンスとコスト効率 Claude Opus 5は、前モデルOpus 4.8と同じコストで大幅に改善されたパフォーマンスを提供します。このセクションのグラフは、顧客が知能を最適化したり、より高速で安価な結果を得るためにトークンを節約したりするために使用できる、モデルの努力設定に応じたパフォーマンスの変化を示しています。 Opus 5は、価値の高いソフトウェアエンジニアリングタスクで優れています。例えば、Frontier-Bench v0.1では、Opus 5は他のすべてのモデルを上回り、タスクあたりのコストを抑えながらOpus 4.8のパフォーマンスを2倍以上に向上させています。CursorBench 3.2では、最大努力設定で、モデルはFable 5のピークスコアに0.5%以内のパフォーマンスを示しますが、タスクあたりのコストは半分です。また、高、超高、最大努力設定のいずれにおいても、他のすべてのモデルよりも高いパフォーマンスを特定のコストで達成しています。 Frontier-Bench v0.1 CursorBench AAコーディングエージェントインデックス 同様の結果が知識作業や問題解決タスクでも見られます。例えば: モデルが新しい問題を解決する必要がある評価であるARC-AGI 3では、Opus 5のスコアは次に良いモデルの3倍です。 モデルがビジネスタスクを最初から最後まで完了できるかを測定するZapier AutomationBenchでは、Opus 5の合格率は、タスクあたりのコストが同じ場合、次に良いモデルの約1.5倍です。最低努力設定であっても、Opus 5は他のどのモデルよりも多くのタスクを完了します。 コンピュータ使用ベンチマークであるOSWorld 2.0では、Opus 5はどのコスト設定でも他のすべてのモデルを上回り、Fable 5の最高の結果をわずか3分の1強のコストで達成しています。 また、いくつかの関連評価においても、当社の最も強力でコスト効率の高いモデルです。 ARC-AGI 3 GDPval-AA v2 OSWorld 2.0 HLE AutomationBench DeepSearchQA Opus 5は、科学研究においてOpus 4.8からの意味のある改善です。構造生物学、有機化学、バイオインフォマティクスなどのトピックをカバーする当社のライフサイエンス評価のすべてにおいて、Opus 4.8よりも優れたパフォーマンスを示しています。その改善は、有機化学タスク(分光データから分子構造を推測するなど、当社の内部ベンチマークでOpus 4.8よりも10.2パーセントポイント高いスコア)、およびタンパク質の配列の変化がその機能にどのように影響するかを予測するようなタンパク質関連タスク(ここでは、Opus 4.8よりも7.7パーセントポイント高いスコア)で最も顕著です。 最後に、Opus 5ははるかに強力な視覚出力を生成する能力があります。 風洞 細胞アーティファクト Opus 5は、空気力学的な(および非空気力学的な)物体の空気の流れを視覚化しました。風洞でさまざまな設定を試してみてください。 Opus 5は、細胞の簡略化されたインタラクティブなイラストを作成しました。その要素をここで探求してください。 Claude Opus 5との連携 Claude Opus 5は、作業を検証し、成功するまで慎重に反復する能力が大幅に向上しました。評価および早期アクセスでのテストにおいて、当社およびユーザーは、Opus 5のエージェンシーと徹底さを示す多くの例を見つけました。 あるFrontier-Benchタスクでは、Opus 5に機械部品の図が与えられ、それを3D FreeCADモデルとして再構築するためのコードを書くように依頼されました。しかし、このタスクでは、モデルは図を直接表示する方法を意図的に与えられていませんでした。Opus 5は、生のピクセルからジオメトリを抽出するための独自のコンピュータビジョンパイプラインを作成して応答しました。そして、完全な機械部品を再構築しました。これを繰り返し成功させました。同じセットアップの競合モデルは、5回の試行後もそれを解決できませんでした。 人気のあるオープンソースパッケージマネージャーの実際のバグが与えられたとき、Opus 5はその根本原因を見つけ、コミュニティのパッチが見逃していたエッジケースを修正しました。競合モデルは表面的な症状のみを修正し(根本原因ではなく)、バグが解決されたと報告しました。 ある取引会社のエンジニアは、Opus 5を使用して、1回のセッションで新しい取引所のマーケットデータフィードを構築しました。以前のモデルは、エンジニアからの広範な計画を与えられても、このタスクをまったく完了できませんでした。検証するためのライブフィードが見つからなかったため、Opus 5は独自のテストハーネスを構築して、コードが取引所のデータを正しく解析していることを確認しました。 以下は、早期アクセス顧客からのOpus 5との作業経験に関するさらなる報告です。 FrontierCode 1.1では、Claude Opus 5は半額のコストでFableレベルのパフォーマンスに近づいています。Devin内でも、困難なデバッグおよび根本原因分析タスクで特に強みを示しています。 Claude Opus 5は、Opusの速度とコストでFable 5に近い知能を提供します。CursorBenchではFable 5のわずかに下ですが、多くの同じ動作を示します。開発者がCursorでどのように使用するかを見るのが楽しみです。 Claude Opus 5は、以前のClaudeモデルと同じトークン数を使用せずに、ZapierのAutomationBenchリーダーボードをトップしました。生の顧客アカウント健全性ワークブックを取得し、完全な解約防止シーケンスをエンドツーエンドで実行しました。リスクのあるアカウントをフラグ付けし、適切な担当者にアラートを出し、リテンションオペレーションのために要約しました。以前のモデルは合格しませんでしたが、Opus 5は100%達成しました。 ゲノム解析の作業において、Claude Opus 5は、実行した他のどのモデルよりも、慎重な科学者のように振る舞います。交絡因子を排除するための適切な統計テストを求め、独立した方法で自身の結果をクロスチェックし、長くて多段階の分析を通じて軌道を維持します。 Claude Opus 5は、当社の内部評価において、そのファミリーのすべてのモデルを上回りました。最も困難なエージェンティックコーディングタスクで22%向上しただけでなく、実行ごとのばらつきがはるかに少なく、より安定しています。Lovableの数百万人のビルダーにとって、その一貫性はすべてです。ビルドごとに信頼できる結果が得られます。 Claude Opus 5は、4.5以降のOpusファミリーにおける最大の飛躍です。同じフルスタックアプリビルドで、フロントエンドが最初にそれを実感します。Opusモデルから見た最高のパフォーマンスのアニメーション、ゲーム、3Dワークです。 Claude Opus 5を気に入っています。当社のエージェントが処理するようなオープンエンドな分析作業にとって、Opus 4.8からの厳密なアップグレードであり、最も重要な、より困難で曖昧なタスクで最大の向上が見られます。応答はより明確で簡潔になり、高努力レベルでの効率性も向上しています。 Claude Opus 5は、当社のアナリストが毎日実行する金融リサーチワークフローにとって、Opus 4.8からの顕著な改善です。数値推論、表計算、精度が重要なシャープな批判的思考において際立っています。 Claude Opus 5は、専門的なエンタープライズコンテンツの分析に不可欠な業界の知性と精度を提供します。Boxは、Opus 5がOpus 4.8を8%上回り、テクノロジー、ヘルスケア、公共部門の組織が日常的に依存するデータ分析(11%の改善)およびデューデリジェンス(17%の改善)ワークフローで顕著なパフォーマンス向上をもたらすことを発見しました。 Claude Opus 5は、Opus 4.8からの明確な世代交代です。ある週末、私はそれに開発環境のチーフオブスタッフの役割を与えました。それは独自のモニターを構築し、各ボックスを駆動し、判断が必要な場合にのみ私を呼びました。 Claude Opus 5は、当社のFundamental Research Assistantコードベース全体に大規模な変更を加え、エージェンティックワークフロー全体でフィードバックに適応し、使用したどのモデルよりも明確にその推論を説明しました。通常はるかに小さな部分に分割する必要があった作業を処理しました。 最も困難な金融モデリングタスクの一部において、Claude Opus 5は、精度と効率の両方においてOpus 4.8からの明確なステップアップです。特に深い金融ドメインロジックにおいて、そのパフォーマンスの最低ラインは著しく高くなっています。努力レベル全体で、平均して9パーセントポイント高い精度を達成し、ターンとツールコールは3分の1減少し、時間は60%短縮されました。 Claude Opus 5は、実際のフロントエンド開発者のように自身の作業をチェックします。当社のベンチマークでは、デスクトップ幅と電話幅でブラウザでページを開き、モバイル折り畳みの下に隠れていた製品を検出し、オフスクリ