HN 日本語サマリー

← 一覧へ戻る
AI・機械学習

Claude Opus 5.5の知能、パフォーマンス、価格分析(Max)

Claude Opus 5.5 Intelligence, Performance and Price Analysis (Max) (artificialanalysis.ai)

112 pointsby theanonymousone35 コメント

要約

Artificial AnalysisによるClaude Opus 5.5の分析によると、このモデルは知能指数でトップクラスに位置するものの、同価格帯のモデルと比較するとやや高価です。100万トークンあたりの入力コストは4ドル、出力コストは20ドルと、中央値よりも高めですが、1Mトークンのコンテキストウィンドウを持ち、テキストと画像の入力をサポートします。知能指数タスクあたりのコストは4ユニット中4ユニットと評価されています。

全文翻訳

Artificial AnalysisKAnthropic•Claude Opus 5.5max•プロプライエタリモデル•2026年9月リリース Claude Opus 5.5(アダプティブ・リーゾニング、マックス・エフォート、デフォルト・フォールバック)知能、パフォーマンス、価格分析 比較 試してみる APIプロバイダー ベンチマーク モデル概要 知能 更新済み #1 / 20658 Artificial Analysis Intelligence Index 知能で4ユニット中4ユニット。 速度 N/A 秒間出力トークン 速度で4ユニット中不明。 コスト #87 / 206 $4.00 (入力) $20.00 (出力) キャッシュ割引 95% $5.98 知能指数タスクあたりのコスト コストで4ユニット中4ユニット。 冗長性 #89 / 206 260M 知能指数からの出力トークン 冗長性で4ユニット中4ユニット。 比較概要 Claude Opus 5.5(アダプティブ・リーゾニング、マックス・エフォート、デフォルト・フォールバック)は、知能において最先端モデルの部類に入りますが、他の同価格帯モデルと比較するとやや高価です。このモデルはテキストと画像入力をサポートし、テキストを出力し、1Mトークンのコンテキストウィンドウを持っています。 Claude Opus 5.5(アダプティブ・リーゾニング、マックス・エフォート、デフォルト・フォールバック)は、Artificial Analysis Intelligence Indexで58を記録し、比較対象モデルの中央値25を大きく上回っています。Intelligence Indexの評価では、260Mトークンを生成しましたが、これは中央値の92Mと比較して非常に冗長です。 Claude Opus 5.5(アダプティブ・リーゾニング、マックス・エフォート、デフォルト・フォールバック)の価格は、1M入力トークンあたり4.00ドル(やや高価、中央値: 2.00ドル)、1M出力トークンあたり20.00ドル(やや高価、中央値: 10.00ドル)です。合計で、Claude Opus 5.5(アダプティブ・リーゾニング、マックス・エフォート、デフォルト・フォールバック)をIntelligence Indexで評価するために8708.20ドルかかりました。 技術仕様 推論 はい このページは、このモデルの推論バージョンを示しています。推論しないバリアントも存在する可能性があります。 入力モダリティ サポート: テキストと画像 出力モダリティ サポート: テキスト コンテキストウィンドウ 1M 約1500 A4ページ(12pt Arialフォントサイズ) 206モデルはこのクラスに属します メトリクスは同じクラスのモデルと比較されます: 推論しないモデル → 推論しないモデルのみと比較 推論モデル → 推論モデルと推論しないモデルの両方と比較 オープンウェイトモデル → 同じサイズクラスの他のオープンウェイトモデルのみと比較: Tiny: ≤4Bパラメータ Small: 4B–40Bパラメータ Medium: 40B–150Bパラメータ Large: >150Bパラメータ プロプライエタリモデル → プロプライエタリモデルとオープンウェイトモデルを同じ価格帯で比較、ブレンドされた3:1の入出力価格比を使用: <$0.15/1Mトークン $0.15–$1/1Mトークン >$1/1Mトークン ハイライト 更新済み 知能 Artificial Analysis Intelligence Index 速度 出力トークン/秒 コスト タスクあたりのコスト 重み付け平均コスト(USD)/ Intelligence Indexタスク プロンプトオプション 知能 更新済み Artificial Analysis Intelligence Index Artificial Analysis Intelligence Index v4.3.2は、10の評価を含みます: AA-Briefcase v1.1, GDPval-AA v2.1, AutomationBench-AA, Terminal-Bench 4.0, SciCode, Humanity's Last Exam, GDP.pdf, CritPt, AA-Omniscience, AA-LCR v1.1 29 / 661 モデル 特定のプロバイダーからモデルを追加 Artificial Analysis Intelligence Index Artificial Analysis Intelligence Index v4.3.2には、AA-Briefcase v1.1, GDPval-AA v2.1, AutomationBench-AA, Terminal-Bench 4.0, SciCode, Humanity's Last Exam, GDP.pdf, CritPt, AA-Omniscience, AA-LCR v1.1が含まれます。詳細については、Intelligence Indexの方法論を参照してください。各評価の内訳と実行方法も含まれています。 オープンウェイト / プロプライエタリ 推論 / 非推論 テキストのみ / マルチモーダル入力 Artificial Analysis Intelligence Index by Open Weights / Proprietary Artificial Analysis Intelligence Index v4.3.2は、10の評価を含みます: AA-Briefcase v1.1, GDPval-AA v2.1, AutomationBench-AA, Terminal-Bench 4.0, SciCode, Humanity's Last Exam, GDP.pdf, CritPt, AA-Omniscience, AA-LCR v1.1 29 / 661 モデル 特定のプロバイダーからモデルを追加 プロプライエタリ オープンウェイト オープンウェイト(商用利用制限あり) Artificial Analysis Intelligence Index Artificial Analysis Intelligence Index v4.3.2には、AA-Briefcase v1.1, GDPval-AA v2.1, AutomationBench-AA, Terminal-Bench 4.0, SciCode, Humanity's Last Exam, GDP.pdf, CritPt, AA-Omniscience, AA-LCR v1.1が含まれます。詳細については、Intelligence Indexの方法論を参照してください。各評価の内訳と実行方法も含まれています。 オープンウェイト モデルのウェイトが利用可能かどうかを示します。「商用利用制限あり」は、商用利用が条件付きで制限されている場合、「非商用」はライセンスが商用利用を禁止している場合です。 能力指数 特定の能力と業界におけるモデルのパフォーマンスを測定します。 金融・会計 戦略・オペレーション 法務 エンジニアリング 経済学 Artificial Analysis Finance & Accounting Index 7つの評価を含みます: AA-Omniscience, GDPval-AA v2.1, AA-Briefcase v1.1, Humanity's Last Exam, AutomationBench-AA, AA-LCR v1.1, GDP.pdf · 高いほど良い 29 / 158 モデル 特定のプロバイダーからモデルを追加 ベンチマーク 知能評価 Artificial Analysisによって独立して測定された知能評価 · 高いほど良い コーディング エージェント型 ツール使用 プライベートデータセット ユーザーインタラクション 金融 医療 法務 知能指数 長文コンテキスト マルチモーダル 指示追従 忠実性 ライティング ビジネス さらに表示 18 / 26 評価 29 / 661 モデル 特定のプロバイダーからモデルを追加 AA-Briefcase v1.1 更新済み エージェント型知識作業、(Elo-500)/2000 GDPval-AA v2.1 更新済み エージェント型実世界タスク、(Elo-500)/2000 AutomationBench-AA 更新済み エージェント型SaaSワークフロー Terminal-Bench 4.0 新規 エージェント型コーディングとターミナル使用 SciCode コーディング Humanity's Last Exam 推論と知識 GDP.pdf 新規 専門文書推論、全合格 CritPt 物理学推論 AA-Omniscience Accuracy 知識 AA-Omniscience Non-Hallucination Rate 1 - ハルシネーション率 AA-LCR v1.1 長文コンテキスト推論 Harvey LAB-AA 法務エージェント作業、基準合格率 EnterpriseOps-Gym-AA エージェント型ビジネスオペレーション AA-Analyst スプレッドシートとドキュメントの定量的分析 𝜏³-Banking エージェント型ツール使用 ITBench-AA Kubernetesインシデント根本原因分析 MMMU-Pro 視覚的推論 MLCR-AA 新規 医療長文コンテキスト推論 知能評価の関連性 モデルの知能は一般的にユースケース全体に翻訳されますが、特定の評価は特定のユースケースにより関連性が高い場合があります。 Artificial Analysis Intelligence Index Artificial Analysis Intelligence Index v4.3.2には、AA-Briefcase v1.1, GDPval-AA v2.1, AutomationBench-AA, Terminal-Bench 4.0, SciCode, Humanity's Last Exam, GDP.pdf, CritPt, AA-Omniscience, AA-LCR v1.1が含まれます。詳細については、Intelligence Indexの方法論を参照してください。 AA-Briefcase v1.1 更新済み AA-Briefcase Elo AA-Briefcase Rubric Score (%) Analytical Quality & Presentation Elo AA-Briefcase Elo AA-Briefcase v1.1は、Artificial Analysisによって開発されたエージェント型知識作業ベンチマークです。AA-Briefcase Eloは、ルーブリック合格率、分析品質Elo、プレゼンテーションEloを統合した複合メトリクスです · 高いほど良い 29 / 179 モデル 特定のプロバイダーからモデルを追加 AA-Briefcase Elo AA-Briefcase Eloは、分析品質Elo、プレゼンテーションElo、およびルーブリック合格率を統合した複合メトリクスであり、ルーブリックパフォーマンスは合成的なヘッドツーヘッドマッチを通じてEloに変換されます。Eloおよび95%信頼区間は0にクランプされます。 AA-Omniscience AA-Omniscience Index AA-Omniscience Accuracy AA-Omniscience Hallucination Rate AA-Omniscience Index AA-Omniscience Index (高いほど良い) は、知識の信頼性とハルシネーションを測定します。正解を報酬とし、ハルシネーションを罰し、回答を拒否することにペナルティはありません。スコアは-100から100の範囲で、0は正解と不正解が同数であることを意味し、負のスコアは不正解が多いことを意味します。 29 / 536 モデル 特定のプロバイダーからモデルを追加 AA-Omniscience Index AA-Omniscience Index (高いほど良い) は、知識の信頼性とハルシネーションを測定します。正解を報酬とし、ハルシネーションを罰し、回答を拒否することにペナルティはありません。スコアは-100から100の範囲で、0は正解と不正解が同数であることを意味し、負のスコアは不正解が多いことを意味します。 知能指数比較