HN 日本語サマリー

← 一覧へ戻る
AI・機械学習

Claude Haiku 5.5 の紹介

Claude Haiku 5.5 (anthropic.com)

421 pointsby sfkgtbor203 コメント

要約

Anthropicは、最も安価で高速、かつ高性能な小型モデルであるClaude Haiku 5.5を発表しました。このモデルは、要約、データコンパクション、データベースクエリ、分類などの高ボリュームでコスト重視のタスクに最適化されており、以前のバージョンと比較して大幅な価格低下とパフォーマンス向上が実現されています。また、Claude Sonnet 5.5のキャッシュ読み取り価格も引き下げられ、APIクレジットの提供も拡充されています。

全文翻訳

Claude Haiku 5.5 の紹介: 私たちがこれまでにリリースした中で最も安価で、最も高速で、最も高性能な小型モデルです。 Claude Haiku 5.5 は、高ボリュームでコストに敏感なタスクのために設計されています。要約、コンパクション、データベースクエリ、分類リクエストなどの、迅速で反復的なワークロードを確実に処理します。コーディング作業におけるサブエージェントとして、Opus 5.5 および Sonnet 5.5 と組み合わせて使用するのに適しています。また、これまでのモデルの中で最も高速であるため、ライブカスタマーサポートやブラウザ利用など、速度が重要なタスクにも特に適しています。 Haiku 5.5 は Haiku 4.5 よりもはるかに低い価格で利用可能です。平均して、実行コストが約 75% 低減されました。このローンチと同時に、モデルレンジの価値向上も図っています。Claude Sonnet 5.5 のキャッシュ読み取りの価格を半額にし、これにより Sonnet 5.5 はほとんどのエージェント作業で約 20% 安価になりました。さらに、Claude Max および Team サブスクライバー向けの新しい月間 API クレジットを導入し、Claude Platform 上で動作する新しいエージェントやアプリケーションの構築をサポートします。 パフォーマンス Claude Haiku 5.5 がさまざまなベンチマークでどのようにパフォーマンスを発揮するかを以下に示します。 Haiku 5.5 Haiku 4.5 GPT-6 Luna Sonnet 5.5 参考 ナレッジワーク GDPval-AA v2.1 ナレッジワーク GDPval-AA v2.1 162073514371840 ナレッジワーク AA-Briefcase v1.1 ナレッジワーク AA-Briefcase v1.1 157861413361824 コンピューター利用 OSWorld 2.1 コンピューター利用 OSWorld 2.1 72.4% オフラインサブセット 15.7% オフラインサブセット 48.9% オフラインサブセット 83.9% オフラインサブセット 学際的推論 Humanity’s Last Exam 学際的推論 Humanity’s Last Exam 45.9% ツールなし 10.2% ツールなし — 56.9% ツールなし 57.4% ツールあり 18.7% ツールあり — 64.5% ツールあり エージェントコーディング Terminal-Bench 4.0 エージェントコーディング Terminal-Bench 4.0 39.2% 0.0% 16.4% 70.6% エージェントコーディング FrontierCode 1.1 (Main) エージェントコーディング FrontierCode 1.1 (Main) 46.4% — 42.4% 52.1% ビジュアル推論 Chartography ビジュアル推論 Chartography 46.4% ツールなし 6.4% ツールなし 29.1% ツールなし 61.6% ツールなし 評価の実行方法の詳細については、Haiku 5.5 システムカードを参照してください。 Haiku 5.5 は、調整可能な努力設定を備えた初の Haiku クラスモデルです。これは、他のモデルと同様に、ユーザーがコストまたはインテリジェンスのいずれかを最適化するかを決定できることを意味します。以下のチャートは、各努力設定における 3 つのベンチマークでの Haiku 5.5 のパフォーマンスを示しています。 コンピューター利用: OSWorld ナレッジワーク: GDPval-AA 学際的推論: Humanity’s Last Exam コンピューター利用: OSWorld ナレッジワーク: GDPval-AA 学際的推論: Humanity’s Last Exam OSWorld 2.1 (オフラインサブセット) 精度 vs. コスト Haiku 5.5 Haiku 4.5 Sonnet 5.5 GPT-6 Luna 0 10 20 30 40 50 60 70 80 90 部分点スコア (%) 0.05 0.10 0.20 0.50 1 25 試行あたりのコスト (USD、対数スケール) 低 中 高 Xhigh Max OSWorld 2.1 は、エージェントが実際のコンピューターを操作して、長くて複数ステップのタスクを完了する能力を測定します。 GDPval-AA v2.1 精度 vs. コスト Haiku 5.5 Haiku 4.5 Sonnet 5.5 GPT-6 Luna 800 1000 1200 1400 1600 1800 2000 0 Elo、報告値 0.005 0.01 0.02 0.05 0.10 0.20 0.50 1 25 タスクあたりのコスト (USD、対数スケール) 低 中 高 Xhigh Max Artificial Analysis の GDPval-AA v2.1 は、44 の職業にわたる実世界の専門的な作業でエージェントを評価します。 Humanity’s Last Exam (ツールなし) 精度 vs. コスト Haiku 5.5 Haiku 4.5 Sonnet 5.5 0 10 20 30 40 50 60 70 スコア (%) 0.005 0.01 0.02 0.05 0.10 0.20 0.50 1 コストあたりの試行 (USD、対数スケール) 低 中 高 Xhigh Max Humanity’s Last Exam (HLE) は、専門家レベルの学術知識と推論のテストです。 初期テストでは、お客様から上記のパフォーマンスとコストの改善と一致する結果が報告されています。新しいモデルについてお客様から寄せられた声は次のとおりです。 Asana HubSpot AlphaSense Box Rogo Cognition Asana HubSpot AlphaSense Box Rogo Cognition 引用 「私たちは Claude Haiku 5.5 に非常に感銘を受けており、特にその速度に驚いています。AI チームメイト、当社の AI エージェント製品の評価スイートで実行したところ、バグのトリアージ、プロジェクトの設定、高リスクまたは期限切れの作業を表面化するための大規模なポートフォリオの検索などのユースケースをカバーしました。現在使用しているモデルと比較して、タスク完了のレイテンシが 30% 以上削減され、エージェントのターンごとの推論速度が最大 2.5 倍になりました。明らかに、より応答性の高いエクスペリエンスです。」 会社 Asana 著者 Aaron Vinh、Staff Software Engineer 引用 「HubSpot では、シミュレートされたポータルを使用して、レポート作成などの CRM タスクで新しいモデルを評価しています。主に小型で効率的なモデルをテストしていますが、Claude Haiku 5.5 は、3 回の実行の平均で 92.8% という、このスイートでこれまでに見た中で最高のスコアを達成しました。ある CRM 監査タスクでは、モデルに古いものの曖昧なレコードを特定するように求めています。テストしたすべてのモデルの中で、Haiku 5.5 はタスク完了が最も速く、ヒット率が最も高く、偽陽性率が最も低かったです。」 会社 HubSpot 著者 Ze’ev Klapow、Distinguished Software Engineer 引用 「Ask in Document は、当社の支出の大きな源泉の 1 つであり、本番環境で週に約 800 万件の呼び出しを行っています。これは、1 つまたは複数のドキュメントの上にある非常に具体的な質問に答えます。400 件のクエリを実行したところ、Claude Haiku 5.5 は Haiku 4.5 よりも統計的に有意な改善が見られました。0.84 対 0.76 です。」 会社 AlphaSense 著者 Daniel Campos、Distinguished Engineer 引用 「当社の顧客は、大量のエンタープライズ コンテンツで Box AI を使用しています。広範な使用に伴い、効率とコストを管理し、タスクに適した最適なモデルを見つける必要が生じます。初期テストでは、Claude Haiku 5.5 は、レイテンシが約半分で、Haiku 4.5 よりも 11 ポイント高いスコアを記録しました。コストレポートから財務サマリー、週次レビューまで、大規模に実行される分析作業に利用するでしょう。」 会社 Box 著者 Yashodha Bhavnani、VP of AI Products 引用 「短く高ボリュームの作業は、クイックルックアップ、サブエージェント、要約など、Claude Haiku 5.5 が私たちにとって適している分野です。より大きなモデルがプレゼンテーションデッキを構築している間に、Haiku 5.5 のサブエージェントが 10-K にアクセスして、デッキに必要なセグメント収益ラインを取得します。それは十分に正確なので、そこに信頼して使用でき、十分に高速かつ安価なので、多くの回数実行できます。」 会社 Rogo 著者 Alex Wang、Applied AI 引用 「Claude Haiku 5.5 は、Devin Fusion のサイドキックラインナップに加わり、優れた選択肢となっています。Haiku 5.5 をサイドキックとして使用すると、Fusion はトップティアの FrontierCode スコア 66.2 を維持しながら、コストとレイテンシを削減します。Opus 5.5 をリードとして、Devin CLI で今日試すことができます。」 会社 Cognition 著者 Walden Yan、Co-Founder & CPO 価格 以下の表は、Claude Haiku 5.5 の価格が他のモデルと比較してどのように見えるかを示しています。Haiku 5.5 は、プロンプトが 100,000 トークンまでのタスクに使用される場合に特に価値が高く、これは以前の Haiku モデルへのリクエストの約 90% を占めます。 100 万トークンあたりの価格 Haiku 5.5 プロンプト 100k まで / 100k 超 Haiku 4.5 Sonnet 5.5 キャッシュ読み取り $0.01 / $0.05 $0.10 $0.10 キャッシュ書き込み $0.125 / $0.625 $1.25 $2.50 入力トークン $0.10 / $0.50 $1.00 $2.00 出力トークン $0.50 / $2.50 $5.00 $10.00 安全性 アライメント。 Claude Haiku 5.5 は、Haiku 4.5 と比較して、ほぼすべての当社のアライメント評価で大幅な改善を示しています。特に、不適切な動作のインスタンスがはるかに少なくなり、不正利用への協力意欲が低下しました。モデルのシステムカードには、評価プロセスと結果がさらに詳しく記載されています。 保護機能。 その能力と一致して、Haiku 5.5 のサイバーセキュリティ保護機能は Haiku 4.5 よりも厳格ですが、他の最近のモデルに適用したものよりもやや緩やかです。サイバーセキュリティにおいては、Sonnet 5.5 の保護機能よりも広範な防御タスクを許可しますが、侵入テストや攻撃者が使用する可能性が高いその他の技術は引き続きブロックします。 Haiku 5.5 の生物学保護機能は、Sonnet 5、Sonnet 5.5、および Opus 5 と同じです。研究目的の生物学の質問は許可しますが、害を引き起こす可能性が高いと判断されるリクエストへのアクセスは制限します。より広範な生物学およびサイバー活動に取り組んでいる組織は、当社のライフサイエンス検証プログラムおよびサイバー検証プログラムに申し込むことができます。 利用可能性 Claude Haiku 5.5 は現在、Amazon Web Services、Google Cloud、Microsoft Azure を含むすべてのプラットフォームで利用可能です。Claude Platform では、開発者は claude-haiku-5-5 から始めることができます。詳細については、移行ガイドを参照してください。 今後のアップデート Claude Haiku 5.5 の新しい価格設定と並行して、さらなる改善を行っています。