HN 日本語サマリー

← 一覧へ戻る
AI・機械学習

Mercury 2.5の紹介

Mercury 2.5 (inceptionlabs.ai)

88 pointsby Topfi9 コメント

要約

Inception Labsは、最新かつ最も高性能なプロダクションモデルであるMercury 2.5を発表しました。このモデルは、前モデルMercury 2と比較して品質が40%向上し、GPT-5.6 LunaやGemini 3.5 Flash-Liteなどの最先端モデルに匹敵する性能を持ちます。NVIDIA GPU上で1,107トークン/秒という高速な処理能力と、260Kトークンのコンテキストウィンドウを備え、低コストで提供されます。このモデルは、検索、音声、コーディングなどのレイテンシに敏感なワークロードで既に多数の企業に採用されています。

全文翻訳

Mercury 2.5の紹介 Read the blog Mercury 2.5の紹介 ブログ/製品 Mercury 2.5の紹介 より多くの知性とMercuryのスピード Stefano Ermon CEO 本日、私たちは最も高性能なプロダクションモデルであるMercury 2.5をリリースします。Mercury 2と比較して品質が大幅に向上しており、同じ低レイテンシ、低コストのサービングプロファイルを実現しています。Mercury 2のローンチ以来、数千人の開発者がこれを使用して構築し、数十の企業が本番環境に導入し、利用量は1桁以上増加しました。現在、検索、音声、コーディング製品のレイテンシに敏感なワークロードにサービスを提供しています。 これらのワークロードは、ベンチマークだけでは得られない、より明確なシグナルを私たちに与えてくれました。顧客からのフィードバックと本番環境での失敗事例を使用して、評価をシャープにし、トレーニングに焦点を当てました。Mercury 2.5はそのループの最初の結果です。 何が変わったか Mercury 2.5は市場で最も高性能な拡散言語モデルです。私たちの知る限り、これまでトレーニングされた中で最大の拡散言語モデルです。 品質: Mercury 2から40%の知性向上。GPT-5.6 Luna(Low)、Gemini 3.5 Flash-Lite、Claude Haiku 4.5のようなコスト最適化された最先端モデルに匹敵します。 速度: 一般的なNVIDIA GPUで毎秒1,107トークン。 コンテキスト: 260Kトークン。 価格: 入力100万トークンあたり0.20ドル、出力100万トークンあたり0.75ドル。 ローンチ時、Mercury 2.5は80%オフの入力100万トークンあたり0.04ドル、出力100万トークンあたり0.15ドルです。 機能: チューニング可能な推論、並列ツール呼び出し、スキーマアラインされたJSON。 Mercury 2のローンチ以来、私たちはInceptionがNVIDIA AIインフラストラクチャ上で拡散ベースの言語モデルをさらに進歩させているのを見てきました。Mercury 2.5の知性の向上は、NVIDIAプラットフォーム上で本番対応システムに成熟する新しいアーキテクチャの速さを反映しています。 Shruti Koparkar プロダクトシニアマネージャー、アクセラレーテッドコンピューティンググループ、NVIDIA Mercuryの本番環境での利用 検索エージェントとRAGパイプライン 1回の検索リクエストで数十回のモデル呼び出しが発生する可能性があります。検索の計画、クエリの書き換え、結果の再ランク付け、事実の構造化、ソースの要約、回答の確認などです。Mercuryは、これらの呼び出しを単一のユーザーインタラクション内に収まるほど高速に保ちます。現在、いくつかの主要な検索インフラストラクチャ企業が本番環境でこれを使用しています。 音声エージェントとインタラクティブアプリケーション 音声では、レイテンシはインフラストラクチャの詳細ではありません。それは発信者が聞く一時停止です。OpenCallは、ライブカスタマーコールを処理するAI電話エージェントを構築しています。本番ワークロードにおいて、Mercuryは中央値モデル応答レイテンシを170ミリ秒近くにまで短縮しました。 Mercuryに切り替えた後、P99応答時間は数分からわずか1秒に低下し、P50は0.4秒から0.2秒未満に低下しました。これは、私たちがこれまでに見た他のどのプロバイダーよりも大幅に高速であり、推論も含まれています。 Oliver Silverstein 共同創業者兼CEO、OpenCall 続きを読む: 電話に出るのに十分な速さの最初の推論モデル コーディングサブエージェントとアシスタント コーディングエージェントは既にワークロードをモデル間で分割しています。1つはコードを計画または記述し、他のエージェントは検索、ツールの実行、リクエストのルーティング、状態の要約、または長いセッションの圧縮を行います。これらのサポート呼び出しは何度も繰り返されるため、レイテンシとコストは急速に積み重なります。Augment Codeは、コンテキスト圧縮、モデルルーティング、MCPツール検索にMercuryを使用しています。圧縮をMercuryに移行したことで、レイテンシは約150秒から27秒に82%削減され、品質を維持しながらコストは90%削減されました。ツール検索の要約は1秒未満で返されます。 Webアプリの開発にも同じ速度が適用されます。以下のデモで、Mercury 2.5が数回のプロンプトから動作する音楽発見ログWebアプリを生成する様子をご覧ください。 Mercury VoiceとMercury Routerプレビュー Mercury 2.5と同時に、Mercury VoiceとMercury Routerのプレビューを発表します。Mercury Voiceは、レイテンシ予算が最も厳しい音声エージェント向けに最適化されたdLLMであり、タイム・トゥ・ファースト・トークン(TTFT)を170ミリ秒未満で提供します。Mercury Routerは、dLLMを使用して着信プロンプトを理解し、品質、速度、コストの最適な組み合わせを提供する最適なモデル(オープンおよびクローズドモデル)にルーティングします。 開始方法 Mercuryモデルは、Inception API、Baseten、およびOpenRouterを通じて利用可能です。エンタープライズデプロイメントは、専用容量、自動スケーリング、コンプライアンス制御、設定可能なデータ保持をサポートします。 Mercury 2.5をチャットで試す 1億無料トークンでAPIを試す APIドキュメントを読む Basetenのお客様: 既存のBasetenセットアップを通じてMercury 2.5をデプロイしてください。 Y Combinator企業: 50万ドルのデプロイメント特典を請求してください。 音声用にMercuryを評価していますか?ワークロードの適合性をテストし、サービング制約下でのパフォーマンスを検証するために協力します。お問い合わせください。 次は何ですか? 次のモデルのトレーニングは既に開始しています。これはこれまでで最大のモデルであり、数ヶ月以内のリリースを目指しています。次のモデルは、拡散モデルの速度とトークン効率を犠牲にすることなく、機能の大幅な飛躍となるでしょう。そのためには、モデルトレーニング、推論、評価、およびインフラストラクチャの進歩が必要です。もしあなたがそのような問題に取り組みたいのであれば、ぜひお話を聞かせてください。 詳細は近日公開。 製品・2026年9月8日 Mercury 2.5の紹介 製品・2026年9月8日 Mercury 2.5の紹介 製品・2026年8月11日 検索用Mercury 2: クエリあたり100回実行できる速さ 製品・2026年8月11日 検索用Mercury 2: クエリあたり100回実行できる速さ 製品・2026年7月29日 より多くのビルダー。より多くのスループット。より良いMercury 2。 製品・2026年7月29日 より多くのビルダー。より多くのスループット。より良いMercury 2。 製品・2026年9月8日 Mercury 2.5の紹介 製品・2026年8月11日 検索用Mercury 2: クエリあたり100回実行できる速さ 製品・2026年7月29日 より多くのビルダー。より多くのスループット。より良いMercury 2。 LLMの未来はここにあります 開始方法 LLMの未来はここにあります 開始方法 製品 開始方法 モデル 価格 会社 私たちについて リサーチ キャリア ブログ リソース Mercury Chat APIプラットフォーム ドキュメント インテグレーション パートナー 法的情報 利用規約 プライバシーポリシー Cookie設定 お問い合わせ セールス お問い合わせ Discord X LinkedIn © 2026 Inception 製品 開始方法 モデル 価格 会社 私たちについて リサーチ キャリア ブログ リソース Mercury Chat APIプラットフォーム ドキュメント インテグレーション パートナー 法的情報 利用規約 プライバシーポリシー Cookie設定 お問い合わせ セールス お問い合わせ Discord X LinkedIn © 2026 Inception