HN 日本語サマリー

← 一覧へ戻る
AI・機械学習

Nvidia Nemotron 3.5 Lightning および NeMo Switchyard

Nvidia Nemotron 3.5 Lightning and NeMo Switchyard (blogs.nvidia.com)

242 pointsby droidjj123 コメント

要約

NVIDIAは、AIエージェントの進化に対応するため、高効率なオープンモデル「Nemotron 3.5 Lightning」と、AIモデルのスマートルーティングライブラリ「NeMo Switchyard」を発表しました。Nemotron 3.5 Lightningは、エージェント型AIワークロード向けに最適化され、カスタマイズ可能で高速な処理能力を提供します。NeMo Switchyardは、複数のAIモデルを効率的に連携させ、タスクごとに最適なモデルを自動で選択することで、コスト削減と精度向上を実現します。

全文翻訳

AIがチャットボットから自律型エージェントへとシフトするにつれて、AIの実行場所、展開方法、進化方法を完全に制御したいという市場の要求に応えるため、オープンモデルが活用されています。本日、NVIDIAはNemotron 3モデルファミリーを拡張し、長時間稼働するエージェント型AIワークロードにおいてクラス最高の効率を誇る「Nemotron 3.5 Lightning」を発表しました。このリリースはNemotron 3 Nanoに続くもので、NVIDIAが精度と速度を向上させるオープンモデルの継続的な改善にコミットしていることを反映しています。 より大きなマルチエージェントシステム内の専門的なタスク向けに構築された、300億パラメータの混合エキスパートモデルであるNemotron 3.5 Lightningは、より賢く、より効率的なエージェント型アプリケーションの作成を支援します。さらに、NVIDIAは人気の高いエージェントツール内でスマートルーティングを行うためのオープンソースライブラリ「NeMo Switchyard」をリリースします。企業はこれを使用して、特定のニーズに基づいたルーターを構築できます。展開時、NeMo Switchyardは、開発者がアプリケーションを書き直す必要なしに、開発者自身のオープン、プロプライエタリ、NVIDIAモデルのミックス全体で、各リクエストをそのジョブに最も能力があり、適切なモデルにインテリジェントにルーティングできます。 Nemotron 3.5 LightningとNeMo Switchyardを組み合わせることで、AIの展開方法、実行場所、およびPC、ワークステーション、データセンター、クラウド全体での運用効率に対する制御が向上します。Nemotron 3.5 Lightningは、高ボリュームのエージェント型ワークフロー向けに構築された、小さくカスタマイズ可能なオープンモデルで、最先端レベルの知能を提供します。 常時稼働エージェントにはモデルシステムが必要 現代のエージェント型システム、すなわち常時稼働エージェントは、ますますモデルシステム、またはモデルアンサンブルとして機能するようになり、異なるモデルが異なるタスクに特化しています。NVIDIA Nemotronオープンモデルはこのアーキテクチャ向けに設計されています。Nemotron 3 UltraやGPT-5.6のような最先端の推論モデルがワークフローを計画・オーケストレーションする一方で、Nemotron 3.5 Lightningのようなより小さな専門モデルは、コードレビュー、ツール使用、セキュリティアラート監視、請求に関する質問への回答といったターゲットタスクを実行できます。 高ボリュームの専門タスクをNemotron 3.5 Lightningで強化 NVIDIA Nemotron 3.5 Lightningは、常時稼働エージェントを支える高ボリュームタスク向けに構築された、完全にカスタマイズ可能なオープンモデルです。Nemotron Coalitionのメンバーからの貢献を受けて開発され、メンバーはモデルの進歩を支援するために評価方法論、推論ソフトウェア、データセットを提供しました。このモデルは、他の同クラスのモデルと比較して最大4倍高速な出力速度を実現し、エージェント型タスクの完了を30%高速化します。また、オープンでカスタマイズ可能であるため、NVIDIA NeMoを使用して組織固有のドメインデータ、ツール、ワークフローで簡単に後処理トレーニングを行い、専門タスクの精度を向上させることができます。 PinchBenchベンチマークは、Nemotron 3.5 Lightningが他の同クラスのモデルと比較して、最先端レベルの精度で、より高速なエージェント型タスク完了を実現することを示しています。各業界のAIリーダーは、サイバーセキュリティ向けのCrowdStrike、法律サービス向けのHarvey with Trajectory、コードレビュー向けのCodeRabbit with Basetenなど、ワークロードのためにNemotron 3.5 Lightningをカスタマイズしており、ドメイン固有のエージェント型タスクの精度向上に貢献しています。さらに、Lila Sciencesは物理科学および生命科学全体のエージェント型タスクの推論能力向上を支援しており、Fastino Labsはモデルをカスタマイズして、ソフトウェア開発、金融、ヘルスケアのワークロードで最先端の精度を達成しています。企業は、エージェント型ワークフローにおける専門タスクで最先端の精度を達成するために、Nemotron 3.5 Lightningをカスタマイズしてきました。 Nemotron 3.5 Lightningは、組織にプライバシーと展開に関する制御も提供します。NVIDIA RTX PC、NVIDIA DGX Spark、NVIDIA DGX Station、NVIDIA Jetsonを含むローカルAIシステムで実行でき、ユーザーが既存のインフラ投資を最大化するのに役立ちます。また、エンタープライズユースケースのために、エッジAIデバイス、NVIDIA RTX PROワークステーション、データセンター、クラウド環境全体にスケールアップすることも可能です。そして、Nemotron 3.5 Lightningは、高速応答を必要とする高ボリュームの専門タスクのために、ローカルまたはオンプレミスで実行できます。また、すべてのNemotronのリリースと同様に、NVIDIAはライセンスで許可される範囲でトレーニングデータと技術の大部分を公開しており、トレーサビリティ、監査、および他のモデルのトレーニングを可能にします。Lightningに加え、NVIDIAはコーディングエージェント機能の後処理トレーニングに使用されるエージェント型強化学習データセット「Nemotron-RL-Agentic-Terminal-Pivot」をリリースします。 モデルルーティングによるAIアプリの効率向上 一部のモデルはコーディングに優れ、一部は推論に優れ、一部は軽量タスクに優れ、一部はプライバシーと効率を高めるためにローカル実行に最適化されています。顧客が1つのデフォルトモデルに依存すると、過剰な支出をするか、品質を失う可能性があります。手動でルーティングを管理すると、統合作業となり、展開が遅れる可能性があります。NVIDIA NeMo Switchyardは、AIエージェント向けのオープンソースモデルルーティングライブラリです。この技術は、特定のニーズに基づいて、エージェントワークフローの各ステップで最も能力があり、効率的なモデルにプロンプトを自動的にルーティングします。エージェントアプリケーション開発者は、品質、レイテンシ、コスト要件などの優先順位に合わせて、さまざまなルーティングアルゴリズムでルーターを調整または変更できます。 モデルシステムでは、企業はトークンエコノミクスを改善した強力なAIエージェントを作成できます。内部ベンチマークによると、NeMo Switchyardは最先端レベルの精度を維持しながら、Opus 4.8単独の約3分の1までタスク完了コストを削減しています。NVIDIAの内部ベンチマークによると、NeMo Switchyardは最先端レベルの精度を維持しながら、Opus 4.8単独の約3分の1までタスク完了コストを削減しています。 NVIDIAは、AIエコシステム全体のパートナーと協力して、開発者がすでに使用しているツールやプラットフォームにインテリジェントなモデルルーティングをもたらしています。 Boomi: 5つのルーティング機能でSwitchyardを評価し、100%のドメインルーティング精度を達成し、トラフィックの59%を5倍高速なファインチューニング済みモデルに送信し、後続ターンのレイテンシを21%削減しました。 Cadence: ChipStack AI Super Agentを使用して、フォーマル検証ユースケースで効率を9.9%向上させました。 Classmethod: NeMo Switchyardを使用して、opencodeおよびFireworksワークロードを内部で実行しており、初期テストでは品質を維持しながらコストを27%削減しました。 Cognition: NVIDIA内部使用のために、NVIDIA NeMo SwitchyardステージングルーターをDevin Desktopに統合し、すべてのリクエストを単一の基盤となる最先端モデルにルーティングした場合と比較して、平均コストを28%削減しながら、FrontierCode Mainで最先端に近いパフォーマンスを達成しました。 Kong: Kong AI Gatewayを通じて、ネイティブにNeMo Switchyardによるルーティングを提供しています。 LangChain: NeMo Switchyardを使用し、最先端モデルへの呼び出しを7%に抑え、精度トレードオフを6%にすることで、145のマルチターンDeep Agentsタスクでコストを74%削減しました。 LiteLLM: 開発者が既存のスタックを変更することなくこれらのメリットにアクセスできるように、NeMo Switchyardをプロキシレイヤーのプラグインとして追加しています。 Nous Research: エージェント効率を向上させるための設定が容易なルーティングシステムを開発者に提供するために、NeMo SwitchyardをHermesに統合しました。 Ramp: Ramp SWE-Benchで、最先端モデルのパフォーマンスに匹敵させながら、コストを58%、実行時間を33%削減するためにNeMo Switchyardを使用しました。 Siemens: Fuse EDA AI Agentの効率向上をベンチマーク中です。 Nemotron 3.5 Lightningは、Hugging Face、ModelScope、OpenRouterで利用可能であり、build.nvidia.comではNVIDIA NIMマイクロサービスとして、また幅広いNVIDIA Cloudパートナー、後処理プラットフォーム、推論プラットフォーム、クラウドサービスプロバイダーのエコシステムを通じて利用できます。NeMo SwitchyardはGitHubで利用可能であり、まもなくパートナープラットフォームでも提供される予定です。