HN 日本語サマリー

← 一覧へ戻る
AI・機械学習

Quasar 438B: ヨーロッパをリードするAIモデル

Quasar 438B: Europe's Leading AI Model (multiversecomputing.com)

143 pointsby amunozo93 コメント

要約

Multiverse Computingは、エンタープライズ規模のエージェントやコーディング向けに設計された、ヨーロッパをリードするAIモデル「Quasar 438B」を発表しました。このモデルは、Artificial Analysis Intelligence Indexで43という高いスコアを記録し、速度と長文コンテキスト処理能力にも優れています。API経由で利用可能で、英語とスペイン語をサポートしています。

全文翻訳

Quasar 438Bは、エンタープライズ規模のエージェントやコーディングのために構築された当社のフラッグシップ推論モデルです。Multiverse Computingがリリースする最初の大型モデルであり、英語とスペイン語で動作し、Artificial Analysis Intelligence Indexで43という、この分野におけるヨーロッパのモデルとしては最高のスコアを記録しています。 Intelligence Index v4.1.1は、GDPval-AA v2、τ³-Banking、Terminal-Bench v2.1、SciCode、Humanity's Last Exam、GPQA Diamond、CritPt、AA-Omniscience、AA-LCRの9つの評価を組み合わせています。Quasarの43というスコアは、30のMistral Medium 3.5、38のNVIDIA Nemotron 3 Ultra、42のInklingを上回り、この分野をリードするClaude Opus 5の63に次ぐものです。 Quasarは知的なだけでなく、高速でもあります。思考時間を含めて500トークンを15.3秒で返します。比較対象の中で、これより高速なモデルは3つだけで、そのうちインデックスでより高いスコアを持つのはGemini 3.7 Flashのみです。Quasarを上回るスコアを持つモデルのうち、25秒未満で回答するのは2つだけです。残りは38秒から156秒かかります。 Multiverse Computingは、AIをより効率的で展開可能なものにすることで地位を確立してきました。Quasarは、その作業を400B以上のパラメータクラスにもたらします。これは、通常そのクラスが持つ遅延なしに、計画、ツールの使用、コード実行、および大規模なコンテキストを必要とするマルチステップタスクのための推論モデルです。 このモデルはCompactifAI APIを通じて利用できるため、チームはインフラストラクチャを構築せずにテストできます。 最もスコアの高いヨーロッパのモデル 図1. Artificial Analysis Intelligence Index v4.1.1、9つの評価の複合。高いほど良い。 Quasarは複合インデックスで43を記録しました。これはMistral Medium 3.5より13ポイント、1120億パラメータを持つNemotron 3 Ultraより5ポイント上です。 最先端の速度 図2. エンドツーエンドの応答時間:500トークンを出力するまでの秒数(推論時間を含む)。低いほど良い。 Quasarは500トークンの応答を15.3秒で完了します。比較対象の中で、これより高速な3つのモデルは、9.4秒のNemotron 3.5 Lightning(インデックススコア24)、10.8秒のGemini 3.5 Flash-Lite(インデックススコア37)、11.5秒のGemini 3.7 Flash(インデックススコア56)です。そのうち、より高速でかつより高機能なのは最後の1つだけです。 逆に考えると、その差はさらに広がります。Quasarは43を記録し、15.3秒かかります。Mistral Medium 3.5は30を記録し、18.8秒かかります。Nemotron 3 Ultraは36を記録し、25.7秒かかります。Inklingは42を記録し、Quasar 438Bの2倍以上の48.3秒を必要とします。 Mistral Medium 3.5との比較では、両方の軸で一方向の差があります。Quasarはより高いスコア(43対30)を記録し、より速く(15.3秒対18.8秒)回答します。 長文コンテキスト推論 図3. AA-LCRスコア。高いほど良い。 QuasarはAA-LCRで75.0を記録しました。これは、長いドキュメントに分散した情報を抽出、接続、推論する能力をテストするものです。これはGrok 4.6(高)の75.0と同等であり、Claude Opus 5の75.7およびQwen3.8 2.4T A95Bの75.3に1ポイント以内です。Nemotron 3 Ultraより4.0ポイント、Mistral Medium 3.5より9.7ポイントリードしています。 長文コンテキスト処理は、エンタープライズリサーチ、ドキュメント分析、エージェントワークフローの基盤であり、Quasarが最先端グループに最も近づく分野です。 エージェントコーディングとターミナル作業 図4. Terminal-Bench v2.1スコア。高いほど良い。 QuasarはTerminal-Bench v2.1で69.3を記録しました。これは、エージェントを実際のターミナル環境で動作させるテストです。Mistral Medium 3.5より18.7ポイント、Nemotron 3 Ultraより15.4ポイントリードしていますが、Claude Opus 5が89.1を記録する最先端グループには及びません。これはQuasarにとって最も改善の余地がある評価であり、次の作業の焦点となります。 4つの結果を1つのビューで 表1. 4つのArtificial AnalysisチャートにおけるQuasar 438B。出典:Artificial Analysis。 エンタープライズ規模のエージェントとコーディングのために構築 Quasarは、ソフトウェア開発エージェント、テクニカルコパイロット、リサーチシステム、ワークフロー自動化を実行する組織のために構築されています。Terminal-Benchと長文コンテキストの結果は、コンテキストを保持し、アクションを調整し、マルチステップタスクを処理する必要があるエージェントをサポートします。応答時間は、それらのループをバッチジョブではなくインタラクティブな製品内に収まるのに十分な速さに保ちます。 英語とスペイン語のサポートにより、Quasarは、単一言語へのデプロイメントを狭めることなく推論を必要とするヨーロッパおよび国際的な企業にとって実用的な基盤となります。チームは、精度、コンテキスト、および信頼性の高いタスク完了が結果を決定するあらゆる場所で、エンジニアリング、オペレーション、およびナレッジワーク全体でQuasarを活用できます。 Quasarのさらなるアップデートが予定されています。ご期待ください。 開始する CompactifAI API。サインアップしてリクエストの送信を開始してください:dashboard.compactif.ai Artificial Analysis。ベンチマークをチェックしてください お問い合わせ。business@multiversecomputing.comまでチームにご連絡ください。