HN 日本語サマリー

← 一覧へ戻る
AI・機械学習

ドイツのAIコンソーシアムがベンチマークでトップを記録したオープンな30Bモデル「Soofi S」をリリース

German AI consortium releases Soofi S, an open 30B model that tops benchmarks (the-decoder.com)

87 pointsby amai18 コメント

要約

ドイツの研究コンソーシアムが、Deutsche TelekomのAIクラウドインフラで完全にトレーニングされたオープンソース言語モデル「Soofi S」を発表しました。このモデルは、トークンごとに31.6億パラメータのみをアクティブにするリソース効率の高いハイブリッドアーキテクチャを採用しており、長い入力でも処理速度を一定に保ちます。ドイツ語のトレーニングデータに重点を置いたSoofi Sは、ドイツ語、英語、プログラミングタスクのベンチマークで、Olmo 3 32BやApertus 70Bなどの他の完全にオープンなモデルを上回っています。

全文翻訳

ドイツのAIコンソーシアムがベンチマークでトップを記録したオープンな30Bモデル「Soofi S」をリリース Jonathan Kemper 2026年7月13日 Nano Banana Pro THE DECODER 提供 主要ポイント ドイツの研究コンソーシアムが、Deutsche TelekomのAIクラウドインフラで完全にトレーニングされたオープンソース言語モデル「Soofi S」をリリースしました。このモデルは、トークンごとに31.6億パラメータのみをアクティブにするリソース効率の高いハイブリッドアーキテクチャを採用しており、非常に長い入力でも処理速度を一定に保ちます。ドイツ語のトレーニングデータに重点を置いたSoofi Sは、ドイツ語、英語、プログラミングタスクのベンチマークで、Olmo 3 32BやApertus 70Bなどの他の完全にオープンなモデルを上回っています。 検索 更新 – 2026年7月15日 過学習の申し立てに関する声明を追加 2026年7月15日の更新:リリース後、批評家はSoofi Sが古典的なChinchillaスケーリング則の基準で重度に「過学習」していると主張しました。Google DeepMindは2022年にこれらの法則を発表し、固定された計算予算に対してモデルサイズとトレーニングデータをどのようにバランスさせるかを説明しました。彼らが特定したスイートスポットは、パラメータあたり約20トークンでした。Soofi Sはこの比率をはるかに超えています。約27兆トークンと300億パラメータで、数百対1の比率になります。トークンごとにアクティブなパラメータが32億しかないことを考慮すると、比率は数千対1に跳ね上がります。プロジェクトの技術リーダーシップの一部であるMichael Fromm氏は、その批判に反論しています。彼は、これらのルールはMixture-of-Experts(MoE)アーキテクチャには単純に適用されないと主張しています。「古いモデルのスケーリング則がMoEアーキテクチャにはもはや適用されないことを示す新しい研究があります」とFromm氏は述べています。その理由は、MoEモデルの構築方法にあります。個々のエキスパートは同じドキュメントを見ることから恩恵を受けるため、大規模で高品質なデータセットでの繰り返しデータは、密なモデルの場合よりも問題になりにくいです。比較として、Fromm氏はNvidiaが独自のモデルを最大25兆トークンでトレーニングしたことを指摘しています。 オリジナルの記事(2026年7月13日): Soofi Sは、ミュンヘンにあるDeutsche TelekomのIndustrial AI Cloudで完全にトレーニングされた最初の大規模言語モデルの1つです。オープンな30Bモデルは、軽量なハイブリッドアーキテクチャと、意図的にドイツ語に重点を置いたトレーニングミックスを使用しています。KI Bundesverband(ドイツAI協会)が調整したドイツの研究コンソーシアムは、Soofi S 30B-A3Bをリリースしました。これは、その事前トレーニングレポートによると、完全にオープンなモデルの中で英語とドイツ語のベンチマークで最高のスコアを達成し、以前のリーダーであるOLMo 3 32BやApertus 70Bを上回っています。 そのハイブリッドMamba-Transformerアーキテクチャのおかげで、Soofi SはApertus 70Bのような密なモデルが急激に低下するのに対し、非常に長いコンテキストでもスループットを維持します。 画像:Soofi 長いコンテキストのために構築された軽量アーキテクチャ Soofi SはMixture-of-Expertsモデルです。合計で316億のパラメータを含んでいますが、生成されるトークンごとに約32億しかアクティブになりません。これにより、その計算コストは、従来の30Bモデルよりも3Bモデルに近くなります。コンソーシアムは、NvidiaのNemotron 3 Nanoのアーキテクチャをそのまま採用しています。これは、Mamba-2レイヤーと標準的なアテンションレイヤーを組み合わせたハイブリッド設計です。典型的なトランスフォーマーとの主な違いは、メモリの動作です。従来のモデルでは、アテンション計算のために前のトークンを格納するKVキャッシュは、コンテキスト長に比例して増加します。長い入力と多数の並列リクエストでは、そのキャッシュの再ロードがボトルネックになります。Soofi Sの52レイヤーのうち、6つだけがこのようなキャッシュを維持しています。 画像:Soofi 実用的な成果は、生成スループットに現れます。コンテキスト長40,000トークン、32の並列リクエストで、Soofi Sは、140億から240億パラメータの範囲の密なモデルよりも、GPUあたり毎秒約8倍のトークンを生成します。従来のモデルではコンテキストが長くなるにつれてスループットが大幅に低下しますが、Soofi Sは4,000から256,000トークンの範囲でほぼフラットな状態を維持します。測定で同様の動作を示す唯一のモデルは、AlibabaのQwen3.5 35B-A3Bであり、これもハイブリッドアーキテクチャを使用しています。 ドイツを中心に構築されたトレーニングミックス コンソーシアムは合計で約27兆トークンを処理し、3つのフェーズに分割しました。最初のフェーズでは、モデルは、Web、コード、数学、およびドメイン固有のテキストの広範なミックスから抽出された約20兆トークンから言語の基本を学習します。次に、以前に学習したパターンをシャープにするために設計された、より高品質なソースからの約6兆トークンで第2フェーズが行われます。その後、短い第3フェーズで、最大100万トークンの非常に長いドキュメントでトレーニングすることにより、コンテキストウィンドウが拡張されます。3つのトレーニングフェーズ全体で、データミックスはより高品質なソースとドイツ語データの割合が大幅に増加する方向にシフトします。 画像:Soofi ドイツ語への意図的な焦点が中心です。最初のフェーズでは、ドイツ語はトレーニングミックスの7.2パーセントを占めます。第2フェーズでは、その割合は15.3パーセントに上昇します。NvidiaのNemotron参照レシピでは、英語以外のすべての言語を合わせても約5パーセントしか占めません。データソースとして、コンソーシアムはHPLTからのドイツ語Webテキスト、オープンライセンスのGerman Commonsコーパス、FinePDFsおよびFineWikiのドイツ語部分、そして916のドイツの出版物からの1億9300万の記事を含む商用ライセンスのGeniosコーパスを組み合わせています。機械翻訳されたドイツ語テキストと合成生成されたドイツ語テキストがミックスを完成させます。 ドイツ語と英語の両方でトップのオープンモデルスコア レポートによると、16の他のオープンモデルとの評価において、Soofi Sはドイツ語と英語の両方の総合スコアで、すべての完全にオープンなモデルをリードしています。これには、Allen Institute for AIのOLMo 3 32Bや、ETH ZurichとEPFLのApertus 70Bが含まれます。すべてのヨーロッパの主権ベースラインと比較して、このモデルは、ドイツ語のベンチマークスイート全体で、時には2桁の差で上回っています。完全にオープンソースのモデルの中で、Soofi Sは、Apertus 70Bのようなはるかに大きなモデルと比較しても、すべてのカテゴリでトップの座を獲得しています。 画像:Soofi コードベンチマークでは、Soofi SはHumanEvalで73.8パーセント、MBPPで70.2パーセント、ドイツ語MBPPバリアントで84.2パーセントのスコアを記録しており、オープンソースの競合他社の中で最高の成績を収めています。ドイツ固有の地域知識テストであるINCLUDE-DEでは、Soofi Sは61.2ポイントで、より大きなQwen3.5 35B-A3B(76.5)およびGemma 3 27B(65.6)と並んでトップタイです。Nemotronベースラインと比較して、ドイツ語のデータレシピは、英語のパフォーマンスを犠牲にすることなく、言語能力を15.1ポイント、科学テストGPQA-Diamondを9.6ポイント向上させます。Soofi Sは、比較グループのすべてのドイツ語ベンチマークでトップの座を獲得しており、時には2桁の差をつけています。 画像:Soofi Soofi Sは、ドイツの競技数学ではそれほど得意ではなく、Minerva MATH-DEで56ポイントを記録しており、Qwen3.5 35B-A3B(76.5)やGemma 3 27B(65.6)を大きく引き離しています。また、NaturalQuestionsでのオープンな事実検索でも遅れをとっています。後者は、おそらく30億のアクティブパラメータしか持たないことに起因しており、これは密な27Bモデルよりも少ないワールドナレッジしか格納できません。より大きなオープンウェイトモデルと比較して、Soofi Sは競争力を維持し、アーキテクチャ的に同一の参照モデルであるNemotron 3 Nanoを一貫して上回っています。 画像:Soofi RULERの長コンテキストテストも特定の弱点を明らかにしています。モデルが長いテキストから頻繁に出現する単語を抽出する必要がある場合、Soofi Sのヒット率は32,000トークンを超えるコンテキストで約3パーセントに低下しますが、比較対象のNemotronモデルは依然として60〜64パーセントを管理しています。著者らは、長コンテキストのトレーニングデータに多くの長いドキュメントが含まれているが、抽出タスク用に設計された合成データが不足していることをその原因として挙げています。残りの12のRULERタスクでは、両モデルはほぼ同じパフォーマンスを示します。 主権インフラと文書化されたオープン性 トレーニング実行は3月から5月にかけて、ミュンヘンのDeutsche TelekomのIndustrial AI Cloudにある最大512のNvidia B200 GPUで実施され、合計約253,000 GPU時間でした。レポートによると、この施設は...