AI・機械学習
Show HN: ドイツの新しい主権AIモデル Kolibri
Show HN: Germany's new sovereign AI model Kolibri (tej.as)
要約
Aleph Alphaが開発したKolibriは、ドイツと英語に対応したオープンウェイトの大規模言語モデル(LLM)です。780億パラメータを持ちながら、トークンあたり約35億パラメータしか使用しない混合専門家(MoE)アーキテクチャを採用しています。EUのAI法を念頭に設計され、ドイツ国内のインフラで開発・訓練されたことで、データプライバシーと規制遵守を重視する欧州のニーズに応える「主権AI」として位置づけられています。
全文翻訳
Kolibriは、Aleph Alphaが開発したドイツ語と英語に対応したオープンウェイトの大規模言語モデル(LLM)です。これは、780億のパラメータを持つ混合専門家(MoE)モデルで、各トークンを読み書きする際に約35億パラメータしか使用しません。2026年10月3日にApache 2.0ライセンスで公開され、重みはHugging Faceで入手可能です。訓練はドイツとフィンランドのインフラストラクチャ上でゼロから行われました。(Kolibriはドイツ語でハチドリを意味し、軽量であることが特徴のモデルとしては可愛らしい名前です。)私はドイツに住んでおり、2024年のSmashingConf New Yorkで、私がどこに住んでいるかと言うと「規制はするが、イノベーションはしない」と米国で聞いたことを会場に話しました。それは聞くのが辛く、その場で私が願ったのは、その中間、「データプライバシー、データスチュワードシップ、環境制約、エネルギー要件に関するイノベーションと規制の適切なバランス」でした。Kolibriはそれに pretty direct な回答です。ドイツのチームがEU AI法を念頭に「ゼロから」構築し、Aleph Alpha自身の評価では、両言語において比較対象となった同サイズのモデルすべてを上回っています。Kolibriを構築したAleph Alphaの皆さん、特に私の友人であるMichael Hofmannさんに心からお祝い申し上げます。この記事では、Kolibriの仕組み、強みと弱み、実行方法、そしていつ選ぶべきかについて説明します。ここに記載されているすべては、Aleph Alphaの189ページにわたる技術レポート、モデルカード、および彼らのローンチ投稿、さらに私がトークナイザーで実施した1つの実験に基づいています。
Kolibriとは何か?
Kolibri
パラメータ: 合計781億、トークンあたり34.6億(4.4%)
言語: ドイツ語および英語
コンテキスト: ネイティブで262,144トークン、1,048,576までテスト済み
ライセンス: 重みと設定ファイルはApache 2.0(Aleph Alphaはトレーニングコードと手法の権利を保持)
メモリ: 8ビット浮動小数点(FP8)で約78GBの重み
推論: 4レベル(なし、低、中、高)
ツール呼び出し: はい
知識カットオフ: 2026年6月18日
トレーニング: 約24兆トークン(そのうち5分の1以上がドイツ語)、768基のNVIDIA B200 GPUを使用
Aleph AlphaはKolibriを「主権(sovereign)」と呼んでおり、そのローンチ投稿ではそれは2つの意味を持ちます。第一に、どのように構築されたかです。「チームはドイツでモデルを構築し、ドイツとフィンランドのインフラストラクチャ上で、欧州およびドイツの法律の下で、外国の管理なしに訓練しました。」第二に、顧客が得られるものです。「デプロイメントの完全な自由と知的財産保護により、コンプライアンスは継承されたプロパティとなります。」平易な言葉で言えば、省庁や自動車サプライヤーは、自社のサーバー上でデータを外部に出すことなくモデルを実行でき、誰もモデルを変更したり停止したりすることはできません。Aleph Alphaは欧州連合の汎用AI(GPAI)行動規範にも署名しています。主権とは、外部からのものが何も入っていないという意味ではなく、モデルカード自体にも記載されています。英語のウェブテキストはGoogleのGemma 4で、ドイツ語はMistral-NeMoで、Qwen3-32Bは品質フィルターのためのラベル付けデータで言い換えられました。その後、これらのモデルが持ちうる政治的バイアスについてトレーニングデータをフィルタリングしました。これは、彼らが中国のオープンモデルで測定したものです。
Kolibriの仕組み
Kolibriは6つのアイデアが積み重なっており、それぞれがドイツ語をより安く、長く、またはより正直にするために存在します。
1. 384人の専門家、各トークンが6人を見る
通常の(密な)モデルでは、すべてのトークンがすべてのパラメータを通過します。混合専門家(MoE)モデルでは、各レイヤーには小さなサブネットワークの集まりである「専門家」と、各トークンに対してそれらをいくつか選択するルーターがあります。Kolibriは50のレイヤーを持ち、各レイヤーには384人の専門家と、すべてのトークンが通過する1つの共有専門家がいます。ルーターは各トークンを384人の中から6人にルーティングします。これが、781億パラメータがトークンあたり34.6億の実際の作業に変わる仕組みです。2024年に私は「なぜ小さな言語モデルが未来なのか」という講演を行い、「パラメータが少なく、間違いが起こる場所が少なく、より少ない計算能力を必要とする小さな言語モデル」を主張しました。私の例えは、世界のすべての医学書を読んだ医者と、血液学の専門家でした。血液の病気で前者に行くと、「知識が多すぎて、うまく対応できないかもしれません。」混合専門家モデルは、1つのモデルの中に専門家の病院を配置し、ルーターはその受付係が各トークンを適切な6人に送る役割を果たします。ただし、この例えは2つの点で異なります。専門家は「ドイツ法」のような整然としたトピックではなく、研究者がMoEモデルを調べると、多くの場合、専門家は「句読点」や「固有名詞」のようなトークンのパターンに対応しており、人間が選ぶような主題ではありません。そして、病院はたとえ6人しか診察しなくても、384人の専門家全員をスタッフとして維持する必要があるため、Kolibriは35億パラメータモデルのように計算しますが、780億パラメータモデルのメモリを必要とします。モデルカードにはっきりと書かれています。「モデル全体は、一部しかアクティブでない場合でも、メモリに保持される必要があります。」
2. 長いドイツ語の単語を読むトークナイザー
モデルは文字や単語を読むのではなく、トークン、つまり固定語彙からなるテキストの断片を読みます。これはトークナイザーが訓練されるときに選択されます。ドイツ語は単語を結合して長い複合語を作りますが、主に英語から学習したトークナイザーはそれらを断片に分割します。これは、連邦憲法裁判所のドイツ語名が、GPT-4oとGPT-5が使用するトークナイザー(OpenAIのtiktoken経由のo200k_base)とKolibriのトークナイザーで分割された例です。o200k_base(GPT-5): Bund | es | ver | fass | ungs | gericht(6トークン)Kolibri: Bundes | verfassungsgericht(2トークン)Kolibriのトークナイザーは128,000トークンを持ち、Aleph AlphaがUniBPEと呼ぶ新しいアルゴリズムで訓練されています。これはバイトペアエンコーディング(BPE)のボトムアップマージを維持し、各マージを異なるスコアリングルール(Unigram目的)で選択し、ドイツ語の単語構築方法を尊重します。レポートによると、ドイツ語テキストではGPT-5のトークナイザーよりも11.2%少ないトークンを必要とすると述べられており、これは測定された他の9つのトークナイザーの中で最高です。私はそれを自分で確認したかったので、ドイツ連邦共和国基本法(185KBの非常にドイツ語の法律テキスト)とその公式英語訳の両方に対して6つのトークナイザーを実行しました。トークナイザー | ドイツ語トークン数 | Kolibri比 | 英語トークン数 | Kolibri比
Kolibri | 35,190 | - | 39,875 | -
o200k_base (GPT-4o, GPT-5, GPT-OSS) | 41,482 | 17.9% | 39,737 | -0.3%
Qwen3.5 35B-A3B | 42,907 | 21.9% | 41,650 | 4.5%
Mistral Small 4 | 43,478 | 23.6% | 41,301 | 3.6%
Gemma 4 | 43,850 | 24.6% | 41,564 | 4.2%
法律的なドイツ語では、KolibriはGPT-5のトークナイザーよりも15%少ないトークンを必要とし、これはAleph Alpha自身の11.2%よりもさらに多いです。英語では同等でした。驚異的です。トークン数が少ないということは、同じドイツ語テキストを読み書きするのに必要なステップが少なくなり、同じコンテキストウィンドウにより多くのドイツ語を収めることができるということです。(各トークンは、Hugging Faceのtokenizersライブラリ経由で独自のtokenizer.jsonでカウントし、o200k_baseはtiktokenでカウントしました。)
3. ほとんどのレイヤーは近くしか見ない
Kolibriの50レイヤーのうち40レイヤーはスライディングウィンドウアテンションを使用しています。各トークンは、その前の512トークンしか見ません。5番目のレイヤーごとに、前のすべてを見ます。これは、主に現在の文に注意を払いながら長い契約書を読み、数ページごとにすべてについて考えるようなもので、100万トークンのコンテキストを手頃な価格に保つ理由です。そこには巧妙な詳細もあります。スライディングウィンドウレイヤーだけがトークンの位置を知っており(ロータリー位置埋め込みを通じて)、フルアテンションレイヤーは知らないため、コンテキストは追加の位置トリックなしに、訓練された262,144トークンを超えて拡張されます。Aleph Alphaはそれを1,048,576まで検証しました。私の講演「Unlocking Value with AI Today」で、私は有限コンテキストを生成AIの「ビッグスリー」問題の1つとして、ハルシネーションと知識カットオフに次いで挙げました。Kolibriはこれらすべてに対処します。100万トークンで、RULER長コンテキストテストにおいて、Kolibriのベースモデルは63.2を記録しました。これは、Qwen3.5 35B-A3Bのベースモデルの57.5と比較して高い値です。
4. ドイツ語で思考する
推論モデルは回答する前に考えます。ドイツ語のプロンプトであっても、ほとんどの場合英語で思考します。Aleph Alphaは9月24日にこの件について投稿し、「Through the Valley of Tears」と題してまとめました。彼らは約80万のドイツ語の推論例を生成し、その中で...