AI・機械学習
Kolibriが着陸:主権を持つオープンウェイトモデル
Kolibri Has Landed: A Sovereign Open-Weight Model (aleph-alpha.com)
要約
Aleph Alphaは、新しい大規模言語モデル「Kolibri」を発表しました。このモデルは、780億の総パラメータと30億のアクティブパラメータを持ち、最大100万トークンのコンテキスト長をサポートします。特にドイツ語、推論、数学、エージェント行動に特化しており、EUのAI法やGDPRなどの規制に準拠した、主権を重視するエンタープライズおよび政府機関向けのミッションクリティカルな用途を想定しています。モデルの重みはHugging Faceで公開され、Apache 2.0ライセンスで利用可能です。
全文翻訳
リサーチ
Aleph Alpha
2026年3月10日
Kolibriが着陸:主権を持つオープンウェイトモデル
ドイツ再統一の日に、私たちは新しいモデル「Kolibri」をリリースします。Kolibriは、780億の総パラメータと30億のアクティブパラメータを持つ英語・ドイツ語のMixture-of-Experts Transformerです。最大100万トークンのコンテキスト長をサポートします。モデルはHugging Faceでフルウェイトとともにダウンロードでき、Apache 2.0ライセンスの条件で利用できます。
Kolibriは、モデルトレーニングの継続的なイテレーションの結果です。まず、モデルトレーニングパイプラインを構築し、より短い65kトークンのコンテキストウィンドウを持つ300億総パラメータ、30億アクティブパラメータのKolibri Originを構築して検証しました。Kolibriは同じパイプラインを通過しました。データ取り込みとキュレーションから、アブレーション、事前トレーニング、事後トレーニング、最終評価までです。これにより、数百ものアブレーション実験と、ハードウェアの故障やデータ接続の切断時に人が介入する必要のない安定した事前トレーニングが可能になりました。トレーニングメトリクスを継続的に監視し、カスタムベンチマークの標準化された監視を行いました。このパイプラインの構築とイテレーションに費やした時間は貴重な投資でした。KolibriがKolibri Originよりもはるかに優れていること、そしてリリースまでの期間が短いことから、その価値を実感しています。
Kolibriは、公共行政、産業、航空宇宙を含む規制された分野での主権を持つミッションクリティカルな作業のために構築された、専門化された言語モデルです。私たちは、ドイツ語、推論、数学、エージェント行動、および顧客が本番環境で必要とするその他の機能のためにKolibriを専門化しました。この専門化の目的は、顧客の特定のユースケースでのパフォーマンスを最適化することでした。専門化を通じて、顧客はAI運用においてコンテキスト化されたパフォーマンスを達成し、その経済的影響を監視できるため、ROIは測定可能であり続け、時間とともに増加します。
専門化だけでは十分ではありません。主権も同様に重要です。主権は、私たちにとって、モデルの構築方法と、それが顧客にどのように移行するかという2つの次元を組み合わせます。私たちは、完全なサプライチェーンの整合性を提供し、データ取り込みから事前・事後トレーニング、最終評価までのすべての決定を説明します。私たちは透明性を提供します。顧客は、デプロイメントの自由と知的財産権の安全性を完全に享受できるため、コンプライアンスはモデルの組み込まれたプロパティとなります。詳細については、技術レポートをお読みください。
Kolibriが提供するもの
私たちは、顧客が必要とする特定のドメイン固有の言語、規制、および手続き上の現実を考慮して、幅広い分野でのパフォーマンスのためにKolibriを最適化しました。その小さく効率的なサイズは、顧客が内部データをサードパーティの推論サービスに送信することなく、オンプレミスで効率的に実行できる柔軟性を提供します。このセクションのスポットライトでは、セクション「Kolibriを高速で構築した方法」でそれらを説明する前に、モデルの機能を紹介します。
エンタープライズおよび政府向けの基盤となる機能
Kolibriでは、780億の総パラメータのうち30億のアクティブパラメータを使用して、モデルの機能とデプロイメントコストの間のトレードオフを最適化しています。Kolibriは、英語とドイツ語の両方で、品質とサービングコストの最適な組み合わせを示すパレートフロンティア上に位置しています。パレートフロンティアは経済学の概念であり、2つの目的の最良の達成可能な組み合わせを示し、一方を改善すると他方をいくらか犠牲にする必要があります。比較されたモデルの中で、同じサービングコストでより多くの品質を提供するモデル、またはより低いコストで同じ品質を提供するモデルはありません。
[グラフ: 平均ベンチマークスコア[%] vs. サービングコスト(推論速度)]
数学、コーディング、グラウンディング、および長文コンテキストタスク全体で、Kolibriは、Nemotron 3 Superのようなアクティブパラメータ数の最大4倍のモデルに匹敵します。
[表: 各ベンチマークにおけるKolibri、Kolibri Origin、その他のモデルのスコア]
[グラフ: 英語(左)とドイツ語(右)でのポストトレーニングモデルのパフォーマンス vs. スループット。メトリクスは、デコードされたテキスト/秒とGPUあたりの加重なし平均ベンチマークスコアを示します。右上に近いほど良いです。]
[表: 各ベンチマークにおけるKolibri、Kolibri Origin、その他のモデルのスコア(詳細)]
Kolibriの基盤となる機能。Kolibriは、数学、コード、長文コンテキスト、エージェント機能、および知識全体で競争力のあるパフォーマンスを持つ、バランスの取れた汎用モデルです。ベンチマークスコアは、0〜100の共有スケールで示され、高いほど良いです。
リアルワールドアプリケーションのためのコンテキスト化されたパフォーマンス
公開ベンチマークでは、専門分野のニーズを捉えきれないため、ドイツの公共部門、航空、製造、自動車産業など、顧客にとって重要な垂直分野のために独自の内部評価スイートを開発しました。各スイートは、これらの分野で要求されるスキル、ワークフロー、およびエッジケースを反映しており、ペアになった合成トレーニング環境により、顧客データを使用せずにこれらの評価に対してKolibriを改善できます。セクション「コンテキスト化されたパフォーマンス」で詳細をご覧ください。
[グラフ: 内部顧客プロキシベンチマークにおけるコンテキスト化されたパフォーマンス。チェックポイントは単一の評価、線は毎日の平均評価を示します。パフォーマンスはすべての垂直分野で向上しています。]
ドキュメントに基づいた回答。
Kolibriは、棄権データとMerlin-Arthurプロトコルでトレーニングされました。その結果、コンテキストに答えがない場合は「わかりません」と言うようにトレーニングされています。顧客はこの機能を高く評価し要求しているため、棄権の精度を継続的に追跡および検証しています。詳細は「グラウンディング」セクションで提供します。
ネイティブドイツ語および英語モデル。
バイリンガルなドイツ語/英語トークナイザーを開発し、モデルのトレーニングプロセス全体で有機的なドイツ語データを組み込むことに注力したため、事前トレーニングトークンの21.3%がドイツ語です。翻訳されたテキストはソース言語の文化的指紋を帯びる傾向があるため、翻訳は控えめ(全体で6%)に使用しました。その結果、ドイツ語を読んだ英語モデルではなく、設計上バイリンガルなモデルが誕生しました。詳細は「ドイツ語事前トレーニングデータ」および「専門化されたトークナイザー」セクションをご覧ください。
設計による制御とコンプライアンス:顧客の主権の維持
EU AI法、一般目的AIコードオブプラクティス、GDPRを最初から念頭に置いてKolibriを構築しました。特に著作権法は、信頼できる技術への取り組みの中心でした。モデルの重みとトレーニングデータのキュレーションについて透明性を保つことで、開発の背後にある決定が可視化されます。推論トレースを通じて、モデルが特定の回答に至った経緯を説明可能にします。Merlin-Arthurプロトコルにより、モデルは信頼性をグラウンドします。コンテキストが回答をサポートしない場合、Kolibriは回答を控えます。私たちのチームは、ドイツでモデルを構築し、ドイツとフィンランドのインフラストラクチャで、欧州の