AI・機械学習
Bonsai 2 27B: 9倍小さいフットプリントでほぼロスレスな圧縮を実現
Bonsai 2 27B: Near-Lossless Compression in a 9x Smaller Footprint (prismml.com)
要約
PrismMLは、新しいマルチモーダルモデル「Ternary Bonsai 2 27B」を発表しました。このモデルは、元のフルプレシジョンモデルと比較して9倍小さいフットプリント(5.9GB)でありながら、ベンチマーク性能の98.2%を維持しています。これにより、ローカルデバイスでの高度なAIタスク実行が可能になり、スループットとエネルギー効率も向上しています。
全文翻訳
LAUNCH1001011100 11010 1 001
すべてに戻る
Bonsai 2 27Bを発表: 9倍小さいフットプリントでほぼロスレスな圧縮を実現
2026年9月17日 • PrismML
2ヶ月前、私たちは最初のBonsai 27Bモデルをリリースし、27Bクラスのマルチモーダルモデルがローカルデバイスで効率的に実行できるように圧縮できることを示しました。本日、私たちはこれまでで最も高性能なモデルであるTernary Bonsai 2 27Bをリリースします。
Qwen3.8 27BをベースにしたTernary Bonsai 2 27Bは、Bonsaiシリーズに、より強力な推論、コーディング、ビジョン、エージェント機能を、その特徴であるデプロイメントプロファイル(劇的に小さいメモリフットプリント、高いローカルスループット、優れたエネルギー効率)を維持しながらもたらします。
Ternary Bonsai 2 27Bは、3値(−1, 0, +1)の重みとFP16のグループごとのスケーリングを使用しており、1つの重あたり実効1.76ビット、モデル全体のフットプリントは5.9GBです。低ビット表現は言語モデル全体にエンドツーエンドで適用されます。262Kトークンのコンテキストウィンドウ、マルチモーダルなテキストと画像の入力をサポートし、Apache 2.0ライセンスでリリースされます。
フルプレシジョンの対応モデルと比較して、Ternary Bonsai 2 27Bは9倍以上小さく、集計ベンチマークパフォーマンスの98.2%を維持しています。このレベルの維持率であれば、圧縮はデプロイメントの解除となります。ほぼ同じ能力を、はるかに多くの場所で実行できるフットプリントで提供できます。
最初のBonsai 27Bリリースからの変更点
最初のBonsai 27Bリリースは、27Bクラスのインテリジェンスをローカルデバイスで実行するための実用的な方法を提供する重要なマイルストーンでした。Bonsai 2 27Bは、次のステップ、つまり実際のローカルアプリケーションに必要なモデル品質とランタイムパフォーマンスの向上に焦点を当てています。前世代のBonsai 27Bと比較して、Bonsai 2 27Bは以下をもたらします。
より強力なベースモデル、Qwen3.8 27B
フルプレシジョンモデルに対する集計能力維持率が98.2%に向上
推論、コーディング、ビジョン、長期間エージェントパフォーマンスの向上
同じデプロイメントポイントでのより高い能力
推論、数学、コーディング、指示追従、ビジョン、エージェントツールの使用を網羅するベンチマークスイート全体で、Ternary Bonsai 2 27Bは83.9を記録し、Qwen3.8 27Bの集計パフォーマンスの98.2%を維持しています。
能力 | Ternary Bonsai 2 27B | Qwen3.8 27B | Qwen3.6 27B
---|---|---|---
エージェント&ツール呼び出し | 77.57 | 79.74 | 80.05
コーディング | 81.58 | 82.17 | 82.57
指示追従 | 82.66 | 81.25 | 74.53
知識&推論 | 83.95 | 86.66 | 84.71
数学 | 96.57 | 97.06 | 94.64
ビジョン | 78.59 | 81.64 | 79.82
全体 | 83.9 | 85.4 | 83.6
図I: Ternary Bonsai 2 27B(思考モード)とフルプレシジョンのQwen3.8 27BおよびQwen3.6 27Bベースラインとのベンチマークスコア比較。各ベンチマークの詳細結果はホワイトペーパーに記載されています。
重要な結果は、単に集計スコアだけでなく、能力がどこで維持されているかです。コーディングエージェント、ツール使用システム、マルチモーダルワークフロー、長期間タスクは、モデルの劣化に特に敏感です。なぜなら、小さなエラーが多くのステップで累積する可能性があるからです。Bonsai 2 27Bは、メモリフットプリントのごく一部で動作しながら、これらの領域におけるフルプレシジョンモデルのパフォーマンスの多くを維持しています。
フルプレシジョンモデルやその他の低ビット代替モデルと比較して、Bonsai 2 27Bはインテリジェンス密度において際立っています。多くの低ビット代替モデルは、コーディング、ビジョン、またはエージェントツールの使用において意味のある能力を犠牲にすることでしかデプロイ可能になりません。Bonsai 2 27Bは、より高い能力とより低いメモリ使用量の両方に向けてフロンティアを押し広げています。
図II: 同じパラメータクラスの他のモデルと比較したTernary Bonsai 2 27Bのインテリジェンス密度(GBあたり)。
デモI: NVIDIA GeForce RTX 5090でTernary Bonsai 2 27Bを搭載したClineによるコーディングエージェント。
デモII: NVIDIA GeForce RTX 5090でTernary Bonsai 2 27Bモデルを搭載したコンピューター使用。
‹›
Bonsai 2 27Bにより、ローカルモデルは実際の知識作業を引き受けることができます。コーディングエージェントループ、コンピューター使用ワークフロー、プライベートドキュメント分析、マルチモーダルデバッグ、およびローカルモデルが機密性の高いタスクや高頻度のタスクを処理し、選択的にクラウドにエスカレーションするハイブリッドオーケストレーションなどです。
スループットとエネルギー効率
Ternary Bonsai 2 27Bは、NVIDIA GeForce RTX 5090で最大143トークン/秒、M5 Maxで46.8トークン/秒に達します。RTX 4090では、Ternary Bonsai 2 27Bはわずか0.714 mWh/トークンしか消費せず、フルプレシジョンで実行される8Bモデルよりも40%エネルギー効率が高くなっています。
コーディングアシスタントにとって、より高いスループットは、より速い編集・デバッグループを意味します。マルチモーダルエージェントにとって、それはスクリーンショット、ドキュメント、ツール呼び出しのより速いイテレーションを意味します。プライベートなローカルワークフローにとって、より良いエネルギー効率は、同じデバイスでより有用な推論が可能になること、バッテリー寿命が長くなること、そしてクラウドに常に呼び出すことなくバックグラウンドで利用可能であり続けるアシスタントへのより現実的な道筋を意味します。
このリリースが重要な理由
Ternary Bonsai 27Bと比較して、新しいTernary Bonsai 2 27Bは、フルプレシジョンモデルとの維持率のギャップを95%から98%以上に縮小しました。これは、現在のリリースを実質的に「ロスレス」にする大幅な改善です。これは、低ビットモデルがAIを展開するための最良の方法となり得るという考えをさらに強固なものにします。これは、ローカル推論をはるかに超える影響を与えます。低ビットモデルは、デバイス、ワークステーション、データセンター全体でAIシステムの経済性とアーキテクチャを変更できます。同じメモリエンベロープに、より大きなモデルを収容し、同じハードウェアでより多くのユーザーにサービスを提供し、推論あたりのエネルギーを削減し、ローカルで実行すべきこととクラウドで実行すべきことを動的に決定するハイブリッドシステムを可能にします。
今後問われるのは、モデルがどれだけ能力があるかだけでなく、特定のメモリ、コンピューティング、電力予算内でどれだけの有用なインテリジェンスを提供できるかです。能力が向上し続け、これらの要件が劇的に低下すれば、将来のモデルのデプロイメントエンベロープは、パーソナルデバイスから大規模データセンターまで、スタック全体にわたって拡大します。
プラットフォームカバレッジ
Bonsai 2 27Bは、CUDA経由でNVIDIA GPU上で、またMLX経由でAppleデバイス(Mac、iPhone、iPad)上で、カスタム低ビットカーネルを介して実行されます。モデルの重みは、Apache 2.0ライセンスの下で本日より利用可能です。
当社の圧縮、評価、ベンチマークプロセスの完全な技術的詳細は、ホワイトペーパーで入手できます。
私たちと一緒に働きませんか
私たちは、ポストトレーニング(ドメイン固有データへの)からターゲットハードウェアの推論最適化まで、チームと協力してBonsaiモデルをアプリケーションに合わせて調整します。メモリ、レイテンシ、または電力要件が厳しいAI製品を構築している場合は、Bonsaiがどのように役立つかをご検討ください。contact@prismml.comまでご連絡ください。
参加しませんか
PrismMLは、Caltechの研究者チームから生まれ、Khosla Ventures、Cerberus、Googleの支援を受けて設立され、Samsungからの継続的な支援を受けています。私たちは長年、ニューラルネットワークの推論能力を犠牲にすることなく圧縮するという、この分野で最も困難な問題の1つに取り組んできました。
最先端のAIの次世代を構築するのを手伝いたい場合は、ぜひご連絡ください。採用ページをご覧ください。
すべてに戻る
Bonsai 27Bを発表: iPhoneで実行できる初の27Bクラスモデル
2026年7月14日
本日、私たちはBonsai 27Bを発表します。これは、ラップトップ向けに5.9GBの3値、iPhone 17 Pro向けに3.9GBの1ビット、262Kトークンのコンテキストを持つマルチモーダルフラッグシップモデルです。
PrismML、最も高性能なモデルBonsai 2 27Bをリリース
2026年9月17日
新しいフラッグシップモデルは、27Bクラスの推論、コーディング、ビジョン、エージェント機能を、劇的に小さく高速なデプロイメントフットプリントに統合します。
ありがとうございます。最新情報をお届けします。
エラーが発生しました。
リソース
デモ
ホワイトペーパー
ドキュメント
モデル
Hugging Face
GitHub
フォローする
X
Discord
LinkedIn
お問い合わせ
質問、提携のアイデア、または効率的なインテリジェンスを必要とするプロジェクトがありますか?お気軽にお問い合わせください。喜んでお話を伺います。
ありがとうございます。メッセージは受信されました。
おっと!フォームの送信中にエラーが発生しました。