HN 日本語サマリー

← 一覧へ戻る
AI・機械学習

Bonsai 27B (1ビットLLM): スマートフォンで動作する初の27Bクラスモデル

Bonsai 27B (1-bit LLM): The First 27B-Class Model to Run on a Phone (prismml.com)

651 pointsby xenova230 コメント

要約

PrismMLは、Qwen3.6 27BをベースにしたBonsai 27Bを発表しました。これは、スマートフォンで動作する初の27Bクラスのマルチモーダルモデルです。1.71ビットのTernary variant(5.9GB)と1.125ビットの1-bit variant(3.9GB)があり、後者はiPhone 17 Proのメモリ予算に収まります。このモデルは、従来の低ビットモデルと比較して、より高い精度と効率で高度な推論、ツール呼び出し、エージェントループを実現し、Apache 2.0ライセンスで提供されます。

全文翻訳

LAUNCH1001011100 11010 001すべての投稿に戻るBonsai 27Bを発表: スマートフォンで動作する初の27Bクラスモデル2026年7月14日•PrismML本日、Qwen3.6 27BをベースにしたBonsai 27Bを発表します。これはBonsaiファミリーの新しいマルチモーダルフラッグシップであり、その能力クラスで初めてスマートフォンで動作するモデルです。 以前のリリースで、1ビットおよび3値(ternary)の重みを持つモデルが商用利用可能な言語モデルを生成できることを証明しました。Bonsai 27Bは、そのフロンティアを新しい能力層にまで拡張します。それは、マルチステップ推論、構造化されたツール呼び出し、ビジョンタスク、そして多くのステップにわたって一貫性を保つコンピューター利用エージェントループです。今日まで、その層をローカルにデプロイすることは、具体的な理由から実用的ではありませんでした。27Bモデルは16ビット精度で約54GBを占有し、優れた4ビットビルドでも18GBとなり、スマートフォンやほとんどのラップトップには大きすぎます。 Bonsai 27Bはそれを変えます。2つのバリアントがあります。 Ternary Bonsai 27Bは、FP16グループワイズスケーリングを使用した3値(-1、0、+1)の重みを使用し、1ウェイトあたり1.71ビットの実効ビット数を実現します。5.9GBで、これは品質重視のバリアントです。フルな推論、ツール呼び出し、エージェント機能を備え、一般的なラップトップで動作します。 1-bit Bonsai 27Bは、同じグループワイズスケーリングを使用したバイナリ(-1、+1)の重みを使用し、1ウェイトあたり1.125ビットの実効ビット数を実現します。3.9GBで、これはフットプリント重視のバリアントであり、iPhone 17 Proのメモリ予算内に収まり、初めて27Bクラスのモデルをスマートフォンにもたらします。 すべてのBonsaiリリースと同様に、低ビット表現は言語ネットワーク、埋め込み、アテンション、MLP、LMヘッド全体でエンドツーエンドで実行され、高精度へのエスケープハッチはありません。両方のバリアントはマルチモーダルであり、ビジョンタワーはコンパクトな4ビット形式で提供されるため、オンデバイスワークフローはテキストだけでなく、スクリーンショット、ドキュメント、カメラ入力を認識できます。Bonsai 27Bはフルな262Kトークンのコンテキストを持ち、スペキュラティブデコーディングをサポートし、ロスレスのドラフト&ベリファイアクセラレーションで速度を増幅します。すべて本日よりApache 2.0ライセンスの下で利用可能です。 知能の維持 知識、推論、数学、コーディング、指示追従、ツール呼び出し、ビジョン(モデルの完全な推論が行使される思考モードで評価)を網羅する15のベンチマークスイート全体で、Ternary Bonsai 27Bはフルプレシジョンベースラインの95%、1-bit Bonsai 27Bは90%を維持します。 カテゴリ(ベンチマーク) Qwen 3.627B Ternary Bonsai27B 1-bit Bonsai27B 数学(GSM8K, MATH-500, AIME25, AIME26) 95.3 93.4 91.7 コーディング(HumanEval+, MBPP+, LiveCodeBench) 88.7 86.0 81.9 エージェントとツール呼び出し(BFCL v3, TauBench) 80.0 74.0 66.0 指示追従(IFEval, IFBench) 78.4 71.8 65.8 知識 / STEM(MMLU-Redux, MuSR) 83.1 77.0 73.4 ビジョン(MMMU Pro, OCRBench) 72.6 65.2 59.6 全体(15ベンチマーク) 85.0 80.5 76.1 図I: Bonsai 27B(思考モード)のベンチマークスコアとフルプレシジョンベースラインとの比較。完全なベンチマークごとの結果はホワイトペーパーに記載されています。 表を能力別に読むと、平均値よりも鮮明なストーリーが見えてきます。数学とコーディングはほとんど影響を受けておらず、ツール呼び出しはフルプレシジョンから数ポイントの範囲内に留まっています。これはまさにエージェントワークロードが依存する能力です。比較のために、同じベースモデルの最もアグレッシブな従来の低ビットビルドは、1-bit Bonsai 27Bよりも大幅に低いスコアを記録しながら、2.5倍のメモリを消費します。 これは、以前の言語モデルおよび画像モデルで実証したのと同じパレートシフトであり、今回は27Bスケールで実現されています。27Bクラスの能力を、フルプレシジョン2Bモデルよりも小さいフットプリントで提供します。インテリジェンス密度(1-bit Bonsai 8Bで導入した指標)により、1-bit Bonsai 27Bは1GBあたり0.53を提供します。これはフルプレシジョンベースラインの10倍以上、そして利用可能な最高の低ビット代替品の約2.7倍です。 図II: 他の同クラスのモデルと比較したBonsai 27Bのインテリジェンス密度(1GBあたり)。 なぜこれが重要なパラダイムシフトなのか 最も価値のあるAIワークロードは、単一の応答から持続的な作業へと移行しています。実際のツールを操作するアシスタント、結果を返す前に非監視で実行されるワークフロー、数十のドキュメントを合成する研究などです。このシフトはワークロードの形状を変えます。エージェントはモデル呼び出しを1回だけ行うのではなく、数百回行い、それぞれがコンテキストを運び、構造化された出力を生成し、次のステップにフィードします。 クラウドAPIは多くの製品にとって適切な選択であり続けるでしょう。しかし、エージェントワークロードの場合、クラウドのみの実行は構造的な制約を課します。各ステップはリモートリクエストであり、トークンごとのコストは各イテレーションで蓄積され、各計画、ツール呼び出し、中間結果は、ユーザーのプライベートファイル、画面、データを含め、ネットワークを横断します。 カルーセルI: NVIDIA GeForce RTX 5090上のTernary Bonsai 27Bモデルによって強化されたHermesとのエンドツーエンドのエージェントワークフロー。カルーセルII: M5 Max上のTernary Bonsai 27Bとのエージェントツール呼び出しとMCP統合。 ローカル実行は状況を変えます。持続的なエージェント作業が可能なモデルがデバイスに収まる場合、エージェントは製品内に存在できます。100ステップのループの限界費用はゼロになり、ユーザーのデータはマシンから離れることはありません。まるごと新しいカテゴリが開かれます。永続的なオンデバイスエージェント、オフラインで動作するアシスタント、構築によってプライベートローカルデータを推論するアシスタントなどです。これまで欠けていたのは、このようにデプロイするのに十分小さく、作業を任せるのに十分な能力を持つモデルでした。Bonsai 27Bはそのモデルです。 また、新しいシステムアーキテクチャもアンロックします。フロンティアではないタスクやプライバシーに関わるタスクは有能なローカルモデルにルーティングし、最も難しいステップのためにフロンティアのクラウドモデルを予約するハイブリッドデプロイメントです。これにより、エージェントシステムのタスクあたりのコストが削減されます。 Bonsai 27Bは、NVIDIA GeForce RTX 5090で1ビットで最大163トークン/秒、Ternaryで134トークン/秒に達します。M5 Maxでは、1ビットで最大87トークン/秒、Ternaryで58トークン/秒に達します。 スマートフォンに収まることは、ストレージ数よりも厳しいゲートです。スマートフォンはアプリにその全メモリを公開することはありません。12GBのiPhoneは、オンデバイスでモデルが使用できる約6GBを提供し、モデルはその予算をKVキャッシュとアクティベーションと共有します。27Bモデルの従来のビルドは、それをクリアすることさえできません。約4GBの1-bit Bonsai 27Bは、作業スペースを確保して初めて通過できるものです。 その制約が、ファミリーが意図的に2つの動作ポイントを提供している理由です。特にそれを念頭に置いています。ラップトップクラスの品質にはTernary、スマートフォンクラスのフットプリントには1-bitです。 デモII: iPhone 17 Pro Max上の1-Bit Bonsai 27Bによって強化されたマルチモーダルエージェントユースケース(デモモード: キャッシュ済み&事前入力画像コンテキスト) フロンティアは動き続ける すべてのBonsaiリリースは、ギガバイトあたりのインテリジェンスのフロンティアを左に移動させ、Bonsai 27Bは実用的な閾値を超えてそれを移動させます。思考、マルチモーダル理解、ビジョン、信頼性の高いツール使用といった最新モデルの完全な機能セットが、人々がすでに所有しているデバイスに収まるようになりました。 インテリジェンス密度が、AIの次の段階の進歩を定義する軸の1つになると信じています。生の能力はモデルができることを決定し、密度はそれがどこでできるかを決定します。フロンティアの左へのあらゆる移動は、高度なAIが動作できるデバイス、製品、環境のセットを拡大し、スマートフォンからシングルGPUサービングまで、それが触れるすべてのデプロイメントサーフェスの経済性を変えます。Bonsaiの背後にある方法論はアーキテクチャに依存せず、フロンティアは動き続けます。より大きなモデルと新しいアーキテクチャがすでに進行中です。 初期のコンピューターは部屋を満たしていましたが、今日それらは私たちのポケットの中にあります。知能も同じ旅をしており、Bonsai 27Bはその最大のステップです。 プラットフォームカバレッジ Bonsai 27Bは、MLXを介してAppleデバイス(Mac、iPhone、iPad)でネイティブに動作し、CUDAを介してNVIDIA GPUで動作します。これは、ハイブリッドアテンションアーキテクチャ用に構築されたカスタム低ビットカーネルを介して行われます。モデルの重みは本日よりApache 2.0ライセンスの下で利用可能です。このリリースでは、開発者がモデルを簡単に試せるように、無料の期間限定開発者プレビューAPIを提供しています。 圧縮、評価、ベンチマークプロセスの完全な技術的詳細は、ホワイトペーパーで入手できます。 私たちに参加してください PrismMLは、Caltechの研究者チームから生まれました。