AI・機械学習
Show HN: Needle2: 電話、ウェアラブル、スマートホーム、ロボット向けの14MBのエージェント型LLM
Show HN: Needle2: 14MB agentic LLM for phones, wearables, smart home and robots (cactuscompute.com)
要約
Cactus Computeは、電話、ウェアラブル、スマートホーム、小型ロボット、マイクロコントローラー向けの14MBのエージェント型LLM「Needle 2」を発表しました。このモデルは、2bit圧縮で4500万パラメータを持ち、Raspberry Pi 5で毎秒500トークンのデコード速度を達成します。従来のTransformerモデルと比較して、消費電力が大幅に少なく、エッジAIデバイスでの利用に最適化されています。ツール呼び出しや構造化抽出に優れ、カスタムタスク向けに数分から数時間でファインチューニング可能です。
全文翻訳
HNの皆さん、こんにちは!
CactusのHenryです。
以前、電話、ウェアラブル、スマートホーム、小型ロボット、マイクロコントローラー向けのツール呼び出し、デバイス使用、構造化抽出のための14MBのエージェント型LLMであるCactus Needleをリリースしました。ここで非常に良いフィードバックを得られたため、提案を取り入れてNeedle 2をリリースしました。
モデル全体は単一の14MBバイナリで、28MBのRAMでフルセッションを実行します。2bit圧縮で4500万パラメータです。NeedleはRaspberry Pi 5で毎秒500トークンのデコード速度を達成し、Meta Quest 3SやApple Vision ProのようなVRデバイスでは毎秒400~1500トークン、Samsung Aシリーズのような200ドル未満のスマートフォンでは毎秒300~700トークンの範囲で動作します。
ツール呼び出しとモバイルデバイス使用のベンチマークでは、Needle 2はLFM2.5 230MやApple Foundation Modelのような最も近い小型モデルと、5倍から70倍小さいながらも、f16(Needle 2は2bit)で競合します。Needleは、私たちの論文(https://arxiv.org/abs/2607.18363)のSimple Attention Networksに基づいています。
最近のエッジAIはMacやPCを指しますが、これは世界の210億以上の接続されたIoTデバイスのうち、わずか15億に過ぎません。新興市場では、ほとんどのスマートフォンは200ドル未満で、NPUや高性能GPUはありません。これには、低価格スマートフォン、Raspberry Pi、マイクロコントローラー、ウェアラブル、Reachy Miniのような小型ロボット、接続されたホームデバイスが含まれます。
Needleの幅と深さを持つ従来のTransformerは、トークンあたり164 MFLOPsを消費し、Needleのパラメータ数にまで圧縮されたものでさえ87 MFLOPsを消費しますが、Needleは70 MFLOPsしか消費しません。高性能なスマートフォンであっても、常時オンのアシスタントは電力予算内で動作する必要があります。すべてのMFLOPはミリワット時であり、Needleは最も小さい高性能LLMよりもトークンあたり7倍から85倍少ないMFLOPsしか消費しません。アーキテクチャの詳細についてはリンクを参照してください。
コンシューマーデバイスのインテリジェンスを、型付きパラメータを持つ関数として構造化する場合、唯一難しいのは、あいまいな文章をそれらにマッピングすることです。つまり、どの関数をどの値で呼び出すかです。私たちの研究では、そのようにフレーム化すると、問題は世界知識や自由形式の文章を必要としないことがわかりました。そのため、4500万パラメータで十分なのです。
Needle 2は、スキーマをツールとして渡すことができ、モデルが構造化された出力を返す構造化抽出に拡張されます。Needleをテキスト分類モデルとして、enumフィールドを使用したり、キーフィールドを抽出するスキーマを提供して要約モデルとして使用したりできます。自由形式のデコード以外はすべて可能です。
すべての製品には独自のツール語彙があり、Needleをファインチューニングすることで、カスタムタスクで最先端のパフォーマンスを達成できます。そのため、Pythonパッケージ(https://github.com/cactus-compute/needle)を使用して、NeedleはMac/PCで数分から数時間でファインチューニングでき、自動化されたデータ生成パイプラインを備えています。数個のサンプルを渡すだけです。
それでも、すべての応答には、私たちのCactus Hybrid技術に基づいた学習済み信頼度スコアが付属します。しきい値を超えたら実行し、下回ったらクラウドまたはより大きなモデルにエスカレートします。Needle 2とプライベートDeepSeek-v4-Flashデプロイメントを組み合わせることで、ほとんどコストをかけずにエンタープライズレベルのタスクで特にうまく機能します。このセットアップについてお手伝いできます。
Needle 2には多くのことを考えましたが、まだ見落としている点が多いかもしれません。提供されたリンクのプレイグラウンドを使用してNeedleをテストし、ご意見をお聞かせください。常に感謝しています!