HN 日本語サマリー

← 一覧へ戻る
AI・機械学習

Show HN: Cactus Needle 3: 8-29MBの自動化モデルがDeepSeek V4 Flashに匹敵

Show HN: Cactus Needle 3: 8-29MB automation models can match DeepSeek V4 Flash (cactuscompute.com)

86 pointsby HenryNdubuaku38 コメント

要約

Cactus Computeは、8MBから29MBという小型の自動化モデル「Needle 3」を発表しました。このモデルは、ツール呼び出しや構造化JSON出力に特化しており、2から20層のサブネットワークで構成されています。Raspberry Pi 5では高速なデコードが可能で、多言語対応や正規表現によるトリガー機能も備えています。

全文翻訳

HNの皆さん、CactusのHenryです。 数週間前にNeedle 2を投稿しましたが、ディスカッションスレッドでのフィードバックは非常に貴重でした。ありがとうございます!そのフィードバックのおかげで、Needle 3を迅速にリリースすることができ、再び皆さんの意見を聞きたいと思います。 主な機能は以下の通りです。 1) 自動化(ツール呼び出しと構造化JSON出力):Needleは設計上、チャットはしません。このような小型モデルに汎用的な能力を詰め込むのは非常に困難なため、ツール呼び出しと構造化JSONに焦点を当てています。宣言したツールがリクエストに合わない場合は、空のリストが返されます(デモでの注意点)。 2) インテリジェンスラダーリング:各レイヤー(2から20)はデプロイ可能なサブネットワークであり、単一の重みセット、25から121百万パラメータを2ビットで、8MBから29MBのバイナリとして出荷します。Raspberry Pi 5では、最大4kトークン/秒でデコードし、最大10kでプリフィルします。 3) Monarch Hadamard MLP:密なFFNを、3つの学習可能なWalsh-Hadamard初期化されたKronecker(Monarch)因子ペアと、チャネルごとの対数スケール、固定順列、SiLU非線形性、ランク8の入力条件付きゲートで置き換えます。これにより、各トークンは、密な4倍拡張MLPがコストとするO(d²)ではなく、O(d√d)のパラメータと計算量で、そのd_modelチャネルの完全に混合された非線形変換を得ます。 4) パフォーマンス:Mobile Actions(電話コマンド、正確な呼び出しでスコアリング)では、20層モデルは出荷された2ビットバイナリで86.0を達成します。LFM2.5 1.2Bは82.4、Qwen3.5 0.8Bは76.0、Appleのオンデバイスモデルは57.6です。すべてf16で測定しています。リンクにはさらに多くの結果があります。もちろん、どこでも勝てるわけではありません。 5) 多言語対応:Needle 3は現在、英語、フランス語、スペイン語、ドイツ語、オランダ語、イタリア語、ポーランド語をサポートしており、さらに多くの言語が追加される予定です。 6) ファインチューニング:「狭いタスク」であれば、4LでDeepSeek v4 Flashグレードのパフォーマンスを達成できます。「狭いタスク」を強調しています。プロダクションユーザーは、プロダクション前にチューニングすることを好むことが多いことがわかりました。 7) トリガー:ツール呼び出しにおけるグラウンディングは一般的な課題です。少なくともNeedle 2ではそうでした。そのため、各リクエストに対して大文字小文字を区別しない正規表現をマッチさせて、偽陰性をゲートするサポートを追加しました。 8) 信頼度:すべての応答には、キャリブレーションされた信頼度スコアも含まれます。これは、完了した呼び出しとデコード確率の判断の最小値です。閾値を超えたら実行し、閾値以下なら呼び出しを表示して、より大きなモデルにエスカレートしてください。 9) サポートプラットフォーム:macOS、Linux(x86-64、ARM64、ARMv7、RISC-V、MIPS32)、Windows(x64、ARM)、Android、iOS、watchOS、tvOS、WebAssemblyとしてのブラウザ、およびWASIコンポーネント。 お読みいただきありがとうございます。いつものように、ご意見をお待ちしております!