HN 日本語サマリー

← 一覧へ戻る
AI・機械学習

Desert Ant Labs: デバイス上で動作するローカルで高速なモデル

Desert Ant Labs: local, fast models that run on device (desertant.com)

103 pointsby willwhitedc19 コメント

要約

Desert Ant Labsは、デバイス上でのインテリジェンス構築を目指すヨーロッパのAIラボです。同社は、ミリ秒単位で応答し、実行コストがゼロの、小型で特化したオーディオ、ビジョン、テキスト用モデルを開発しています。これらのモデルは、古いスマートフォンでも動作するほど小さく、SDKを通じて利用可能です。

全文翻訳

本日、私たちはDesert Ant Labsを立ち上げます。これは、意見を持ったオンデバイスインテリジェンスを構築する、ヨーロッパのフロンティアAIラボです。 効率的なインテリジェンスへの最良の道は、デバイス上で始まると私たちは信じています。 私たちは、オーディオ、ビジョン、テキストのための小型で特化したモデルを構築しています。各モデルはミリ秒単位で応答し、実行コストはゼロなので、トークンコストや推論速度に制限されることなく、あらゆる製品インタラクションにインテリジェンスを組み込むことができます。 5年前のスマートフォンでも実行できるほど小さく、すべてのフレームやキーストロークで使用できるほど高速で、すでに支払っているAPIコールよりも優れています。 最初の18モデルが本日公開されました(12モデルは安定版、6モデルはベータ版)。Swift、Kotlin、JavaScript用の単一SDKからアクセスできます。 タスクごとに1つのモデルがあり、それぞれがデバイス上でそのタスクを完了する最速の方法となるように構築されています。 Voz:iPhoneで10分間のオーディオを2秒で文字起こしします。Whisperより4.7倍高速で、すべての単語に開始時刻と終了時刻が含まれます。 Clear:5分間のラップトップ録音を1秒でスタジオ品質のオーディオに変換できる9MBのモデルです。 Redact:27言語で、名前、住所、カード番号をリアルタイムでマスクし、サーバーに到達しないようにします。 Tongue:2MBのモデルで、3単語から84言語を識別します。Tongueの言語識別精度は、3単語で2MBのモデルで0.933を記録し、293MBの検出器の0.887を上回ります。 これらはほんの一例です。他の14モデルの完全な仕様とベンチマークは、desertant.com/modelsおよびHugging Faceで見つけることができます。 すべてのモデルは、月間アクティブデバイス10万台まで無料です。トークンなし、ログインなし。 システムRedact · 12MB 88.8 GLiNER-PII · 2.3GB 91.1 Rampart · 14.7MB 61.4 OpenAI filter · 3GB 60.2 Redactは、テキスト内の個人データの88.8%をキャッチします。これは、12MBのモデルから、2.3GBのGLiNER-PIIに近いです。 私たちはヨーロッパでこれを構築しています。「オンデバイス」が主権のデフォルトです。 データは顧客の手を離れることはなく、機能は他者のクラウドに依存せず、アップロードされたことのないものは決して強制されることはありません。 どのようにしてここにたどり着いたか 5年間、私たちはビデオアプリ「Detail」をオンデバイスファーストのアプローチで構築してきました。 しかし、Auto Editで短いクリップを作成したり、ポッドキャストのオーディオエンハンスメントを行ったりする機能を導入したとき、クラウドAPIに頼らざるを得ませんでした。 Detailの人気が高まるにつれて、インフラストラクチャの請求額も増加しました。 数ヶ月ごとに、便利なオンデバイスモデルを探していました。Hugging Faceをサーフィンして、フィラーワードを見つけたり、録音をクリーンアップしたりできるモデルを探しました。 そして、毎年6月には、構築するための素晴らしい新しいツールを手に入れましたが、業界の進歩は十分ではありませんでした。 基盤はありました:チップ、Core ML、研究です。 欠けていたのは、その基盤と、アプリに機能を実際に実装する間のすべてでした:数行のコードでドロップインして出荷できるモデルです。 そこで、私たちはモデル自体をトレーニングしました。 モデルのトレーニングはプロダクトデザインの課題であることが判明し、プロダクトは私たちが知っていることです。 私たちは、速度、品質、コストでクラウドサービスを上回り、サイズははるかに小さいながらも、タスク自体では他のローカルおよびクラウドモデルを上回るモデルとローカル推論を設計しました。 私たちはDolbyをClearに置き換え、より優れた、より高速なオーディオエンハンスメントを実現し、オンデバイス文字起こしをVozで5倍高速化しました。 また、Claude SonnetをClipsに置き換えました。これは、10分間のビデオを5秒で多数のクリップに変換する284MBのモデルで、Sonnetより10倍高速でエネルギー消費は470倍少なく、品質は同等です。 Clearオーディオエンハンスメント速度、5分間のオーディオ iPhone 16 Pro 302x MacBook Pro (M5) 345x Clearは、9MBのモデルから、デバイス上でオーディオクリップをエンハンス、マスター、再エンコードします。電話では302倍リアルタイムです。 文字起こし速度、30分間のオーディオ Voz 319x Apple SpeechAnalyzer 78x Whisper large-v3-turbo 50x M3 Ultraで30分間の連続オーディオのリアルタイムファクター。VozはiPhone 17 Proで298倍に達します。 Detail 6は、iOS 27でリリースされ、すべてのクラウドAPIを独自のモデルに置き換え、完全にデバイス上で実行されます。 私たちは過去数年間、LLMを単なるAPIとして扱ってきました。 そして、汎用的なフロンティアブレインの誇大広告の中で、それらが唯一の選択肢ではないことをほとんど忘れていました。 私が話すすべての開発者は、コストが問題でなければ構築するであろうオンデバイスモデルのウィッシュリストを持っているか、トークンを浪費しているがローカルモデルに喜んで交換する機能を持っています。 1日に何十万回も同じように実行されるコール:録音のクリーニング、写真のタグ付け、文から日付の抽出、テキストがサーバーに到達する前に名前をキャッチすること。 これらのニーズのどれもフロンティアモデルを必要としません。 NVIDIA自身の研究者は、3つのエージェントシステムを分解し、大規模モデルへの呼び出しの40〜70%が代わりに小型で特殊なモデルに移行できると推定しました。 コンピューティングはすでに支払われています 業界は今年、データセンターに約4500億ドルを費やすでしょう。 一方、世界では10億台以上のスマートフォン、タブレット、ラップトップが出荷されており、これらの種類のタスクに完全に適した、ますます高性能なチップが搭載されています。 地球上のすべてのAIデータセンターよりも多くのコンピューティング能力が人々の手にあります。 私たちは無料の推論という不公平なアドバンテージを持っています。 コールごとのコストがないため、機能は、チェックできるものだけでなく、すべてのメッセージで実行されます。 ラウンドトリップがなく、顧客のデータはデバイスから離れることはありません。 推論コストがゼロになると、製品の構築方法は完全に変わります。 すべての製品に小さなブレインを ローカルモデルで構築するには、開発者エクスペリエンスを大幅に改善する必要があります。 商用利用でき、タスクで速度と品質で代替品を上回り、数行のコードでアプリにドロップでき、発見しやすいモデルが必要です。 最初の100モデルを小脳、つまり小さなブレインと考えてください。 小さなブレインは、常にオンの作業(バランス、タイミング、考えずに実行するスキル)を処理するため、脳の残りの部分は自由に考えることができます。 これが私たちが最初に構築しているものです:デバイス上で、無料で、終日実行される、高速で特殊化されたモデルです。 次に、どのモデルが応答するかを決定するレイヤーである大脳皮質が来ます。 まず小さなローカルモデル、ジョブが必要とする場合はより大きなモデル、そしてジョブがデバイスを離れる必要がある場合にのみクラウドを使用します。 オープンリサーチが進み、デバイスシリコンがより高性能になるにつれて、ローカルモデルは成長し、私たち自身もより大きなモデルをトレーニングします。 フロンティアインテリジェンスは、小さなものから構築されます。 クラウドラボは、トークンごとの価格設定が中立的なモデルを必要とするため、中立的なモデルを出荷します。 すべてのDesert Antモデルには、私たちが選択したデフォルトと、そのデフォルトを変更するために必要なレバーが付属しています。 私たちはモデルとランタイムを一緒に最適化します:iPhoneでは、ClearとVozはNeural Engineで実行され、ブラウザでは、Clearの同じウェイトがWebAssemblyを介して実行されます。 SDK 始める準備はできましたか? ネイティブSwift、Kotlin、JavaScript SDKを使用して、アプリにDesert Antモデルを実装できます。これらはGitHubで入手できます。 ドキュメントは開発者とエージェント向けに書かれており、CLIでMacでモデルを試したり、Hugging Faceでブラウザで試したりできます。 私たちのモデルでクールなものを構築していますか、それとも私たちと一緒に構築したいですか? お問い合わせください。