HN 日本語サマリー

← 一覧へ戻る
プログラミング

Show HN: 2GB RAMでGemma 4 26Bを実行するオープンソースエンジン、MシリーズMacならどれでも動作

Show HN: Open-source engine running Gemma 4 26B in 2 GB RAM on any M-series Mac (github.com)

843 pointsby gitpusher42299 コメント

要約

この記事では、SwiftとMetalで書かれたTurboFieldfareという名前の特殊な推論エンジンを紹介しています。このエンジンは、MシリーズMacのわずか2GBのRAMで、4ビット量子化されたGemma 4 26Bモデルを実行することを可能にします。SSDから必要な部分のみをストリーミングすることで、メモリに収まらない大規模モデルの実行を実現し、OpenAI互換のローカルサーバー機能も備えています。

全文翻訳

皆さん、こんにちは。 私は、MシリーズMacの約2GBのRAMで、4ビットGemma 4 26B-A4B-ITを実行できる特殊な推論エンジンを開発しました。TurboFieldfareと名付けました。SwiftとMetalで書かれています。 私は常にオンデバイスAIを愛してきました。強力なニューラルネットワークをMacやiPhoneで実行できるのは魔法のようです。そこで、限界を少し押し広げ、メモリに収まらないモデルを実行したいと思いました。 モデルの4ビット量子化された重みは約14GBを占めるため、OS、アプリケーション、KVキャッシュを含めると、8GBや16GBのMacで従来の推論ツールで実行することはほぼ不可能です。 トリックは、モデルの共有部分とKVキャッシュをRAMに保持し、トークンごとに必要なルーティングされたエキスパートのみをSSDからストリーミングすることです。SSDはRAMよりもはるかに遅いため、ランタイムは小さなエキスパートキャッシュと制限付きの並列`pread`を使用します。これらの読み込みが進行中、GPUはレイヤーの共有部分を実行します。 100以上の実験を行いました。ほとんどはうまくいきませんでした。いくつかはこの結果につながりました。実験についてはGitHubリポジトリで説明しています。 現在、8GBのM2 MacBook Airで5〜6トークン/秒、M5 MacBook Proで31〜35トークン/秒を生成します。 実験的なOpenAI互換ローカルサーバーも追加しました。ストリーミングとツール呼び出しをサポートし、KVキャッシュから1つのプロンプトプレフィックスを再利用します。 ぜひ試してみてください!Macアプリは簡単にインストールできます。初回実行時に、Hugging Faceから15GBの重みをダウンロードします。このモデルは驚くほど高性能です。 どんなフィードバックでも大歓迎です!