AI・機械学習
Show HN: DDR4タイミングルールを破ってDRAM内でPrismMLのBonsaiを実行
Show HN: Running PrismML's Bonsai inside DRAM by breaking DDR4 timing rules
要約
PrismMLの1ビット/3値Bonsaiモデルは、スマートフォンでのLLM実装に注目を集めています。しかし、標準的なLPDDRではメモリ帯域幅の限界が課題となります。この課題に対し、DRAM内で直接推論を実行するアーキテクチャ「CaSA」が開発され、メモリバスを完全にバイパスすることでこの問題を解決します。
全文翻訳
DRAM内でPrismMLのBonsaiを実行するShow HN:DDR4タイミングルールを破る
PrismMLの1ビット/3値Bonsaiモデルを取り巻く興奮は、業界がスマートフォン大手、特にAppleがエッジデバイスにLLMをどのように実装するかを注意深く見守っている状況を生み出しています。
AIをオンデバイスに移行することは、 brilliantで必要な戦略です。これにより、EU規制に準拠した絶対的なユーザープライバシーが確保され、高価なクラウド推論から経済性が根本的にシフトし、真のAI対応シリコンを求めるユーザーによる大規模なハードウェアアップグレードサイクルの道が開かれます。
スマートなオンデバイス「セマンティックルーター」を作成するには、モデルは27B以上のパラメータスケールに到達する必要があります。これを電話で達成するには、PrismMLの3値重みのような極端な量子化が必要です。
しかし、ソフトウェアの世界ではしばしば見過ごされがちな重要なハードウェアの現実は、RAMに重みを収めることが、それらを移動することと同義ではないということです。各トークン生成のためにSoCバスを介して数ギガバイトのデータを転送すると、NPUのサーマルスロットリングや過剰なバッテリー消費につながる可能性があります。
これは重要な疑問を投げかけます:なぜ私たちはまだデータをコンピューティングに転送しているのでしょうか?なぜメモリ内で直接AI推論を実行しないのでしょうか?
ベアメタル物理学を見落とした学術的なPIMシミュレーションに不満を感じ、私はCOTS DRAM内で直接3値LLM推論をチャージシェアリングを通じて実行するアーキテクチャ「CaSA」を開発しました。これにより、メモリバスを完全にバイパスします。
ソフトウェア量子化は素晴らしい最初のステップであり、CaSAはブリッジを完成させるために必要な物理ハードウェア基盤を提供します:https://github.com/pcdeni/CaSA