AI・機械学習
Show HN: InstinctFlash – Jetson Thorで5Bワールドアクションモデルをリアルタイム実行
Show HN: InstinctFlash – Run 5B world-action models in real time on Jetson Thor (github.com)
要約
General Instinctは、ロボティクスモデル向けの高性能サービングフレームワーク「InstinctFlash」をリリースしました。このフレームワークは、Jetson Thor上でランタイム最適化と蒸留された少数ステップの拡散スケジューラを組み合わせることで、モデルの実行速度を最大33.78倍向上させます。これにより、リアルタイムでの高度なロボット制御が可能になり、既にSamsungやSiemensなどの企業で利用されています。
全文翻訳
HNの皆さん、General Instinctの共同創業者であるGuanmingです。高性能サービングフレームワークであるInstinctFlashをリリースしました。これはAGPL-3.0ライセンスです。
Jetson Thorでは、ランタイム最適化のみで1.2倍から7.9倍の速度向上が見られ、LingBot-VAでは、これらのランタイム最適化と蒸留された少数ステップの拡散スケジューラを組み合わせることで、最大33.78倍の速度向上を達成しました。元の25のビジュアル/50のアクションステップから2/4ステップに短縮されました。50のRobotwin2.0タスク全体で、設定あたり1,153エピソードを評価した結果、2/4ビジュアル/アクションステップのInstinctFlashを使用したLingBot-VAは、90.5%の成功率を達成しました。これは、25/50ビジュアル/アクションステップのベースラインの92.1%と比較してわずかに低いですが、大幅な高速化を実現しています。
以下は、Jetson Thor上でリアルタイム実行される最適化された5Bワールドアクションモデルの例です。
https://youtu.be/nku65iyL5Fw
InstinctFlashは現在、RTX 4090/5090およびJetson Thor上で、pi0.5およびNVIDIA Cosmos Policyを含む8つのVLA/ワールドアクションモデルファミリーをサポートしています。
ファインチューニングされたチェックポイントを提供するだけで、InstinctFlashが残りを処理し、PythonランタイムまたはOpenPI互換のWebSocketサーバーを介して高速化されたモデルを公開します。
ロボットポリシーを展開する際に常に同じ問題に直面していたため、この作業を開始しました。モデルは大幅に改善されていましたが、推論速度が実際に望んでいた制御ループには遅すぎることがよくありました。
pi0.5では、混合精度GEMMとCUDAグラフが計算を高速化し、起動オーバーヘッドを削減します。Cosmosでは、キャッシングにより、拡散ステップ間の冗長な計算が回避されます。ワールドアクションモデルの拡散ノイズ除去ステップは前のステップに依存するため、少数ステップ蒸留に関する作業の動機となりました。
現在、InstinctFlashには6つの最適化側面が含まれています。
- Graph: CUDAグラフキャプチャ、メモリ計画、プリフィルと繰り返し実行の分離。
- Cache: 拡散ステップおよび予測呼び出し間でのKVおよび条件付け状態の再利用。
- Attention: さまざまなモデルアーキテクチャ向けの特殊化されたアテンションパス。
- Kernels: 特定のバックエンドとテンソルレイアウトに合わせた融合演算およびカーネル。
- Precision: FP8および混合精度実行。
- Model: 拡散およびアクション生成のための少数ステップ蒸留。
Samsung、Siemens、その他のロボットスタートアップのチームは、VLA、WAM、および拡散ベースのワールドモデルでのモデルアクセラレーションにInstinctFlashを使用しています。 now we are opening up access to you.
こちらから試してみてください。
https://github.com/General-Instinct/InstinctFlash
詳細な実装とベンチマークはこちらです。
https://general-instinct.com/blog/instinctflash-edge-inference
フィードバックをお待ちしています!