HN 日本語サマリー

← 一覧へ戻る
AI・機械学習

Moebius: 10Bレベルの性能を持つ0.2B画像インペインティングモデル

Moebius: 0.2B image inpainting model with 10B-level performance (hustvl.github.io)

247 pointsby DSemba65 コメント

要約

Moebiusは、わずか0.2Bのパラメータで10Bレベルの性能を発揮する軽量な画像インペインティングフレームワークです。これは、Local-λ Mix Interaction (LλMI) ブロックという独自の拡散バックボーン再構築と、適応型マルチ粒度蒸留戦略の組み合わせによって実現されました。既存の高性能モデルと比較して、パラメータ数を2%未満に抑えながら15倍以上の推論速度向上を達成し、高品質な画像補完を可能にします。

全文翻訳

Moebius: 10Bレベルの性能を持つ0.2Bの軽量画像インペインティングフレームワーク Kangsheng Duan1,* Ziyang Xu1,*,† Wenyu Liu1 Xiaohu Ruan2 Xiaoxin Chen2 Xinggang Wang1,📧 (*) 同等貢献, (†) プロジェクトリーダー, (📧) 責任著者. 1華中科技大学 2VIVO AI Lab 論文 コード BibTex 概要 100億規模の産業基盤モデルが画像インペインティングの限界を押し広げた一方で、その法外な計算コストは実用的な展開を著しく妨げています。高度に最適化されたタスク特化型スペシャリストを構築することは有望な解決策を提供しますが、極端な構造圧縮は避けられない表現のボトルネックを引き起こします。これを克服するために、我々は高度に効率的な軽量インペインティングフレームワークであるMoebiusを提案します。 我々は、Local-λ Mix Interaction (LλMI) ブロックを導入することで、拡散バックボーンを体系的に再構築します。Local-λとInteractive-λモジュールから構成されるこのブロックは、空間コンテキストとグローバルな意味的先行情報を固定サイズの線形行列にエレガントに集約し、複雑な潜在相互作用を維持しながらパラメータを劇的に削減します。さらに、この高度にコンパクトなアーキテクチャの潜在的な表現能力を最大限に引き出すため、適応型マルチ粒度蒸留戦略と相乗的に組み合わせます。高価なピクセル空間デコーディングを避けるために厳密に潜在空間内で動作するこの戦略は、複数の勾配ベースの損失を動的にバランスさせ、高忠実度のアラインメントを実現します。自然およびポートレートのベンチマークにおける広範な実験は、この最適な相乗効果がMoebiusを10Bレベルの産業汎用モデルFLUX.1-Fill-Devの生成品質に匹敵するか、あるいはそれを上回ることを可能にすることを示しています。驚くべきことに、Moebiusはパラメータの2%未満(0.22B vs 11.9B)を使用しながら、合計推論時間を15倍以上加速させ、高忠実度インペインティングの新たな効率標準を確立します。 手法 Moebiusの全体的なパイプライン。我々は、潜在カテゴリガイダンス(LCG)を備えた潜在拡散モデル(LDM)フレームワークを採用しています。極限のアーキテクチャ効率を達成するため、デノイジングU-Netは我々が提案するLλMIブロック(3.2節で詳述)を用いて体系的に再構築されます。さらに、極端な構造圧縮によって引き起こされる容量低下を首尾よく軽減するために、高容量教師モデルとの軽量スペシャリストのアラインメントのために、訓練中に適応型マルチ粒度蒸留戦略(3.3節)が適用されます。 ハイライト 📉 極端なパラメータ効率(2%未満):Moebiusはわずか0.22B(2億2600万)のパラメータで動作し、これは巨大な産業巨人FLUX.1-Fill-Dev(11.9B)のサイズの2%未満に相当します。これにより、重い計算を必要とするという通説を打ち破り、消費者向けおよびエッジデバイスで高品質なインペインティングを可能にします。 ⚡ 15倍の推論速度向上(26ms/ステップ):単一GPU上で1ステップあたりわずか26.01ミリ秒という驚異的な推論レイテンシを達成します。最適化されたサンプリングステップと組み合わせることで、Moebiusは10Bレベルのモデルと比較して、全体で15倍以上の総実行時間短縮を実現します。 🏆 10Bレベルのインペインティング品質(FLUX.1-Fill-Devに匹敵/上回る、6つのベンチマークで):サイズの縮小は表現能力の劣化を意味しません。アーキテクチャと蒸留の相乗的な最適化を通じて、Moebiusは、自然なシーン(Places2)とポートレートシーン(CelebA-HQ, FFHQ)の両方にわたる6つの包括的なベンチマークにおいて、10Bレベルの最先端(SOTA)汎用モデル(FLUX.1-Fill-Dev, SD3.5 Large-Inpainting)に匹敵し、特定のシナリオ(複雑なテクスチャや顔の信憑性など)ではそれを上回る性能を発揮します。 💡 相乗的なコアイノベーション: アーキテクチャ設計(LλMIブロック):空間コンテキストとグローバルな意味的先行情報を固定サイズの線形行列に凝縮することで、自己注意と交差注意の両方を再構築し、二次的な計算オーバーヘッドを回避します。 適応型マルチ粒度蒸留戦略:PixelHacker(教師)からの表現能力を厳密に潜在空間内で(高価なピクセル空間デコーディングを避けながら)転送します。微視的な中間特徴から巨視的な拡散軌跡に至るまでのマルチ粒度な監視をアラインメントし、勾配ノルム適応型損失重み付けメカニズムを通じてトレーニングを動的にバランスさせることで、巨大な容量ギャップを埋めます。 最適な相乗的バランス:コンパクトな構造と蒸留の間の相互制約と上限を体系的に探求します。このアーキテクチャ・蒸留相乗フロンティアをマッピングすることで、我々の0.22B Moebius(生徒)が表現飽和を引き起こすことなくPixelHacker(教師)の最大の意味的推論を吸収することを保証します。 🚀 肥大化した汎用モデルに対するタスク特化型スペシャリスト:盲目的にスケールアップするのではなく、Moebiusは「タスクが明確に定義されている場合、モデルはよりスマートに、より軽量に、より速くなれるか?」という根本的な問いに答えます。これは、現実世界の画像インペインティングやAIオブジェクト除去をパラメータの肥大化から解放する、高度に最適化されたスペシャリストとして機能します。 視覚化 - 自然なシーン - - ポートレートシーン - 自然なシーンの比較(Places2)ポートレートシーンの比較(CelebA-HQ, FFHQ) BibTeX @misc{DuanAndXu2026Moebius, title={Moebius: 0.2B Lightweight Image Inpainting Framework with 10B-Level Performance}, author={Kangsheng Duan and Ziyang Xu and Wenyu Liu and Xiaohu Ruan and Xiaoxin Chen and Xinggang Wang}, year={2026}, eprint={2606.19195}, archivePrefix={arXiv}, primaryClass={cs.CV}, url={https://arxiv.org/abs/2606.19195}, }