HN 日本語サマリー

← 一覧へ戻る
AI・機械学習

Flux 3 X Mimic: 次世代のビデオ・アクションモデル

Flux 3 X Mimic: The Next Generation of Video-Action Models (bfl.ai)

311 pointsby kensai48 コメント

要約

Black Forest Labs (BFL) は、画像、ビデオ、音声の生成を統合するマルチモーダル基盤モデル「FLUX 3」を発表しました。このモデルは、ロボット学習と展開に強みを持つmimic roboticsとの協力により、ロボットの動作を制御する「FLUX-mimic」へと進化しました。FLUX 3は、物理世界の理解を基盤としており、コンテンツ生成だけでなく、ロボットによる物理的なアクション予測も可能にします。

全文翻訳

ブログに戻る リサーチ モデル FLUX 3 x mimic: 次世代のビデオ・アクションモデル FLUX 3、当社の新しいマルチモーダル基盤モデルの初期バージョンが、現在ロボット上で稼働しています。私たちはmimic roboticsにFLUX.3への早期アクセスを提供しました。ロボット学習と展開における彼らの強みと、モデルの世界知識およびBFLの基盤モデルの専門知識を組み合わせることで、次世代のビデオ・アクションモデルであるFLUX-mimicが誕生しました。 FLUX FLUX 1とFLUX 2は画像を生成します。FLUX 3はマルチモーダルへと拡張し、オーディオビジュアルコンテンツを共同で生成します。同時に、FLUX-mimicの基盤を提供します。これはmimicとの共同開発によるビデオ・アクションモデルで、Audiでテストおよび展開されたロボット上で稼働しています。 一見すると、説得力のあるビジュアルコンテンツの生成とロボットの制御は、ほとんど共通点がないように思われます。一方はピクセルを生成する必要があり、もう一方は物理世界に触れたり操作したりしたときにどのように反応するかを理解する必要があります。もし1つのモデルが両方を実行する場合、それは決してコンテンツ作成モデルだけではありません。それは世界の振る舞いをモデル化したものであり、コンテンツ作成はそのモデルを使ってできることの1つです。 それがFLUX 3です。 ビデオは難しい部分 FLUX 3は、最初から画像、ビデオ、音声全体で共同学習された単一のモデルです。そのトレーニングで最も要求の厳しい部分(総コンピューティングコストの95%以上を占める)は、ビデオ予測です。リアルなビデオを生成するために、モデルは接触、動き、重量、原因と結果を学習せざるを得ません。どれか1つでも間違えると、それは間違って見えます。世界を正確にレンダリングすることを学ぶということは、世界がどのように振る舞うかを学ぶことを意味します。 比較的言えば、音声は簡単なモダリティです。ビデオよりも低次元で、はるかに詳細が少ないため、音声付きの720pビデオのトークンの0.5%未満を占めます。モデルがビデオ理解を学習するという難しい作業を終えれば、ビデオと音声の間の因果関係を学習し、唇の動きに同期したスピーチや、それらを原因とする物理イベントに同期したオーディオエフェクトを予測できるようになります。 アクションも同じ形状をたどります。ロボットの状態の低次元表現であり、視覚的な観測と密接に結びついています。アクション、音声、ビデオフレームはすべて、単一の根本的な物理的現実の断片的な表現です。モデルがビデオと音声の背後にある物理プロセスについて学習した後、アクション予測は新しい出発点ではありません。それは、すでにモデル化している現実のもう1つのビューにすぎません。 単一のバックボーン もしそのフレームワークが正しいなら、FLUX 3にアクションを予測するように教えることは、永続的なコストを発生させるべきではありません。モデルがアクション空間の構造を学習し、その内部的な世界表現をそれに合わせるための短い混乱期を予想しますが、その後は完全なパフォーマンスに戻ります。まさにそれが私たちが観察していることです。 大規模なトレーニング実行で、私たちはカリキュラムにアクション予測を追加し、ビデオ生成品質への影響を観察しました。テキストからビデオ、画像からビデオへの人間による評価は、モデルが新しいアクションモダリティを組み込み始めたときに、最初は最大10%低下しました。3500ステップ後、モデルはビデオ生成タスクで以前の品質を完全に回復し、同時にアクションも予測できるようになりました。 各シリーズは、アクション予測が追加される前の品質に正規化されています。高いほど良いです。 モデルはアクションを入力と出力に統合する必要がありましたが、それを行うことで容量が永久に失われることはありませんでした。単に、この新しいモダリティが既存の世界モデルとどのように関連しているかを学習する必要があっただけです。これが理解されると、既存の機能に対するパフォーマンスの低下はなくなりました。ビデオ生成とアクション予測は、別々の基盤を必要としません。同じバックボーンが両方を担います。 これにより、Physical AIはBlack Forest Labsのロードマップの自然な拡張となり、方向転換ではありません。コンテンツ作成は、当社のマルチモーダルFLUX 3バックボーンが画像、ビデオ、音声で行うことです。Physical AIは、それがアクションで行うことです。1つの基盤モデルが、視覚的知能を中核として、2つのアプリケーションファミリーを可能にします。私たちは別個の基盤モデルを構築しませんでした。私たちは難しいことに集中しました。世界を理解するモデルを構築することです。その中で行動することは、その理解が可能にすることです。 ラボから現実へ: FLUX-mimic FLUX 3バックボーンを実際の生産ラインでの実際の自動化タスクに向けたときに何が起こるでしょうか? それが、mimicとBFLがFLUX-mimicを作成して回答しようとしている質問です。mimicは独自のロボットを構築し、ロボット学習、器用な操作、生産展開の専門知識をもたらします。BFLは視覚的基盤モデルを構築し、マルチモーダルトレーニングとモデリングの専門知識をもたらします。共に、私たちは産業要件に適応し、mimicのフルスタック展開システムに統合された、汎用操作のための次世代モデルを構築しました。FLUX-mimicは、FLUX 3バックボーン上に構築されたビデオ・アクションモデルです。 学習された世界モデルのデコード 私たちの仮説は、FLUX 3がビデオを生成するために、世界の内部表現を学習する必要があるということです。FLUX-mimicはこの仮説を追求し、FLUXバックボーンの学習済み世界表現からアクションをデコードします。mimic-videoで開拓されたこのアプローチは、FLUXのビデオ予測パスから抽出された中間特徴の上に軽量なアクションデコーダーをトレーニングします。 FLUX-mimicがFLUX 3の上に構築されるアーキテクチャ概要 このアプローチの成功は、関連するが異なる2つの側面にかかっています。FLUXによって学習された世界モデルの品質と、この世界モデルの特徴表現の品質です。世界モデルの品質は、生成品質に直接関係します。モデルが世界の振る舞いを理解していなければ、それをシミュレートすることはできません。しかし、たとえ最高のても、アクションデコーダーにとってアクセス可能でなければ、世界モデルは役に立ちません。特徴空間がモダリティ間の因果関係を非線形に絡み合わせたままにしている場合、特徴表現からそれらの関係を理解することは、生の入力からそれらの関係を理解することと同じくらい困難です。表現の品質が重要です。 生成品質と表現品質は、長い間、それぞれ孤立して研究され、アプローチされてきました。生成アプローチは、シミュレーションを可能にする高品質な世界モデルをもたらし、コンピューティング投資に対する予測可能なリターンを得るためのスケーリング則を示します。しかし、表現学習のためのより専門的なアプローチと比較して、それらはあまり分離されていない表現を生成するため、世界理解を必要とするタスクでの有用性に上限を設けています。 生成モデル自体がそれ自身の特徴に依存しているため、それらの表現品質におけるこの乖離は直感に反するように思われます。生成モデル内の表現の改善は、それらの世界モデルの品質を向上させ、ダウンストリームタスクでの使用可能性を高めるはずです。私たちの研究であるSelf-Flowでは、生成と表現学習を単一のフレームワークで統合する方法を示し、まさにこの相互改善を観察しました。世界モデルは(ビデオ、画像、音声全体での生成品質によって測定されるように)改善され、その表現品質は(シミュレーションでのロボット制御タスクの成功率によって測定されるように)改善されました。 Self-Flow vs. Flow Matching (FM)。左: 各モダリティの生成エラー(フレシェ距離)、FM = 100に正規化(低いほど良い)。右: ファインチューニングによる操作タスクの平均成功率(4つのタスクグループ)。 世界モデルのスケーリング Self-Flowではスケーリング則は依然として有効であり、FLUX 3はその応用です。これはSelf-Flowのスケーリングバージョンです。それは、可能な限り広範な世界ダイナミクスを最初から学習するために、数千万時間もの一般的なビデオコンテンツでトレーニングされ、視覚的知能のバックボーンとして準備するために、人間とロボットの操作タスクに焦点を当てた数十万時間ものビデオコンテンツでトレーニングされています。このスケーリングが、Self-Flowの成功をラボから現実に移行させています。mimicは、部品を構造化トレイにキット化するなど、生産および物流業務の日常的な現実を網羅する実際の工場でのユースケースにFLUX-mimicを展開しました。