HN 日本語サマリー

← 一覧へ戻る
AI・機械学習

Flux 3

Flux 3 (bfl.ai)

538 pointsby ThouYS125 コメント

要約

Baiduは、画像、動画、音声の3つのモダリティを統合的に学習する新しいマルチモーダル基盤モデル「FLUX 3」を発表しました。このモデルは、単一モダリティの限界を超え、現実世界の複雑な相互関係を理解し、コンテンツ生成や物理AIなどの分野で応用されることを目指しています。現在、早期アクセスが提供されており、APIやオープンウェイトアクセスを通じて、動画・音声生成、画像合成、アクション予測などの機能が順次展開される予定です。

全文翻訳

ブログに戻る モデル リサーチ FLUX 3 - 実世界モデル:マルチモーダルフローモデルをビジュアルインテリジェンスのバックボーンとして。 FLUX 3が早期アクセスで利用可能になりました。 FLUX 3は、当社の新しいマルチモーダル基盤モデルです。単一の要素を孤立して学習するのではなく、画像、動画、音声を統一されたアーキテクチャ内で共同で学習します。なぜなら、モデルが学習する必要があるのは、これらの要素のいずれか一つだけではないからです。むしろ、モデルは世界の表現を学習する必要があります。オブジェクトがどのように組み合わさるか、物事がどのように動くか、イベントがどのように聞こえるか。 単一のモダリティは完全な説明を提供しません。それぞれが同じ根本的な現実の投影であり、異なるセンサーによって捉えられ、それぞれがその過程でいくらかの情報が失われます。画像は、特定の時点での空間構造と関係を捉えます。動画は、時間の次元を回復し、時間的ダイナミクスと物理法則を明らかにします。音声は、視覚だけでは検出できない機械現象と音響の関係を明らかにします。言語は、これらの知覚を目標、抽象化、指示と結びつけます。 一つから学習すると、その投影の良いモデルが得られます。それらすべてから同時に学習すると、それらの相互制約がより多くのことを教えてくれます。音は衝撃に一致しなければならず、運動は質量に従わなければならず、未来は過去に従わなければなりません。モダリティは別々であることをやめ、一つの根本的な現実についての証拠となり始めます。 FLUX 3は、その原則に基づいて完全に構築された最初のモデルであり、実世界ビジュアルインテリジェンスを開発するという当社のミッションにおけるチェックポイントです。このモデルは、物理的およびデジタル環境全体で知覚、予測、行動できます。コンテンツ作成および物理AIにおける初期の結果は、これが正しい道であることを示唆しています。 FLUX 3:一つのモデル、複数の機能。 FLUX 3は、同じ根本的なアーキテクチャ内でマルチモーダル生成と理解を効率的に調整するためのアプローチであるSelf-Flowを基盤としています。このアプローチに基づき、動画、画像、音声全体でFLUX 3を同時にトレーニングするために、コンピューティングおよびデータリソースを大幅にスケールアップしました。 Self-Flow vs. Flow Matching (FM)。左:モダリティごとの生成エラー(Fréchet距離)、それぞれFM = 100に正規化(低いほど良い)。右:ファインチューニングによる操作タスクの成功率(4つのタスクグループの平均)(高いほど良い)。 機能と初期評価 その結果、FLUX 3はモダリティを混合し、純粋なテキストプロンプトから、または画像や動画などの入力参照を提供した場合の両方から、画像と動画+音声を共同で生成できます。モデルの主要な機能のいくつかを以下に紹介します。 動画 FLUX 3は、単一の生成で最大20秒の音声付きで、非常に多様な動画を作成できます。 そのコア機能は以下の通りです(すべての出力にはネイティブ音声生成が含まれます)。 テキストから動画への生成。 画像から動画への生成(開始フレームからの継続(「アニメーション」)または画像を参照として使用)。 参照クリップからの動画から動画への生成。ソース動画の中心的な要素(例えば同じキャラクター)を新しいシーンやコンテキストに持ち込みます。 入力動画と音声からの生成的な動画・音声継続。 キーフレームから動画への生成。定義された瞬間間の制御された遷移のため。 多言語対話。 従来の映画的な出力から遠く離れた、幅広いビジュアルスタイルとアスペクト比。 個々のクリップをより長く、マルチショットのシーケンスにエージェント的に連鎖させること。 高いスタイル多様性 -- FLUX 3 Videoは、キャンディッドなカムコーダー映像からアニメーション、シネマティックスまで、幅広いスタイルを容易に処理します。 強力なタイポグラフィ生成とアニメーションデザイン。 以下の予備分析では、720pで音声付きの10秒のテキストから動画へのクリップを生成しました。 評価は初期段階であり、さらなる改善が期待されます。 モデルとその周辺のハーネスはまだ開発中であるため、これらの結果は予備的なものであり、早期アクセス期間中にさらなる改善が期待されます。初期評価全体で、FLUX 3はGrok Imagine Videoと比較して最大69%で、Kling v3 Proと比較して60%で、Happy Horse v1と比較して59%で、Happy Horse 1.1と比較して57%で、Seedance 2.0およびGemini Omni Flashと比較して52%で好まれました。FLUX 3はRunway Gen-4.5と比較して77%で、Luma Ray 3.2と比較して93%で好まれました。 まだ開発中ですが、FLUX 3 Videoは人間の顔の表情を捉え、物理的なイベントに音を関連付け、多言語機能を備えている点で既に特に強力です。さらに、これらの機能は組み合わせて数分続くシーケンスを作成でき、視覚的な参照はキャラクターがすべてのシーンで一貫性を保つのに役立ちます。 FLUX 3 Videoは現在、こちらで早期アクセスが可能です。 画像 FLUX 3は、幅広いスタイル、アスペクト比、解像度で画像を合成および編集できます。中間トレーニング中に実施された予備評価では、FLUX 3は既に以前のFLUXバージョンと比較して大幅な改善を示しています。複雑なプロンプトとテキスト生成を処理する能力が大幅に向上しました。モデルは幅広い出力スタイルを生成し(以下のサンプルを参照)、複数の言語で高精度なテキストをレンダリングできます。 動画評価と同様に、これらは予備的な結果であり、リリース前にさらなる改善が期待されます。今後数週間でFLUX 3 Imageの早期アクセスを開始します。 アクション FLUX 3の世界理解はアクション予測にまで及びます。私たちはそれに2つのルートを取りました。一つは、Self-Flowの初期作業をスケールアップして、FLUX 3にネイティブなアクション予測を直接統合することです。もう一つは、特殊なアクションモデルが限定的なタスク固有データでファインチューニングできる、ダイナミクスを意識した基盤として、事前トレーニング済みの動画バックボーンを使用することです。 後者について、Mimic RoboticsはFLUX 3の早期アクセスを得た最初のパートナーの一つでした。私たちは共同で、FLUX 3バックボーンと、Mimicの器用な操作と生産展開におけるロボット学習の専門知識を組み合わせた動画・アクションモデルであるFLUX-mimicを開発しました。物理AIとコンテンツ作成が同じ基盤で実行される理由、そしてそれがAudiで実際の生産タスクでどのようにテストされているかについての私たちの論文をお読みください。 ローンチプラン 今後数週間から数ヶ月で、以下の機能を提供します。各機能は、スムーズなロールアウト、フィードバックの収集、および厳格な安全テストを確保するための早期アクセス期間を経て提供されます。すべての機能は、同じ根本的なマルチモーダルフローマッチングモデルから構築されています。これらの機能とモデルには以下が含まれます。 APIおよびプライベートウェイトアクセスを介した動画および音声生成と編集。(「FLUX 3 Video」) 選択された研究および商用パートナーを介したアクション予測。Mimic Robotics(「FLUX-mimicおよびFLUX 3 Action」)から開始。 APIおよびプライベートウェイトアクセスを介した画像合成と編集。(「FLUX 3 Image」) コンテンツ作成(動画、音声、画像)およびアクション予測のためのマルチモーダルバックボーンへのオープンウェイトアクセス。(「FLUX 3 Dev」) 基盤となるアプローチに関するより詳細な技術情報も公開します。 こちらから早期アクセスをリクエストしてください。 次は何ですか? 私たちは、汎用的で有能な統一マルチモーダルモデル、そしてそれらが可能にするものの表面をなぞり始めたばかりです。インタラクティブな画像・動画編集、シミュレーションからコンピューターの使用、物理AIまで、フロンティアは広大に開かれています。これらの新しい機能を徐々に展開しながら、私たちは既に次世代モデルに取り組んでいます。私たちの目標は、知覚、行動、言語予測を同じ統一モデルで統合することです。 FLUX 3を探求し、構築することに興味がある場合は、こちらからお問い合わせください。私たちのミッションに貢献することに興味がある場合は、私たちに参加してください!ドイツと米国で採用しています。