AI・機械学習
OpenWAM: Composable World-Action Modelsのためのオープンフレームワーク
OpenWAM: An Open Framework for Composable World-Action Models (openwam.stanford.edu)
要約
OpenWAMは、ロボット工学における世界モデルと行動モデルを統合・比較するためのオープンフレームワークです。異なるバックボーンやデータセットを使用するシステムに共通の基盤を提供し、ビデオ予測と行動生成の相互作用を研究できるようにします。このフレームワークは、モデル内の構成可能性とモデル間の接続性をサポートし、ロボットの知覚と制御の進歩を目指しています。
全文翻訳
世界–行動モデルのためのフレームワーク
ロボットは、行動を決定する前に、見るであろうことを予測すべきか、それとも両方を同時に生成すべきか?世界–行動モデルは、その両方を可能にします。各システムが異なるバックボーン、データセット、トレーニングレシピを使用している場合、これらの選択肢を比較することは困難です。OpenWAMは、それらに共通の基盤を提供し、予測と制御がどのように連携して機能するかを研究できるようにします。このフレームワークは、モデル内の構成可能性とモデル間の接続性をサポートします。ビデオと行動が生成される順序や、それらのトークンがお互いにアテンドする方法を変更できます。また、独立してトレーニングされたコンポーネントを接続することもできます。ビデオ予測器が未来を提案し、逆動力学モデルがそれを行動に変換し、順動力学モデルが提供された行動シーケンスが何をもたらすかを予測します。
図1. OpenWAMの概要。共通のビデオ基盤は、設定可能なビデオ–行動プログラムと独立してトレーニングされた動力学をサポートします。転移実験(右下)では、ビデオ予測器を各タスクに適応させ、IDMをさらにトレーニングせずに再利用します。フルサイズの図を見る↗
共通のビデオ–行動アーキテクチャ
行動を学習する前に、Wan2.2-5Bをロボットの動きと相互作用に適応させます。約334万の軌跡と記録(14.64k時間分のソースビデオ)を事前トレーニングします。これには、実際のロボット操作、人間による操作、人間との相互作用が含まれます。この段階では、行動ラベルや固有感覚入力なしで、ビデオのみを使用します。
事前トレーニングに使用されるもの
データセット | トラジェクトリ数 | 時間(時間)
Open X-Embodiment | 1,300,749 | 1,911.29
AgiBot World Beta | 1,003,672 | 2,976.4
Ego-Exo4D v2 | 5,035 | 221.26
InternData-A1 | 637,498 | 7,433.91
RoboCOIN | 183,157 | 1,306.83
RoboMIND | 107,877 | 305.5
FastUMI-100K | 92,823 | 461.77
UMI family | 5,430 | 24.60
論文表8 · トレーニングウィンドウサンプリング前のソースシーケンスの時間数(合成ビデオと人間との相互作用ビデオを含む)。OXEは49の操作データセットをカバーし、InternData-A1は合成データ、Ego-Exo4Dは人間との相互作用を記録します。UMIファミリーには、UMI、DexUMI、UMI on Legs、MV-UMIが含まれます。
因果アテンションにより、ビデオをチャンクごとに生成できます。各チャンクは、現在の観測と過去の観測、および以前のチャンクを使用できますが、それ以降のチャンクは使用できません。そのトークンは一緒にデノイズされます。32台のNVIDIA B200 GPUで14日間トレーニングした後、このチェックポイントは下流モデルの視覚的基盤を提供します。
ロボット制御を追加するために、5Bビデオエキスパートを2B行動エキスパートとMixture-of-Transformers(MoT)アーキテクチャでペアにします。行動エキスパートは、事前トレーニングされたビデオレイヤーの幅調整コピーから開始します。各エキスパートは独自の正規化、射影、フィードフォワードレイヤーを保持します。それらの結合されたトークンに対するアテンションにより、情報交換が可能になります。
図2. 共有MoTアーキテクチャ。5Bビデオエキスパートと2B行動エキスパートは、ビデオと行動トークンに対するアテンションを共有します。それぞれがタスク指示にもアテンドします。フルサイズの図を見る↗
ビデオ–行動インタラクションプログラム
同じアーキテクチャで、ビデオを生成してから行動を生成したり、行動を生成してからビデオを生成したり、あるいは両方を同時に生成したりできます。各インタラクションプログラムは、生成順序と将来のトークン間のアテンションを指定します。バックボーン、トークン化、トレーニング目的、下流レシピは固定され、各プログラムはタスク指示と観測履歴を受け取ります。
プログラム | 生成と条件付け
ビデオ先行行動(VTA) | まずビデオを予測し、そのビデオを条件として行動を生成します。
行動先行ビデオ(ATV) | まず行動を生成し、その行動を条件としてビデオを予測します。
共同(Joint) | ビデオと行動を同時にデノイズし、双方向のアテンションを使用します。
分離(Decoupled) | 将来のトークン間にアテンションがない状態で、ビデオと行動を生成します。
図3. アテンションマスク。A–D: 評価されたポリシープログラム。E–F: ローカル逆動力学と順動力学。色はクリーンまたはノイズのある条件付けを示し、数字は生成順序を示します。Lは言語、O−、O0、O+は過去、現在、将来の観測を示し、A+は将来の行動を示します。フルサイズの図を見る↗
すべてのプログラムは潜在フローマッチングを使用します。4つの潜在ビデオフレームが16ステップの行動チャンクごとに整列され、各チャンクごとに固有感覚が供給されます。VTAとATVでは、第2段階はトレーニング中に記録された軌跡から学習し、推論時には第1段階の予測を使用します。
ポリシーを超えて:ローカルコンテキストIDMとFDM
タスク条件付き予測器は、次に何が起こるべきかを提案します。動力学モデルは、その提案をロボットの動きに接続します。逆動力学(IDM)は視覚的な未来を行動に変換し、順動力学(FDM)は行動シーケンスの結果を予測します。OpenWAMは、これら両方をスタンドアロンモデルとしてサポートします。それらにローカルコンテキストインターフェースを提供します。現在の観測、固有感覚、および提供された将来の軌跡です。
ローカルコンテキストIDM: 現在の観測 + 固有感覚 + 提供された将来のビデオ → 行動軌跡。
ローカルコンテキストFDM: 現在の観測 + 固有感覚 + 提供された行動軌跡 → 将来のビデオ。
どちらのモデルもタスク言語や開始前の履歴を受け取りません。これにより、タスクの選択と遷移のモデリングが分離されます。ビデオ予測器を適応させ、同じIDMが依然として正しい行動を生成するかどうかを尋ねることができます。以下の実験では、このローカル情報がどこまで通用するかをテストします。ビデオ予測器は、トランスフォーマーの隠れ状態やキャッシュではなく、VAEビデオラテントをIDMに渡します。互換性のあるビデオと行動の表現があれば、コンポーネントは別々にトレーニングされ、推論時に接続できます。同様に、FDMは別のポリシーからの行動の結果を予測できます。
代替結果からの学習
デモンストレーションはデモンストレーターが選択したことを示しますが、他の行動がどのような結果をもたらしたかについてはほとんど情報がありません。モデルの入力を変更しても、トレーニングデータにおけるそのギャップは埋まりません。シミュレータの状態を復元し、代替の行動シーケンス(失敗したものを含む)を試すことにより、10のタスクにわたる32,000の対照セグメントであるLIBERO-Long-CFを構築します。モデルは、シミュレータ状態へのアクセスなしで、結果の観測と行動から学習します。
数量 | デモンストレーション | LIBERO-Long-CF
タスク | 10 | 10
保存されたシーケンス | 500 | 32,000
タスクごとのシーケンス | 50 | 3,200
シーケンスごとの制御 | 27 | 6.2(平均) | 128
合計制御 | 138,090 | 4,096,000
制御相当時間 | 1.92 | 56.9
論文表9 · 20Hzでの相当時間。各対照セグメントには128の制御と129の同期された2ビュー観測が含まれます。データセットには、元のタスク、アセット、物理演算を使用したデモンストレーションの29.7倍の制御レコードが含まれています。
対照ロールアウトで何が変わるか?
モーションの大きさ、方向、タイミング、個々のアクション軸、グリッパーの動作を変更します。75%のセグメントはデモンストレーションに沿って開始し、残りの25%は追加のアクション摂動後に開始します。
介入ファミリー | 割合(%)
アームモーションの停止/スケーリング | 9.4
並進の反転/リダイレクト | 6.3
軸バイアスとパルス | 12.5
専用ヨー摂動 | 3.1
ノイズ/ランダム化アーム制御 | 12.5
専用グリッパー介入 | 31.3
ランダム期間アーム/グリッパー介入 | 25.0
介入レシピ(%) · 論文表10。値は丸められています。異なるレシピは重複する物理的効果を生み出す可能性があります。摂動された開始状態の分析では、エンドエフェクタはデモンストレーションパスの最も近い点から平均3.34cm(中央値1.90cm)離れていました。オブジェクトは、61.6%の開始状態で、デモンストレーション構成を超えて移動します(しきい値は並進1cm、回転5°、関節駆動部トラベル5%)。
測定された相互作用率(%) | グリッパー–オブジェクト/固定具の接触 | 90.4
検出された把持 | 50.0
オブジェクト構成効果 | 72.3
相互作用率(%) · 論文表11。分析されたセグメントで測定。1つのセグメントは複数のカテゴリにカウントされる可能性があります。オブジェクトの変更は、同じ開始状態からの参照ロールアウトに対して測定されます。同じ開始状態からの分岐は、トレーニング/テスト分割で一緒に保持されます。各遷移は独自のトレーニング例を供給します。損失はペアの分岐を直接比較しません。デモンストレーションのみでトレーニングされたモデル、対照のみ(CFのみ)、および60%の対照と40%のデモンストレーションの混合でトレーニングされたモデルを比較します。P