AI・機械学習
Xiaomi-Robotics-1: 実世界での10万時間以上の軌跡データを用いたビジョン・言語・アクションモデルのスケーリング
Xiaomi-Robotics-1 (robotics.xiaomi.com)
要約
Xiaomi-Robotics-1は、ロボットポリシーモデルのスケーリングにおけるデータ不足の問題を解決するため、大規模な具現化フリー(UMI)事前学習と、実ロボットデータを用いた事後学習を組み合わせたアプローチを提案しています。このモデルは、膨大なUMIデータで汎用的な行動生成能力を学習し、その後、実ロボットデータでアライメントを行うことで、物理的なロボットへの応用を可能にします。実験の結果、事前学習のデータ量やモデルサイズを増やすことで、実ロボットでの性能が予測可能に向上することが示されました。
全文翻訳
データバリアを打ち破る。具現化フリー事前学習によるロボットポリシーモデルのスケーリング。
言語とビジョンにおける基盤モデルは、経験的なスケーリング則に乗ることでフロンティアを押し広げ続けています。すなわち、能力はデータ、パラメータ、コンピューティングに追随します。ロボット工学はこれに乗り遅れていました。大規模で高品質なデータは入手が困難であり、その希少性が、ポリシーモデルがどこまでスケーリングできるかを制限する最大の要因となっています。真に大規模なトレーニングの下でロボットが何を行えるかは、依然として大きな未解決の問題でした。私たちはその答えに一歩近づきます。Xiaomi-Robotics-1は、大規模な具現化フリー(UMI)事前学習と、事後段階での適度な量の実ロボットデータを組み合わせています。私たちは、モデルがスケーリングするにつれてどのように振る舞うかを研究します。
データ
Xiaomi-Robotics-1ができることのすべてはデータから始まります。事前学習では、1,700以上のシナリオ(家庭、商業施設、産業現場、屋外空間)にまたがる10万時間の具現化フリー(UMI)軌跡を使用し、多様なタスクをカバーしています。私たちはスケーラブルな自動ラベリングパイプラインを開発し、まず軌跡を固定長のセグメントに分割し、次に各セグメントにシーンの状態遷移の言語記述をアノテーションします。
事後学習では、社内のロボットデータ、フィルタリングされたオープンソースのロボットデータ、および高品質なUMIデータセットを含むクロスエンボディメントデータセットを活用します。社内データについては、実際の家庭で7,200時間以上の実ロボットデータを収集し、ソファの片付け、靴箱の整理、キッチン用品の片付けなどのタスクをカバーしました。UMIデータは、事前学習データで使用される自動ラベリングされた状態遷移記述とは異なる、時間セグメントと指示プロンプトで手動でアノテーションされています。
方法
LLMのトレーニングパラダイムに従い、Xiaomi-Robotics-1のトレーニングは事前学習と事後学習の2つの段階で構成されます。最初の段階では、大規模なUMIデータから行動生成のための汎用的な表現を学習し、事後学習段階では、モデルを実ロボットの具現化と指示追従能力にアライメントします。
事前学習
事前学習は幅広さに関するものです。モデルを可能な限り多くの実世界に触れさせます。上記で説明した具現化フリーUMIデータを使用し、広範な環境とタスクをカバーします。この規模では、手動ラベリングは実行不可能であるため、強力なビジョン言語モデル(VLM)を搭載した自動アノテーションパイプラインを構築しました。長いビデオは固定長のクリップに分割され、VLMは各クリップ内のグリッパーと相互作用するオブジェクトの状態遷移を記述します。これにより、言語によって記述された状態遷移に向けてシーンを駆動する行動生成を学習できる、大規模な実世界操作軌跡コーパスが得られます。
有望な発見は、事前学習がクリーンなスケーリング動作を示すことです。データとモデルサイズが増加するにつれて、検証行動誤差は着実に減少します。
事後学習
事後学習は、事前学習から獲得した強力な行動生成能力を、2つの軸に沿って実ロボットの具現化と自然言語指示追従にアライメントすることを目的としています。具現化アライメントは、高品質なクロスエンボディメント実ロボットデータを使用して、汎用的な行動生成能力を実際のロボットにマッピングします。指示アライメントは、モデルを「シーンの状態遷移の記述を与えられた行動を生成する」から「自然言語の指示を理解し、それを直接実行する」へとシフトさせます。
事後学習後、Xiaomi-Robotics-1は、実世界で幅広いモバイル操作タスクを実行するために、そのまま(out-of-the-box)使用できます。事後学習後、事前学習からのスケーリング動作が実ロボットのパフォーマンスに転移するかどうかを理解するために、事後学習済みモデルを未知の環境で未知のオブジェクトインスタンスで評価します。
答えは「はい」です。事前学習データ量とモデルサイズを増やすにつれて、実ロボットの成功率は着実に予測可能に上昇します。つまり、より強力な事前学習済みモデルは、より良い実ロボットのパフォーマンスをもたらします。スケーリングゲインには飽和の兆候は見られません。事前学習中にモデルがより多くのデータを消費したり、スケールアップしたりするにつれて、事後学習後の実ロボットの成功率は向上し続けます。
アプリケーション
事後学習後、Xiaomi-Robotics-1は、下流アプリケーションのための強力なロボット基盤モデルとして機能します。Xiaomi-Robotics-1を2つの補完的な下流設定で使用します。新しいタスクへの効率的な適応は、タスクあたり数時間のデータから、ブランドニューで非常に複雑な実ロボットタスクにモデルを特化させます。シミュレーションベンチマークは、汎化を重視する主流のスイートでその能力を調査します。
新しいタスクへの効率的な適応
Xiaomi-Robotics-1は、高いデータ効率で新しいタスクを学習できます。モデルは、タスクあたりわずか数時間の実際の実ロボットデモンストレーションから、電話の梱包、プリンターの補充、洗濯物の積み込み、箱詰めなどのタスクを習得します。タスクあたり平均10時間未満のデモンストレーションで、すでに75%の全体的な成功率を達成しており、同じ予算でのπ0.5ベースライン(40%)をほぼ倍増させています。予算を平均40時間未満に引き上げると、全体的な成功率は85%に向上します。
タスク
<10 h/task on average
<40 h/task on average
XR-1 ours
π0.5
XR-1 ours
π0.5
Phone Packing
70
30
80
40
Printer Refilling
70
20
60
20
Laundry Loading
80
40
100
50
Box Packing
80
70
100
100
Overall
75
40
85
53
新しいタスクの効率的な学習の評価。各セルは成功率(%)を示し、高いほど良い。XR-1 = Xiaomi-Robotics-1。
シミュレーションベンチマーク
4つの主流シミュレーションベンチマークでXiaomi-Robotics-1を評価します。すべてのベンチマークで最先端の結果を達成しています。表は、平均成功率と2位との相対的なゲインを示しています。これらの結果は、Xiaomi-Robotics-1の汎化とスケーリングゲインが標準的なシミュレーション評価に引き継がれることを示しています。
Benchmark
XR-1 ours
2nd Best
Rel. Gain
RoboCasa
74.5
72.6
+2.6%
RoboCasa365
57.4
46.6
+23.2%
VLABench
59.1
53.2
+11.1%
RoboDojo
13.9
38.8
0
+58.3%
シミュレーション評価。すべてのベンチマークは平均成功率(%)を報告します。XR-1 = Xiaomi-Robotics-1; Rel. Gain = (XR-1 − 2nd best) / 2nd best。高いほど良い。
RoboCasa365リーダーボード(2026年7月15日現在)
RoboDojoリーダーボード(2026年7月15日現在)
結論
Xiaomi-Robotics-1は、ロボット基盤モデルをスケーリングするための実用的なパスを示しています。大規模な具現化フリーUMI事前学習はロボットデータボトルネックを打破し、実ロボットおよび指示アライメントは、その汎用的な能力を物理ロボットに転送します。結果は、モデルが事前学習中にデータ量とモデルサイズでうまくスケーリングし、このスケーリング動作が事後学習に直接転移することを示しています。そこでは、より強力な事前学習済みモデルが、未知の環境でのそのまま(out-of-the-box)の実ロボットパフォーマンスを向上させます。結果として得られる基盤モデルは、最小限のデータから新しいタスクに適応し、汎化を重視する4つの挑戦的なシミュレーションベンチマークで最先端のパフォーマンスを達成します。
最後に、荷造りの未編集映像を公開します。
引用
@article{guo2026xiaomi,
title={Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories},
author={Guo, Jun and Jin, Piaopiao and Li, Jason and Li, Peiyan and Li, Yingyan and Liu, Futeng and Peng, Wanli, and Qin, Optimus and Su, Yifei and Sun, Nan and others},
journal={arXiv preprint arXiv:2607.15330},
year={2026}
}
Copy