AI・機械学習
MistralのRobostral Navigate:最先端のロボットナビゲーションモデル
Mistral's Robostral Navigate: a state of the art robotics navigation model (mistral.ai)
要約
Mistral AIは、単一のRGBカメラのみでロボットが複雑な環境を自律的にナビゲートできる8Bモデル「Robostral Navigate」を発表しました。このモデルは、複数のセンサーを使用するアプローチを上回りながらも効率的で、未見のR2R-CEベンチマークで76.6%の成功率を達成しています。シミュレーションで訓練されたデータとトークン効率の高い技術を用いて完全に自社開発されており、ロボットの種類を超えて汎化し、訓練中に見られなかった実世界の障害物にも適応します。
全文翻訳
← + − → Robostral Navigateの紹介
思考の要約
Robostral Navigateは、ロボットが単一のRGBカメラのみを使用して複雑な環境を自律的にナビゲートできるようにする8Bモデルであり、未見のR2R-CEベンチマークで76.6%の成功率を達成しています。これは、複数のセンサーを使用するアプローチを上回りながらも、より効率的です。シミュレーションで訓練されたデータとトークン効率の高い技術を用いて完全に自社開発されており、ロボットの種類を超えて汎化し、訓練中に見られなかった実世界の障害物にも適応します。このモデルは、ロボット工学における統一された具現化されたAIへの道を開くため、継続的な改善のためにポインティングベースのナビゲーションと強化学習を組み合わせています。
本日、具現化されたナビゲーションのために構築された最初のモデルであるRobostral Navigateを紹介します。これは、RGB画像と平易な言語の指示を受け取り、ロボットを環境内を移動させる8Bモデルです。「ロビーを出て、廊下を歩き、倉庫に入り、2番目の棚を向いて停止してください。」のようなタスクを実行するために、他のモデルはしばしば深度センサー、LiDAR、または複数のカメラを連携させて使用します。Robostral Navigateは、通常のRGBカメラ1台のみを使用し、深度センサーは使用しませんが、それでもR2R-CE(Continuous EnvironmentsでのRoom-to-Room)の検証済み未見データで76.6%を達成しており、これは環境内で指示に従うことのベンチマークです。その結果、深度センサーや複数のカメラを使用しないにもかかわらず、単一カメラのアプローチの最高値を9.7ポイント、深度または複数のカメラを使用するシステムを4.5ポイント上回っています。
ナビゲーション
当社のモデルはロボットナビゲーションのために設計されており、オフィス、住宅および商業ビル、屋外の設定を含む複雑な環境をロボットが自律的にナビゲートできるようにします。
Robostral Navigateが、1つの長距離指示ルートを、稼働中のオフィス内で完全に自律的に実行している様子。
この技術は、製造、配送、物流、ホスピタリティ分野で数多くのアプリケーションを可能にし、今日、お客様にとって最も需要の高い機能の1つとなっています。Robostral Navigateに1つの指示を与えると、それはタスク全体を単独で完了し、人々や障害物で満たされた実際の空間を移動します。これらの障害物は訓練中に一度も示されたことがなく、あらゆる設定に適応する能力があります。
ハイライト
* R2R-CEにおける最先端のパフォーマンス
* 検証済み見込みデータでの成功率 79.4%
* 検証済み未見データでの成功率 76.6%
* 単一RGBカメラから動作、LiDARまたは深度センサーなし
* 8Bモデル、自社開発、完全にシミュレーションで訓練済み
* 車輪付き、脚付き、飛行ロボットで動作し、ロボットサイズを超えて汎化
* カメラの内部パラメータの違いに対して堅牢
* プレフィックスキャッシングによるトークン効率的な訓練
成功率
* 成功率
* パス長で重み付けされた成功率
* ナビゲーションエラー
ポインティングによるナビゲーション
タスクと観測履歴が与えられると、Robostral Navigateはポインティングによってロボットが次にどこに移動すべきかを予測します。これは、ターゲットの画像座標をロボットの現在のカメラビュー内で推測し、到着時の望ましい向きとともに示します。メトリック変位に依存するコマンドとは異なり、ポインティングはポリシーをカメラの内部パラメータや世界のスケールの変化に対して自然に堅牢にします。しかし、この方法では、ターゲットの場所が現在の視野の外にあるケースを処理できません。ポインティングが適用できない場合、モデルは変位にフォールバックします。これはロボットのローカル座標系での変位です。例えば、「2メートル前進、1.5メートル左へ移動し、25度左に回転する」といった指示です。
ゼロから構築
Robostral Navigateは完全に自社開発されており、既存のオープンソースVLMに依存していません。このモデルは、ポインティング、カウント、オブジェクトのローカライゼーションなどのグラウンディングタスクに特化したビジョン言語モデルから初期化されています。ナビゲーションは、これらの機能の自然な拡張として現れます。物事がどこにあるかを理解すれば、移動方法を学習します。私たちは、完全にシミュレーション内で効率的なデータ生成パイプラインを構築しました。これにより、データに対する迅速なイテレーションが可能になり、6,000シーンにわたって収集された約400,000の軌道のデータセットが作成されました。
効率的な教師あり学習
Robostral Navigateの重要な要素は、プレフィックスキャッシングに基づいた効率的な訓練アルゴリズムです。ツリーベースの注意マスキング戦略を使用して、私たちの方法はエピソード全体を単一のシーケンスに圧縮し、時間ステップ間の情報漏洩を防ぎながら、単一のフォワードパスですべての時間ステップで訓練できるようにします。時間ステップごとに1つのサンプルで訓練する場合と比較して、私たちの方法は学習信号をすべて保持しながら、訓練トークン数を22倍削減します。実際には、この方法は数ヶ月かかる訓練実行を数日で完了する実行に変えます。
オンライン強化学習
私たちは、Robostral Navigateのパフォーマンスを向上させるために、オンライン強化学習を使用して、大規模なポストトレーニングLLMに関する知識を活用します。教師あり学習ステージの後、オンライン強化学習アルゴリズムであるCISPOを使用してモデルのパフォーマンスをさらに向上させます。これにより、試行錯誤から学習し、失敗から回復し、探索的な行動を獲得できるようになり、バニラ行動クローニングの分布シフト問題を効果的に軽減します。これだけで成功率が3.2%向上しました。私たちはプラトーを見ていないため、さらなる訓練と実験がこの数値をさらに押し上げると確信しています。
次は何へ
Robostral Navigateは、統一された具現化されたエージェントに向けた最初のステップにすぎません。ナビゲーションは、汎用ロボット工学の基盤となる能力であると信じています。大規模なシミュレーション、効率的な訓練、強力なグラウンディングプライアーズを組み合わせることで、Robostral Navigateは、コンパクトなモデルと単一のRGBカメラで最先端の具現化されたナビゲーションが達成できることを示しています。具現化されたフロンティアAIへの旅を始めましょう、私たちのチームと話してください。ところで、私たちは採用しています!ナビゲーションモデルのリリースは大きな前進ですが、私たちの旅はまだ終わっていません。私たちの野心は、ロボットがオフィス、家庭、商業ビル、屋外スペースなどの複雑な環境を自律的にナビゲートできるようにすることであり、まだまだ多くの作業があります。私たちはロボット工学チームを積極的に拡大しており、私たちの野心を共有する才能あるリサーチサイエンティストやエンジニアを探しています。ロボットにどこでもシームレスなナビゲーションをもたらすという私たちの使命に参加することに興味がある場合は、私たちのチームに参加するための応募を歓迎します!
By Théo Cachet, Arjun Majumdar, Srijan Mishra, Thomas Chabal, Chris Bamford, Elliot Chane-Sane, Benjamin Tibi, Ludovic Ho Fuh, Olivier Duchenne - AI Science Robotics