HN 日本語サマリー

← 一覧へ戻る
AI・機械学習

Transformer Transformer: モーション条件付きロボット共同設計のための統一モデル

Transformer Transformer: A Unified Model for Motion-Conditioned Robot Co-Design (transformer-transformer.github.io)

67 pointsby ilreb8 コメント

要約

本研究では、特定のタスクに最適化されたロボットを設計する「Transformer Transformer」という統一モデルを提案しています。このモデルは、操作デモンストレーションを入力として受け取り、リンク、ジョイント、モーター、慣性特性を含む完全なロボットを生成します。この設計により、特定のタスクにおける追従誤差を大幅に削減することが実証されました。

全文翻訳

Transformer Transformer: モーション条件付きロボット共同設計のための統一モデル Huy Ha, Karen Liu, Shuran Song 論文 arXiv 動画 コード すべてのロボットが平等に作られているわけではありません — しかし、特定のタスクのためにロボットを設計できたらどうでしょうか?私たちはTransformer Transformerを提案します。これはまさにそれを実行する統一モデルです。操作デモンストレーションを与えると、そのモーションに最適化された、リンク、ジョイント、モーター、慣性特性のすべてを含む完全なロボットを生成します。私たちは、ALOHA2バイマヌアルプラットフォーム上で布を振り回すためにそのような設計を製造しました。その結果、元のロボットと比較して追従誤差が73%、最大ジョイント速度が30%減少しました。 その結果の背後にあるのは、ロボットの具現化、状態、およびアクションの統一されたトークン化であるRoboTokensでトレーニングされた拡散トランスフォーマーです。同じアーキテクチャは、具現化空間(車輪付きバイマヌアル、四足歩行、ヒューマノイド)とユースケース(具現化生成、クロス・エンボディメント制御)にまたがります。1つの報酬関数に過学習するのではなく、これはダイナミクスモデルであり、その報酬に依存しない予測は、推論時に報酬固有の値予測に変換され、Dynamics Self-Guidanceと呼ばれる手順を通じて具現化拡散を誘導するために使用されます。3つの設計空間にわたる実験は、進化ベースラインよりもパフォーマンスと実行時間を向上させ、未知の報酬と軌道のゼロショット最適化を示しています。 テクニカルサマリー動画 17分間のウォークスルー — または、図とキャプションのバージョンをご覧ください。 特定の操作タスクに最適なロボットとは何でしょうか?ロボットの具現化(embodiment)は、どのようなタスクをうまくこなせるかを決定します。私たちは、ロボットをより賢くすることに力を注いでいます — より大きなデータセット、より良いアルゴリズム、より有能なポリシーアーキテクチャ — しかし、悪い具現化は、優れたポリシーさえも妨げることがあります。あなたは世界中のあらゆる投げ上げデータを収集できるかもしれませんが、ロボットの形状が最適からかけ離れていれば、ボールではなく自分自身を投げてしまうかもしれません。 したがって、問題を具体的に定式化しましょう。目標のエンドエフェクタモーションと報酬関数を入力として与えられた場合、タスクのために完全なロボットの具現化を生成したい — 完全とは、すべてのリンク、ジョイント、モーター、および慣性特性、さらに全体を駆動するコントローラーを意味します。これをモーション条件付きロボット共同設計と呼びます。 目標モーションを実行しようとするランダムに手続き的に生成されたロボット:完了前に倒れてしまいます 🙃 デモンストレーション、生成、検証 私たちのフレームワークは、ロボット共同設計を3段階のプロセスとして再構築します。あなたは望ましいエンドエフェクタモーション(例:UMI3人間のデモンストレーションから)をデモンストレーションし、私たちのモデルは最適化された具現化を生成し、同じモデルがそれを直接制御することによって設計を検証します。同じネットワークが、ロボットの統一されたトークン化で共同トレーニングすることにより、ジェネレーター、クリティック、クロス・エンボディメントコントローラーの3つの役割を果たします。3つのステップ、1つのモデル。 目標のエンドエフェクタモーション(例:人間のデモから)とユーザー定義の報酬を与えると、Transformer Transformerは完全なロボット(ジオメトリ、キネマティクス、慣性、モーター)を生成し、そのロボットを制御してモーションを追跡します。個別のオプティマイザー、クリティック、またはコントローラーパイプラインはありません。 この論文は3つの部分からなります:統一ロボット表現(RoboTokens)、統一アーキテクチャ(Transformer Transformer)、および統一トレーニング目的(Dynamics Self-Guidance)。アーキテクチャセクションまで、この言葉遊びの意味を理解できるはずです 🥸 パート1 RoboTokens 統一ロボット表現 すべてのロボットが型付きトークンシーケンスになります。青いトークンは具現化(リンク、ジョイント、モーター)をエンコードし、オレンジ色のトークンはダイナミクス(状態とアクション)をエンコードします。同じトークナイザーが、四足歩行ロボット、ヒューマノイド、または器用な手を摂取します — ロボットごとのアダプターはありません — そのため、単一のモデルがそれらすべてから学習できます。 もし私たちが任意のロボットを共同設計できる1つのモデルを望むなら、ネットワークはすべての具現化にまたがる共有語彙を必要とします。RoboTokensはその語彙です:リンク、ジョイント、モーター、状態、およびアクションの各タイプに対する型付きトークン — ロボットの具現化(時間不変)とダイナミクス(時間変化)の両方を記述する単一のシーケンスに編成されています。 RoboTokensには以下の主要な設計目標があります: 完全性。RoboTokenシーケンスは、剛性関節ロボットに関するすべてをキャプチャします:5つの具現化トークンタイプ(リンク、固定ジョイント、回転/スライドジョイント、ボールジョイント、モーター)に加えて、状態とアクションのトークン。 柔軟性。トークンはIDで互いに参照します — ジョイントトークンは、それが接続する2つのリンクトークンを知っています — そのため、同じ形式が6自由度の腕または35自由度の二足歩行ロボットを処理できます。 一貫性。トークナイザーは冗長な空間オフセットを正規化し、慣性/変換データを単一のフレームに格納することで、モデルが学習する必要のある分散を減らします。 拡張性。新しいトークンタイプは、アーキテクチャを変更せずにスロットインできます — ターゲットのエンドエフェクタとタイムステップIDを指すことで、軌道追従のためのターゲットエンドエフェクタポーズトークンを追加します。残りのロボットの再トークン化は不要です。 最適化可能性。MJCFのような自己回帰テキスト形式とは異なり、連続値のRoboTokensを拡散することは、グローバルな制御可能性(デノイジングステップ全体で後続のトークンが先行トークンに影響を与える)と微分可能性の両方を提供します — これらは推論時に勾配ベースの報酬最適化に必要な2つの要素です。 私たちは、質量が2桁(0.65 kgの器用な手から67.5 kgの四足歩行ロボットまで)およびアクティブジョイントが6から35の範囲で、MuJoCo Menagerie10から11のロボットをトークン化しました。それぞれが28〜101のRoboTokensのシーケンスになりました — エンドツーエンドで拡散するのに十分小さいです。RoboTokensはMJCFテキストよりも27〜110倍コンパクトです。ロボットの完全な説明は、言語トークナイザーが数千(グレーのカウント)を必要とするのに対し、数十の型付きトークン(青のカウント)に収まります — トランスフォーマーがXMLを自己回帰的に記述するのではなく、直接拡散できるほど小さいです。 パート2 Transformer Transformer 統一アーキテクチャ モデルは、DDIM4ノイズスケジュールでRoboTokensでトレーニングされた拡散トランスフォーマー(DiT1)です。条件付けするトークンを除くすべての入力トークンにノイズが追加されます — そして、どのトークンがマスクされるかを変更することで、同じネットワークが異なる役割を担います。すべてをマスクすると、条件なしのロボットジェネレーターが得られます。アクションをマスクすると、クロス・エンボディメントコントローラーが得られます。具現化をマスクすると、モーション条件付きロボットデザイナーが得られます。同じ重みで、ダイナミクスで共同トレーニングされます。(そして、言葉遊びについて:最初の「Transformer」は、具現化が変化できるロボットを指します。2番目は自己アテンションアーキテクチャを指します 🥸) 1つのアーキテクチャ、2つのユースケース。(a)モーション・ツー・ロボット最適化は、具現化とダイナミクストークンを共同で拡散します。(b)クロス・エンボディメント制御は、具現化と目標モーションを条件としてアクションを拡散します。 推論時に、モデル自身の予測は報酬予測に変換され、その勾配がより高い報酬の設計へと生成を誘導します。 具現化を認識するコントローラー コントローラーは完全な具現化を入力として見るため、駆動するロボットに合わせて制御戦略を調整できます。リンクの慣性、ジョイント範囲、またはモーターゲインを変更しても、同じポリシーが追跡を続けます — ロボットごとに再トレーニングすることなく。 私たちは、手続き的な四足歩行ロボット空間で1つずつトレーニングされたRLエキスパートから、全身コントローラーのビヘイビアクローンを作成しました。1つのポリシー、多くの四足歩行ロボット。 同じコントローラーが、連続的なバリエーション(リンク寸法)と離散的なバリエーション(DoF、スプリングロードまたはシリアルレッグ、膝の方向)を持つ四足歩行ロボット全体で同じ軌道を追跡します。 多様なロボットクラスのジェネレーター 条件付けなしでモデルを実行すると、ガウスノイズから完全なロボットが拡散されます。Menagerie10の多様なロボットでトレーニングされた単一のTransformer Transformerは、固定ベースのアーム、四足歩行ロボット、ヒューマノイド、および器用な手を生成します。拡散は確率的であるため、実行ごとに異なるロボットが得られます。 ロボット、拡散。 単一のモデルが、同じノイズスケジュールから固定ベースのアーム、四足歩行ロボット、ヒューマノイド、および器用な手を生成します。 パート3 Dynamics Self-Guidance 報酬のゼロショット化 さて、実際の共同設計の問題です:トレーニング中にモデルが見たことのない報酬関数に対して、どのように高報酬のロボットを生成するのでしょうか?