科学・技術
ロボティクスが難しい理由
Reasons robotics is hard (secondthoughts.ai)
要約
AIの進歩は知識労働の分野で顕著ですが、物理的な作業を行う汎用ロボットの開発は、デモ映像では見えにくい多くの技術的課題に直面しています。人間の手のような器用さ、複雑な視覚情報の理解、環境に応じた計画と反応、そして実世界での学習や協調といった要素は、現在のロボット技術にとって克服すべき大きなハードルです。
全文翻訳
ロボティクスが難しい14の理由
そしてなぜデモ動画を無視すべきなのか
AIの進歩は急速に進んでいますが、目に見える進歩のほぼすべては知識労働、つまりコンピューター内で実行できる活動の領域にあります。
サンフランシスコのAIシーンでは、ロボットが間もなく登場するという広く信じられている見方があります。広く汎用的なAIを開発する競争と並行して、広く汎用的なロボット、すなわち物理的な知能を備えた人間型機械を開発する同様に積極的な競争があります。料理や掃除、物を運んだり、さらには自分たち自身をさらに多く構築したりすることまで、多くの予測では「爆発」と特徴づけられる経済成長につながる、あらゆることを行うことができる人工労働者です。
もちろん、偉大なシドニー・ハリスによるこの古典的な漫画に触発されています。
言い換えれば、データセンターのAIはすぐにすべての知的労働を吸収し、人間型ボディのAIはすぐにすべての肉体労働を吸収するという考え方です。しかし、重要な違いがあります。知的領域では進歩を見ることができますが、AIの物理的な側面はほとんどテスト施設とデモ動画に限定されています。ChatGPTに相当するものはなく、あなたや私、あるいはAIコミュニティのほとんどの人でさえ、実際に手に取れるものはありません。
そのため、私たちはデモ動画に頼っています。残念ながら、進歩を評価するためのツールとしては不十分です。100回の試行のうち1回の成功したタスクを見ているのかもしれません。ロボットがまだ対応できていない課題を避けるように、シナリオが慎重に準備されている可能性があります。ビデオは、実際よりも速く信頼性高く動作しているように見せるために編集されているかもしれません。ここに非常に印象的なデモがありますが、疑わしいほど多くのカメラカットがあります。
(最近のワールドヒューマノイドロボットゲームからのビデオをまだあまり見る機会がありません。これらは、選択的な提示にあまり適さない公開プラットフォームを提供する上で価値があります。私がこれまでに見た数本のビデオには、いくつかの印象的な偉業が含まれていますが、以下に挙げる多くの課題には対処していません…そして、壮絶な失敗もたくさんあります。)
デモは、ロボットがすでにできることに注目を集めます。次に問題となるのは、何が欠けているのかということです。今日の投稿では、広く汎用的な人工労働者への道で克服しなければならない技術的な課題をカタログ化します。次にロボットが印象的なことをしているのを見たときは、自問してみてください。ロボットはこれらの能力のうちどれを実証したのか、そしてデモシナリオはどのような課題を回避している可能性があるのか?
(車輪付きロボットを厳密に人間型ロボットと比較した場合、一部の課題は容易になることに注意してください。車輪付きロボットはより多くの重量を運ぶことができるため、強度、耐久性、電子機器用の電力はそれほど大きな課題ではありません。そして車輪付きロボットは転倒しにくいです。しかし、それらは階段を上ったり、散乱物を乗り越えたり、戸棚の中に手を伸ばすために角度をつけたりすることはできません。)
手、器用さ、そして協調性
人間の最後の仕事の一つは、クロースアップマジックかもしれません。
人間の手は、対向する親指など、工学的な奇跡です。約24の「自由度」(各関節が曲がることができる独立した関節や方向)と、約17,000の触覚センサーを持っています。私たちの脳は、触覚、視覚、さらには聴覚の手がかりを使用して、非常に繊細なタスクを正確かつ確実に実行するために、手を見事に優雅に制御できます。
現在のロボットの「マニピュレーター」は、かすかな模倣にすぎません。一部の既存のロボットハンドは、1つまたは別の物理的属性で人間の基準に匹敵することができます。たとえば、一部には27もの自由度があります。しかし、柔軟性、感度、強度、信頼性、その他の物理的属性の全体的なパッケージに匹敵するものはありません。デモがますます印象的になっているとしても、特に一致させるのが難しいのは要因の組み合わせです。たとえば、一部の企業はロボットの指先に数千の触覚センサーを詰め込むことに成功していますが、これらの小さなセンサーが激しい使用に耐えられるようにした企業はありません。
制御の問題は、物理的な構築の問題と同じくらい困難かもしれません。有能なロボットは、複雑な物体を掴むための適切な関節位置を見つけ、シャツを折りたたむ、オムレツをひっくり返す、または限られたスペースでボルトを締めるための動作シーケンスを計画し、そして柔らかいまたはぐにゃぐにゃした素材(突然のシフトに即座に反応する必要がある場合があります)を扱う必要があります。
視覚的理解
コンピュータービジョンは過去10年から20年で信じられないほどの進歩を遂げました(そして、LLMを生み出したディープラーニングブームの火付け役となりました)。しかし、複雑な視覚シーンを理解すること、つまり混雑した環境から物体を選び出し、どこを掴むべきかを理解し、どこに足を置くのが安全かを判断し、何かを倒さないようにする方法を理解することは、解決された問題ではありません。
計画と反応
汎用ロボットは、タスクを個々のステップに分解し、それらのステップを環境に関連付ける必要があります。ねじ回しを機械の一部に挿入するために腕をどのように操作しますか?棚の奥にあるスパイスボトルへの道を開く最も速い方法は?リビングルームの床にあるアイテムをどの順序で拾い上げますか?
真の自律性には、より大規模で複雑なタスクの計画が必要になります。食事を作る、バスルームの配管をする、エンジンを修理するなどです。詰まったボルト、腐った農産物、キッチンに飛び込んできた子供など、予期せぬ事態に直面して再計画する必要性はもちろんのことです。
購読
指示の理解
現在のAIが知識労働タスクで失敗する場合、それはしばしば十分なコンテキストが提供されなかったためです。ロボットもコンテキストを必要とします。消耗品はどこに保管されていますか?食事はどのように調理するのが好きですか?その介護施設の入居者はどれくらいの介助が必要で、歩き方のぎこちなさは正常なのか、それともつまずきそうになっている兆候なのか?
コンテキストが得られたら、ロボットは推論、計画、そして判断力と常識を行使する必要があります。ChatGPTやClaudeのようなLLMベースのシステムはこれらの分野で大きな進歩を遂げていますが、物理的な領域はさらなる課題をもたらします。
LLMの成功は、トレーニングのために利用可能な既存のデータの大規模なプール(これまでに書かれたすべての書籍、ウェブ、その他の大規模な既存データプールの一部)によって大いに助けられました。物理的なタスクのために、この規模の広さと深さのデータを一致させることは困難でしょう。「単に」という単純な同等物はありません。
効率的な学習、一般化、および適応性/オンザジョブ学習は要件のように思われます。
協力
AIエージェントはほとんど孤立して、静的な環境で動作します。私たちはそれらを、状況が変化している状況に置いたり、協調を求めたりすることはめったにありません。そうした場合、物事はしばしば混乱します。プライベートワークスペースを自由に作成でき、何も持ち上げるのが重すぎない仮想世界では、孤立を手配するのは容易です。ロボットはしばしば、人々と、あるいは互いに協力する必要があります。
速度
「H1がソファに移動し、1枚の衣類を手に取って洗濯機に入れるのにほぼ2分かかった」と述べている記事から。
今日の汎用ロボットは、人間のスピードよりもはるかに遅く動くことがよくあります。課題には、強度、制御(速度が速いほど計画と反応の時間が短くなる)、および安全性(速く動くロボットはより強くぶつかり、回避するのが難しい)が含まれます。
一部のアプリケーションでは、遅くて着実でも完全に許容できる場合があります。夜通しかけて洗濯物を片付けたり、たたんだりしてもらっても構わないかもしれません。しかし、低速のロボットは、料理人や介護士としてはあまり役に立ちません。倉庫では邪魔になるかもしれません。そして、それ自身の費用を賄うのに十分な仕事をするのが難しくなるでしょう。
強度
これは、大人のロボットにとって、それほど印象的な重量ではありません。
一部の産業用ロボットは非常に強力です。しかし、人間型ロボット、または他の高度に移動可能な「汎用」ロボットは、通常そうではありません。 comb