HN 日本語サマリー

← 一覧へ戻る
AI・機械学習

ある程度、あらゆるものをシミュレーションする:ワールドモデルの可能性と限界

Simulating everything, sort of: The promise and limits of world models (arstechnica.com)

27 pointsby LorenDB1 コメント

要約

近年、AI分野では大規模言語モデル(LLM)に加えて、「ワールドモデル」と呼ばれる、物理世界またはその近似をシミュレーションすることを目指す新しいAIシステムが注目を集めています。LLMが言語処理に特化しているのに対し、ワールドモデルはロボット工学、研究、資産生成などの具体的な応用から出発し、物理的な相互作用や空間的理解を伴うリアルタイムなシミュレーションを可能にすることを目指しています。この新しい技術は、LLMの限界を克服し、AIの次のフロンティアとして期待されていますが、その定義やインターフェースについてはまだ発展途上です。

全文翻訳

ここ数年、多くの人々は人工知能、あるいは現在私たちがAIと呼んでいるものについて、集中的な学習を経験してきました。しかし、それは主に大規模言語モデル(LLM)に関するものでした。しかし、LLMはますますAI分野で期待、巨額の資金調達、そして重要な研究開発の対象となる唯一のカテゴリーではなくなりつつあります。過去1年間で、「ワールドモデル」というラベルが付けられたカテゴリーで数多くの新しい発表が見られ、今後数ヶ月から数年でさらに多くの動きが見られるでしょう。ワールドモデルは、言語を扱うこと、あるいはそれに加えて、物理世界、あるいは少なくともその有用な近似をシミュレーションできるAIシステムの基盤を築くことを目指しています。このアイデアの何が異なり、重要なのかを検証するために、Arsはワールドモデルおよび関連技術に取り組んでいる3人の専門家、MITのVincent Sitzmann氏、RunwayのAnastasis Germanidis氏、World LabsのBen Mildenhall氏に話を聞きました。これらの会話から、LLMベースの製品はインターフェース(チャット)から始まり、ユースケースを模索したのに対し、現在のワールドモデルの主要プレイヤーは逆の方向で作業していると言えます。つまり、ロボット工学、研究、資産生成における特定のユースケースとアプリケーションから始めているのですが、インターフェース、システム、ツールが最終的にどのように見えるかはまだ不明確です。 LLMへの幻滅からの脱却 これからわかるように、ワールドモデルとLLMの間には、アーキテクチャや時間の経過とともにどのように改善されると期待されているかという点で多くの類似点があります。しかし、一部の人々にとっては、それらはLLMの限界に対する潜在的な答えと見なされています。たとえそれに関する研究が、この現代的な物語よりも前から存在していたとしてもです。「LLMの能力を人間レベルの知能を持つレベルまで拡張するという考えは、全くのナンセンスだ」と、元MetaのチーフAIサイエンティストであるYann LeCun氏は今年初めにWiredに語りました。LeCun氏は、AIやLLM分野の一部の研究者が異論を唱えるような意見で波紋を広げていますが、彼は実際、この分野の相当な部分を代表して発言しています。World Labsの共同創設者であり、ワールドモデルに取り組む新しい企業の1つであるコンピュータビジョンのパイオニア、Fei-Fei Li氏も同様です。彼女は昨年末のSubstackの投稿で次のように書いています。「今日、大規模言語モデル(LLM)のような最先端のAI技術は、私たちが抽象的な知識にアクセスし、それを使って作業する方法を変え始めています。しかし、それらは暗闇の中の言葉遣い屋のままであり、雄弁ではあるが経験がなく、知識は豊富だが根拠がありません。空間知能は、私たちが現実世界と仮想世界を創造し、相互作用する方法を変革し、物語、創造性、ロボット工学、科学的発見などを革命的に変えるでしょう。これがAIの次のフロンティアです。」LeCun氏とLi氏のベンチャーはこれらのアイデアに基づいて構築されているため、彼らがこれらのことを言うのは驚くことではありません。しかし、LLMを中心に活動している著名な人物からも同様の感情が見られます。「私は、私たちはLLMのバブルの中にいると考えており、そのLLMのバブルは来年弾けるかもしれない」と、あらゆる種類のLLMのリポジトリをホストするプラットフォームであるHugging FaceのCEO、Clem Delangue氏は述べています。「しかし、『LLM』は、AIを生物学、化学、画像、音声、[そして]ビデオに応用するという点では、AIのサブセットにすぎません」とDelangue氏はカンファレンスで語り、「私たちはその始まりにあり、今後数年間でさらに多くのものを見るでしょう」と付け加えました。 金融の活況 ここ数ヶ月だけで、ワールドモデルは研究トピック(もちろん、それは今でもそうです)から、新しい商用プロジェクトや巨額の資金調達の基盤へと進歩しました。いくつかの重要な例を挙げます:8月には、Google DeepMindがGenie 3を発表しました。これは、ビデオ生成モデルの基盤の上にリアルタイムのインタラクティブ性を構築するモデルです。11月には、World LabsがMarbleを発表しました。これは、テキスト、画像、ビデオ、またはその他のアセットの入力を基に、3Dアセットとしてエクスポート可能な没入型環境を生成できるモデルとツールセットです。わずか1ヶ月後、ビデオ生成および映画製作AI企業であるRunwayが、Runwayのビデオモデルでの過去の作業に基づいて構築された3つの特殊なワールドモデルからなるGWM-1を発表して参入しました。さらに最近では、Yann LeCun氏がAdvanced Machine Intelligence(AMI)を設立しました。これは、AIシステムの真の未来は、言語だけでなく、物理世界と相互作用する(または少なくともそれをシミュレーションする)モデルにあるという考えに賭けている会社です。これらの取り組みや類似の取り組みは、かなりの資金を受け取っています。World LabsとAMIは、それぞれ2月と3月に約10億ドルを調達したと報じられており、Runwayも2月に3億1500万ドルを調達しました。ワールドモデルに関する活動の一部は、少なくとも部分的にはAGIまたは超知能の基盤を構築することを目的としていますが、それに取り組んでいるほとんどの人は、ロボットのトレーニング、テスト、駆動、ゲーム開発や映画制作のための3Dアセットの生成、科学シミュレーションやモデリングなどの実用的なアプリケーションについて話しています。注意すべきは、「ワールドモデル」はしばしば明確な定義なしに使われる包括的な用語であるということです。 「ワールドモデル」の定義 「それは間違いなく過負荷な用語です」とVincent Sitzmann氏は、ワールドモデルの背後にある研究と概念について、長時間の会話の中で私に語りました。Sitzmann氏は、ニューラルレンダリング、ビジュアルコンピューティング、ロボット工学に関する研究を発表しているMITの准教授です。彼はMITのコンピュータサイエンス・人工知能研究所(CSAIL)のシーン表現グループを率いています。 定義を求められた際、彼はワールドモデルを、相互作用を入力として受け取り、「その相互作用を与えられたときに、ある環境で次に何が起こるかをシミュレーションできるようにする」モデルと単純に説明しました。12月にGWM-1モデルファミリーを発表した際、Runwayはワールドモデルを「環境の内部表現を構築し、それを使用してその環境内の将来のイベントをシミュレーションするAIシステム」と定義しました。さらに、「汎用ワールドモデルの目標は、現実世界で遭遇するものと同様の、幅広い状況や相互作用を表現し、シミュレーションすることです」とRunwayは付け加えました。 私はまた、World Labsの共同創設者であり、元Googleのコンピュータビジョンおよび物理学研究者であり、2次元画像から微分可能で機械学習コンテキストで有用な形式でナビゲート可能な3Dシーンを構築する方法であるニューラルラディアンスフィールド(NeRF)の共同作成者であるBen Mildenhall氏にも話を聞きました。 「LLMと区別する主な点は、空間的で、おそらくより良い言葉が見つからないので『連続的』な理解度を示すことでしょう」と彼は言いました。「LLMと対話する非常に特徴的な側面は、それらがターンベースであることです。」つまり、ユーザーがテキストを入力し、一時停止があり、その後テキストブロックが返されます。対照的に、彼はワールドモデルを同期したリアルタイムシステムと見なしています。「ワールドモデルを定義するものは、空間世界と相互作用する際の自由度であり、A、次にB、次にA、次にB、次にA、次にBという媒介された線形ジャーニーを持たないことです」と彼は言いました。ユーザーまたはエージェントがワールドモデルを利用しているとき、彼らは「あたかもそれが一種の世界であるかのように、実際にそれと相互作用しており、連続的なアクションを取っています」そして「同時に並行して物事が起こっています」。Mildenhall氏の共同創設者であるFei-Fei Li氏は、定義を決定する3つの基準があると信じていると書いています。