HN 日本語サマリー

← 一覧へ戻る
AI・機械学習

Atlas: 空間的知能のための世界モデル

Atlas: A World Model for Spatial Intelligence (worldlabs.ai)

92 pointsby johnsutor14 コメント

要約

World Labsは、テキスト、画像、ビデオ、3Dをネイティブに処理できる次世代世界モデル「Atlas」を発表しました。Atlasは、空間的知能の追求を目指し、あらゆる可能な世界を生成、再構築、シミュレーションできます。カメラ制御による生成、空間再構築、時空間シミュレーション、画像生成など、幅広いタスクを実行可能です。

全文翻訳

ワールドモデルは、あらゆる可能な世界を生成、再構築、シミュレーションします。それらは世界の見た目、振る舞い、進化の仕方を理解するため、クリエイティブなユーザーのために想像上の世界をレンダリングしたり、現実世界を高忠実度でシミュレーションしたり、ロボットが行動を計画するのを助けたりすることができます。World Labsでは、空間的知能の追求において、これらの汎用ワールドモデルを構築しています。本日、私たちは次世代ワールドモデルであるAtlasを紹介します。Atlasは、テキスト、画像、ビデオ、3Dをネイティブに処理できるようにゼロから事前学習されたオムニモデルです。これはマルチモーダル自己回帰拡散トランスフォーマーであり、すべての入力は共有空間コンテキストに結合されます。Atlasはそのコンテキストを使用して次に何が起こるかを生成し、見たものすべてと3Dで一貫性を保ち、その先のものを想像します。Atlasはスケーラビリティを考慮して構築されており、トレーニングコンピュートが増加するにつれてパフォーマンスが向上し、スケーリングを続けるにつれてこの傾向が続くと予想されます。Atlasは、世界生成、再構築、シミュレーションにまたがる幅広いタスクを実行できます。 カメラ制御による生成:Atlasは、1つ以上の画像からピクセルパーフェクトなカメラ制御で画像とビデオを生成し、最大1分間のビデオを1440pで出力します。 空間再構築:Atlasは、1つから数十個の入力画像から現実世界のシーンを再構築します。これは、新しい視点からの画像フレームと明示的な3D出力の両方を生成し、3D再構築に特化した最先端モデルを上回ります。 時空間シミュレーション:Atlasは入力ビデオから空間と時間をモデル化し、ドラマチックな視覚効果のためにビデオを再構成し、ロボット工学のためのリアルツーシムワークフローを可能にします。 画像生成:Atlasはテキストから画像と360パノラマを生成します。複雑なプロンプトに従い、テキストをレンダリングし、さまざまなビジュアルスタイルを生成できます。 Atlasは、MarbleおよびWorld Labsのその他の製品の将来のバージョンを強化します。Atlasへの早期アクセスをリクエストしてください。 カメラ制御による生成 Atlasは、1つ以上の参照画像を受け取り、指定した任意のカメラ位置と角度で新しいビューを生成します。生成されたビューは、入力画像のコンテンツとジオメトリに一致し、それらを超えてスムーズに外挿して、入力画像では見えないシーンの部分を想像します。Atlasは、幅広いシーンタイプ、ビジュアルスタイル、カメラモーションを扱います。ビデオは、1つから6つの入力画像と手動で設計されたカメラパスから生成されます。 ピクセルパーフェクトなカメラ制御 Atlasは、正確なカメラジオメトリをネイティブ入力タイプとして使用し、カメラ制御のための粗いテキストベースの指示を超えています。これにより、すべてのショットをフレーミングし、すべてのモーションを制御できます。ここでの例では、Atlasは単一の入力画像から完全なシーンを生成します。入力画像のコンテンツと、その広範な世界知識を使用して、新しい角度からシーンがどのように見えるべきかを想像します。たとえば、ロボットの後ろ側を生成し、プールの隣に芝生の庭があると推測します。単一の画像から、Atlasは任意の角度からのビューを生成します。ビューを変更するにはドラッグしてください。 空間コンテキストを使用した生成 LLMと同様に、Atlasはまず入力をコンテキストにエンコードし、次にコンテキストに基づいて出力を生成します。しかし、Atlasはユニークです。なぜなら、各画像は空間内の3D位置に接地されているため、これが空間コンテキストを形成するからです。この空間コンテキストを管理することで、まったく新しい種類のクリエイティブコントロールが可能になります。たとえば、関連性のない2つの参照画像をコンテキストに配置し、それらを3D空間に配置すると、Atlasはそれらの間をスムーズに補間する世界を生成します。これらの例は、モデルの世界知識と創造性を示しています。それらは、ドア、廊下、ニッチ、およびその他の関連性のない入力画像間の移行を想像します。空間コンテキストを埋めるために左右のフレームを選択すると、Atlasがそれらを結合します。 制御可能な長尺ビデオ Atlasを使用すると、カメラの動きと空間コンテキスト管理を組み合わせて、正確な制御で長尺ビデオを生成できます。すべてのシーンとすべてのカメラアングルを設計します。これにより、あなたは監督席に座ることになります。あなたはスロットマシンのレバーを引くのではなく、シーンを演出しています。以下の例では、少数の参照画像を使用して、1440p解像度で1分間のビデオを生成します。シーン内のカメラパスを手動で設計し、Atlasが首尾一貫した世界を生成します。このページにある他のビデオは、ページパフォーマンスを最適化するために圧縮されています。 空間再構築 Atlasは、1つ以上の入力画像から現実世界の空間を再構築します。オブジェクトとシーンを忠実に再構築するために、特別なキャプチャ機器や何百もの密なビューを必要としません。私たちは、Atlasが、3Dコンピュータビジョンの数十年来の基本的な問題である、疎な入力画像からの新しいビュー合成を解決するための大きな一歩であると信じています。 複数の画像からの再構築 Atlasは、シーンの可変数の入力ビューを受け取ることができます。世界の С部分が入力ビューで見えない場合、Atlasは豊富な世界知識から描画して、ギャップを埋めるもっともらしい方法を想像します。しかし、時には想像ではなく、現実世界の場所の正確な再構築を望む場合があります。より多くの入力画像を渡すと、Atlasはより多くのコンテキストを得ます。見る量が多いほど、想像する量は少なくなります。Atlasは通常、わずか2〜3枚の画像で忠実な再構築を提供し、3D再構築のみに特化してトレーニングされたモデルの最先端の結果を上回ります。しかし、Atlasは空間コンテキストで100枚以上の入力画像を利用することもでき、現実世界の環境の忠実な再現を可能にします。以下の最初の例では、Atlasは地上レベルの写真1枚から空撮ビューを生成します。単一の入力写真で見える庭は、モデルの出力で正確に再構築されていますが、シーンの残りの部分は想像です。庭の隣にあるコテージの2番目の現実世界の入力画像を追加すると、モデルの出力は庭とコテージの両方を示しますが、左側の家はまだ想像です。メインハウスの3番目の入力画像を追加すると、シーン全体が正確に描写されます。2番目の例では、芝生のメインエントランスから始まり、メモリアルチャーチのファサードを飾るカラフルなモザイクで終わる、スタンフォード大学のメインクワッドを段階的に構築します。Atlasは2〜25枚の地上レベルの入力画像しか受け取りませんが、キャンパスの上空を飛行する空撮ビューからのパスを生成できます。 多様なパスの再構築 Atlasは、同じシーン内で多くの異なる軌道を生成でき、同じ入力画像に新しい視点を与えます。カメラパスを何度変更しても、シーンは一貫性を保ちます。以下の例では、少数の入力画像セットから、Atlasが同じシーン内で複数のカメラパスを生成できることを示しています。異なるカメラパスは、シーンのさまざまな部分を強調したり、速度、長さ、または複雑さを変えることによってムードを変更したりできます。Atlasは、少数の入力画像セットを使用して、同じシーン内で多くの異なるパスを生成できます。 明示的な3D出力 上記の出力では、Atlasが2D画像とビデオを出力しているのを見てきましたが、これらは一部のアプリケーションには十分です。しかし、ロボット工学、ゲーム、デザイン、VFXなどのワークフローでは、明示的な3D出力が必要になることがよくあります。Atlasはネイティブに2D画像フレームと3D深度マップの両方を処理し、ポイントクラウドまたは3Dガウシアン・スプラットとして世界を出力できるようにします。1つの画像から、Atlasは新しいビューと3Dジオメトリを生成し、次に3Dガウシアン・スプラットに変換します。単一の入力画像から、Atlasは新しいビューを共同で生成し、そのジオメトリを推定することにより、完全な3D世界を生成します。現実世界のビデオからは、各フレームの深度を予測し、それらを組み合わせて3D再構築を行います。いずれの場合も、Atlasはカメラが一度も見たことのない領域を埋めます。Atlasは入力ビデオから3Dポイントクラウドを再構築できます。ポイントクラウドはシーンのジオメトリを推定しますが、3Dガウシアン・スプラットはそれを使用可能にします。Atlasは残りのギャップを埋め、ポイントクラウドを、デバイス上で高解像度および高フレームレートでレンダリングされる完全なスプラットシーンに変換します。これはMarbleで使用されているのと同じ表現であり、enabli