World Labs、世界モデルAtlasを発表──動画・3D・ロボティクスをつなぐ空間知能へ

World Labs、世界モデルAtlasを発表──動画・3D・ロボティクスをつなぐ空間知能へ

World Labsは、空間知能に向けた次世代世界モデル「Atlas」を発表した。テキスト、画像、動画、3Dをネイティブに扱い、世界を生成、再構成、シミュレーションすることを目指すモデルだ。

画像生成や動画生成の競争が激しくなる中で、Atlasが示すのは「見た目を作るAI」から「空間の整合性を保って世界を扱うAI」への移行である。クリエイティブだけでなく、ロボットが現実を理解し、行動計画を立てるための基盤にも関わる。

Atlasは何ができるのか

World Labsによると、Atlasはマルチモーダルな自己回帰拡散Transformerで、複数の入力を共通の空間文脈に統合する。1枚または複数の画像からカメラ位置を変えた新しい視点を生成し、最大1分・1440pの動画を出力できる。現実シーンの3D再構成や、動画をもとにした空間・時間シミュレーションにも対応する。

機能

内容

Camera-Controlled Generation

カメラ位置や角度を指定して新しい視点の画像・動画を生成

Spatial Reconstruction

1枚から複数枚の入力画像をもとにシーンを再構成

Space-Time Simulation

動画から空間と時間の変化をモデル化し、Real-to-Simを支援

Image Generation

テキストから画像や360度パノラマを生成

なぜロボティクスに関係するのか

ロボットが現実世界で動くには、単に画像を認識するだけでは足りない。見えていない背後、物体同士の位置関係、カメラ移動後の見え方、時間が進んだときの変化を推測する必要がある。Atlasのような世界モデルは、現実環境を高精度にシミュレーションし、行動計画や訓練データ生成に使える可能性がある。

企業利用では期待と検証を分ける

World LabsはAtlasが今後のMarbleや同社製品を支えると説明しているが、企業がすぐにロボット運用へ組み込める段階かは別問題だ。生成された空間の正確性、物理法則との整合性、実環境とのズレ、著作権やデータ利用条件を検証する必要がある。とはいえ、3Dコンテンツ制作、建築・不動産の可視化、ロボティクスのシミュレーションでは、注目すべき技術潮流である。

参考: World Labs

この記事に携わった人
Mynto編集部
Mynto.aiの編集部です。
関連記事
お問い合わせ各種

課題解決のためのお役立ち資料ダウンロードや、
サービスのお問い合わせが可能です。
お気軽にご相談ください。