World Labsは、空間知能に向けた次世代世界モデル「Atlas」を発表した。テキスト、画像、動画、3Dをネイティブに扱い、世界を生成、再構成、シミュレーションすることを目指すモデルだ。
画像生成や動画生成の競争が激しくなる中で、Atlasが示すのは「見た目を作るAI」から「空間の整合性を保って世界を扱うAI」への移行である。クリエイティブだけでなく、ロボットが現実を理解し、行動計画を立てるための基盤にも関わる。
Atlasは何ができるのか
World Labsによると、Atlasはマルチモーダルな自己回帰拡散Transformerで、複数の入力を共通の空間文脈に統合する。1枚または複数の画像からカメラ位置を変えた新しい視点を生成し、最大1分・1440pの動画を出力できる。現実シーンの3D再構成や、動画をもとにした空間・時間シミュレーションにも対応する。
機能 | 内容 |
|---|---|
Camera-Controlled Generation | カメラ位置や角度を指定して新しい視点の画像・動画を生成 |
Spatial Reconstruction | 1枚から複数枚の入力画像をもとにシーンを再構成 |
Space-Time Simulation | 動画から空間と時間の変化をモデル化し、Real-to-Simを支援 |
Image Generation | テキストから画像や360度パノラマを生成 |
なぜロボティクスに関係するのか
ロボットが現実世界で動くには、単に画像を認識するだけでは足りない。見えていない背後、物体同士の位置関係、カメラ移動後の見え方、時間が進んだときの変化を推測する必要がある。Atlasのような世界モデルは、現実環境を高精度にシミュレーションし、行動計画や訓練データ生成に使える可能性がある。
企業利用では期待と検証を分ける
World LabsはAtlasが今後のMarbleや同社製品を支えると説明しているが、企業がすぐにロボット運用へ組み込める段階かは別問題だ。生成された空間の正確性、物理法則との整合性、実環境とのズレ、著作権やデータ利用条件を検証する必要がある。とはいえ、3Dコンテンツ制作、建築・不動産の可視化、ロボティクスのシミュレーションでは、注目すべき技術潮流である。
参考: World Labs


.png&w=384&q=75)

