
2026/09/02 2:36
Atlas:空間知能のための世界モデル
RSS: https://news.ycombinator.com/rss
要約▶
Japanese Translation:
World Labs は「Atlas」という画期的な人工知能モデルを発表しました。これは、テキスト、画像、動画、3D データにネイティブに対応するオムニ・ワールドモデルとして設計されており、疎い入力から一貫性のある高解像度の 3D ワールドを作成します。大規模言語モデル(LLM)の生成力を、統合された空間文脈内の拡散技法と組み合わせることで、Atlas は 1〜6 枚の入力画像から最大 1 分間のピクセル単位で完璧な 1440p の動画を生成し、2〜3 枚の画像から現実世界のシーンを検出します。これにより、3D 再構築ベンチマークにおいて既存モデルを上回ります。また、Atlas は 2D フレームと 3D デプスマップを明示的に出力するため、「Real-to-Sim」ワークフローを可能にし、ロボットがカジュアルなビデオ録画を使用して再構築された環境でナビゲートできるようになります。さらに、ロボティクス応用のために RGB とデプスセンサーデータを生成します。加えて、Atlas は時空シミュレーション(例:3 つのカメラからだけによるブレットタイム)、画像・360 パノラマ・レンダリングテキストを生成し、高度なキャッシュ手法を取り入れて 2D および 3D データを同時に処理できます。World Labs では、これらの機能をさらに拡張し、Marble の今後のバージョンを含む広範な製品スイートに Atlas を統合する予定であり、2026 年に選定パートナー向けに早期アクセス版を発行する計画です。これは、動画生成から空間 AI 開発に至るまで、産業を変革すると約束されています。
本文
Atlas:空間知能のための次世代世界モデル
World Labs は、クリエイティブなユーザーの想像を可視化し、実世界を高精度でシミュレーション、ロボットの行動計画を支援することを可能にする汎用的な世界モデル「Atlas(アトラス)」をご紹介します。
Atlas は、テキスト、画像、動画、3D データをネイティブに扱えるオムニモデルです。これらからゼロで事前学習を行い、すべての入力を共有された空間的文脈に統合して、「何が次に来るか」を生成します。
主要な特徴と能力
Atlas はスケーラビリティに設計されており、トレーニング用計算リソースの増加に伴い性能が向上します(Scaling Law)。以下の幅広いタスクを実行可能です。
- カメラ制御による生成
- 1 枚以上の画像を入力とし、ピクセル単位の完璧なカメラ制御で新しい映像を生成。
- 最大 1440p レゾリューションで 1 分間の動画を出力可能。
- シーンの幾何学的構造と完全に一致した新視点の映像、入力画像にはない部分も滑らかに想像して拡張。
- 空間的再構成
- 少数の入力画像(2〜3 枚程度)から実世界のシーンを忠実に再構成。
- 3D コンピュータビジョンにおける「ノベルビューシンセシス(新規視点合成)」の根本的問題を解決。
- 最前線の 3D 再構成専用モデルよりも優れた性能を発揮。
- 空間・時間シミュレーション
- 入力動画から空間構造と時間の流れをモデル化。
- ビデオのリフレーミング(編集): 限られたカメラ映像で、不可能な角度からのイベント観測やドラマチックなエフェクトを実現。
- 「リアルツーシム」ワークフロー: ロボティクス向けのシミュレーション環境構築を支援。
- 画像生成
- テキストから画像および 360 パノラマを生成。
- 複雑なプロンプトに従い、テキスト描画と多様なビジュアルスタイルの表現が可能。
カメラ制御による詳細機能
Atlas は粗いテキスト指示を超え、精密なカメラ幾何学をネイティブの入力タイプとして採用しています。
ピクセル単位の完璧なカメラ制御
- 単一の入力画像から完全なシーンを生成。
- 世界知識を活用し、ロボットの後側面やプール横の芝生など、観測していない部分も論理的に推測・描写。
- 任意の角度からの視点生成に対応。
空間的文脈を用いた生成
- 3D アンカー機構: LLM と異なり、各画像を 3D 空間内の特定の位置に「アンカー(地面化)」しており、これを文脈として利用。
- 滑らかな補間: 無関係に見える 2 つの参考画像間の位置を指定すると、3D 空間内で滑らかに補間された世界を生成。
- シームレスな統合: 「左フレーム」と「右フレーム」の空間的文脈を構築し、Atlas がそれらをステッチして統合。
制御可能な長尺動画
- カメラ運動の制御と空間的文脈の管理を組み合わせることで、詳細な制御が可能な長尺動画を生成。
- ユーザーは「監督」の役割を果たし、マニュアルで設計されたカメラパスを用いて演出が可能(例:少数の入力画像から 1440p、1 分間の動画)。
空間的再構成の詳細機能
Atlas は、数百枚の高密度視点データや特別な撮影機器を必要とせず、疎な入力画像からの新規視点合成を実現します。
複数画像からの再構成
- 入力画像にない世界の部分は、世界知識に基づき合理的に想像して空白を埋める。
- 入力画像数による精度向上:
- 2〜3 枚程度で忠実な再構成が可能(特化モデルを上回る)。
- 数百枚の入力画像も処理可能で、実世界環境の再現性がさらに高まる。
- 例: 単一写真から航空写真を撮像し、追加画像を追加するごとに庭園やコテージ、メインハウスの描写が正確化。
- 上空からの視点生成: 地上レベルの入力画像のみでも、キャンパス上空のような遠隔・高所視点の映像パスを生成可能。
多様なパスの再構成
- 同じ入力画像セットに対し、多数異なる経路(軌跡)でシーン内を移動する動画生成が可能。
- カメラパスの変更により、シーンの強調箇所や速度、長さ、複雑さ(ムード)を変化させられる。
明示的な 3D データ出力
- 2D と 3D の両対応: 画像フレームに加え、3D 深度マップをネイティブに生成。
- 出力形式: ポイントクラウドまたは 3D ガウシアンスプライト (Splat) 形式で世界データを出力。
- 完全な 3D ワールドの創出:
- 1 つの画像から新規視点と 3D ジオメトリを同時生成。
- 入力動画に対して各フレームの深度を予測・統合し、未観測領域まで埋め込む。
- この形式(Marble も使用)により、World Labs の他の製品と自然に統合可能。
空間・時間シミュレーションの詳細機能
Atlas は世界が時間の経過とともにどのように進化するかを理解する世界シミュレーターとして機能します。
ビデオのリフレーミング
- スタジオレス制作: 高価な撮影スタジオや特殊機材を必要とせず、バックパックに収まるクリップと三脚で撮影された数人のエンジニアによる映像(3〜5 カメラ)を使用。
- 不可能な視点の実現: 時間を停止させ、ショットをリフレーミングし、通常は不可能な角度からイベントを観察できる。
ロボティクスシミュレーション
- 「リアルツーシム」のスケール化:
- 数枚の画像で明示的な 3D 空間を再構成。
- シミュレートされたロボットが移動するにつれて、センサーが観測する RGB データと深度データを同時に生成。
- 多様な学習データの創出:
- カジュアルな録画数本から物体の動きや相互作用も捉えたシミュレーションを構築。
- 物体の種類・配置、ロボットの運動、照明、背景などを容易に変更可能(バリエーション変更)。
- 剛体、関節機構、変形物体との物理的相互作用を再現しつつ、多様なテスト環境を提供。
画像生成と技術詳細
Atlas の主眼は世界モデル化ですが、強力な画像生成器としての能力も併せ持っています。テキストやプロンプトから複雑な描写、360 パノラマ画像を生成可能。
モデルアーキテクチャ
Atlas は空間制御を中心に据えたオムニモデルです。多モーダルな自己回帰型拡散トランスフォーマーとして設計されています。
| 特性 | 説明 |
|---|---|
| 多モーダル | テキスト、画像、カメラポーズ、3D 深度マップをネイティブ処理。動画は画像シーケンスとして表現。 |
| 自己回帰型 | シーケンス上の要素を順次生成。広範なタスクへ柔軟に適応可能。 |
| 拡散型 | ノイズ除去フローモデル。推論ステップ数を調整することで、スピードと品質のトレードオフが可能。 |
| トランスフォーマー | 大規模行列乗算に基づく堅牢な骨格。現代のハードウェアに適応。 |
- LLM の技術継承: KV キャッシング、キャッシュ対応ルーティング、集約化されていないサージングなどの高速化技術を利用。
- 画像・動画モデルの技術継承: 潜在拡散モデル、拡散蒸留、分類器フリーガイダンス、シフトしたノイズスケジュール、VAE 設計の進歩を活用。
ベンチマーク評価
単一のベンチマークではなく、以下の主要タスクで特化モデルを上回る性能を証明しました。
- カメラ条件付き生成: トップクラスの動画モデルと比較し、複雑なカメラ軌道に対する制御優位性が確認された。
- 3D 再構成: 学術コミュニティから注目される疎な入力ビューからの再构成タスクにおいて、ベストなオープンソース特化型モデルを上回る結果を示した。
モデルのスケーリング
現代 AI の進歩はスケーリングによって牽引されてきました。Atlas も計算リソースの増加に伴い性能が向上し続ける傾向を示しています(Scaling Law)。多様な大量的多モーダルデータコーパスからゼロで事前学習を行い、新たなレベルの計算リソースを開錠してモデル能力を拡張します。
アクセスと採用
- 早期アクセス: 選ばれたパートナー向けに開始済み。開発を進めたい場合はアクセス申請リンクへご応募ください。
- 採用活動: 空間知能の進歩のため、研究・エンジニアリング部門での採用も募集中です。
引用先:
@article{worldlabs2026atlas, author = {World Labs Team}, title = {Atlas: A World Model for Spatial Intelligence}, journal = {World Labs Blog}, year = {2026}, note = {https://www.worldlabs.ai/blog/atlas} }