Atlas:空間知能のための世界モデル

2026/09/02 2:36

Atlas:空間知能のための世界モデル

RSS: https://news.ycombinator.com/rss

要約

Japanese Translation:

World Labs は「Atlas」という画期的な人工知能モデルを発表しました。これは、テキスト、画像、動画、3D データにネイティブに対応するオムニ・ワールドモデルとして設計されており、疎い入力から一貫性のある高解像度の 3D ワールドを作成します。大規模言語モデル(LLM)の生成力を、統合された空間文脈内の拡散技法と組み合わせることで、Atlas は 1〜6 枚の入力画像から最大 1 分間のピクセル単位で完璧な 1440p の動画を生成し、2〜3 枚の画像から現実世界のシーンを検出します。これにより、3D 再構築ベンチマークにおいて既存モデルを上回ります。また、Atlas は 2D フレームと 3D デプスマップを明示的に出力するため、「Real-to-Sim」ワークフローを可能にし、ロボットがカジュアルなビデオ録画を使用して再構築された環境でナビゲートできるようになります。さらに、ロボティクス応用のために RGB とデプスセンサーデータを生成します。加えて、Atlas は時空シミュレーション(例:3 つのカメラからだけによるブレットタイム)、画像・360 パノラマ・レンダリングテキストを生成し、高度なキャッシュ手法を取り入れて 2D および 3D データを同時に処理できます。World Labs では、これらの機能をさらに拡張し、Marble の今後のバージョンを含む広範な製品スイートに Atlas を統合する予定であり、2026 年に選定パートナー向けに早期アクセス版を発行する計画です。これは、動画生成から空間 AI 開発に至るまで、産業を変革すると約束されています。

本文

Atlas:空間知能のための次世代世界モデル

World Labs は、クリエイティブなユーザーの想像を可視化し、実世界を高精度でシミュレーション、ロボットの行動計画を支援することを可能にする汎用的な世界モデル「Atlas(アトラス)」をご紹介します。

Atlas は、テキスト、画像、動画、3D データをネイティブに扱えるオムニモデルです。これらからゼロで事前学習を行い、すべての入力を共有された空間的文脈に統合して、「何が次に来るか」を生成します。

主要な特徴と能力

Atlas はスケーラビリティに設計されており、トレーニング用計算リソースの増加に伴い性能が向上します(Scaling Law)。以下の幅広いタスクを実行可能です。

  • カメラ制御による生成
    • 1 枚以上の画像を入力とし、ピクセル単位の完璧なカメラ制御で新しい映像を生成。
    • 最大 1440p レゾリューションで 1 分間の動画を出力可能。
    • シーンの幾何学的構造と完全に一致した新視点の映像、入力画像にはない部分も滑らかに想像して拡張。
  • 空間的再構成
    • 少数の入力画像(2〜3 枚程度)から実世界のシーンを忠実に再構成。
    • 3D コンピュータビジョンにおける「ノベルビューシンセシス(新規視点合成)」の根本的問題を解決。
    • 最前線の 3D 再構成専用モデルよりも優れた性能を発揮。
  • 空間・時間シミュレーション
    • 入力動画から空間構造と時間の流れをモデル化。
    • ビデオのリフレーミング(編集): 限られたカメラ映像で、不可能な角度からのイベント観測やドラマチックなエフェクトを実現。
    • 「リアルツーシム」ワークフロー: ロボティクス向けのシミュレーション環境構築を支援。
  • 画像生成
    • テキストから画像および 360 パノラマを生成。
    • 複雑なプロンプトに従い、テキスト描画と多様なビジュアルスタイルの表現が可能。

カメラ制御による詳細機能

Atlas は粗いテキスト指示を超え、精密なカメラ幾何学をネイティブの入力タイプとして採用しています。

ピクセル単位の完璧なカメラ制御

  • 単一の入力画像から完全なシーンを生成。
  • 世界知識を活用し、ロボットの後側面やプール横の芝生など、観測していない部分も論理的に推測・描写。
  • 任意の角度からの視点生成に対応。

空間的文脈を用いた生成

  • 3D アンカー機構: LLM と異なり、各画像を 3D 空間内の特定の位置に「アンカー(地面化)」しており、これを文脈として利用。
  • 滑らかな補間: 無関係に見える 2 つの参考画像間の位置を指定すると、3D 空間内で滑らかに補間された世界を生成。
  • シームレスな統合: 「左フレーム」と「右フレーム」の空間的文脈を構築し、Atlas がそれらをステッチして統合。

制御可能な長尺動画

  • カメラ運動の制御と空間的文脈の管理を組み合わせることで、詳細な制御が可能な長尺動画を生成。
  • ユーザーは「監督」の役割を果たし、マニュアルで設計されたカメラパスを用いて演出が可能(例:少数の入力画像から 1440p、1 分間の動画)。

空間的再構成の詳細機能

Atlas は、数百枚の高密度視点データや特別な撮影機器を必要とせず、疎な入力画像からの新規視点合成を実現します。

複数画像からの再構成

  • 入力画像にない世界の部分は、世界知識に基づき合理的に想像して空白を埋める。
  • 入力画像数による精度向上:
    • 2〜3 枚程度で忠実な再構成が可能(特化モデルを上回る)。
    • 数百枚の入力画像も処理可能で、実世界環境の再現性がさらに高まる。
    • : 単一写真から航空写真を撮像し、追加画像を追加するごとに庭園やコテージ、メインハウスの描写が正確化。
  • 上空からの視点生成: 地上レベルの入力画像のみでも、キャンパス上空のような遠隔・高所視点の映像パスを生成可能。

多様なパスの再構成

  • 同じ入力画像セットに対し、多数異なる経路(軌跡)でシーン内を移動する動画生成が可能。
  • カメラパスの変更により、シーンの強調箇所や速度、長さ、複雑さ(ムード)を変化させられる。

明示的な 3D データ出力

  • 2D と 3D の両対応: 画像フレームに加え、3D 深度マップをネイティブに生成。
  • 出力形式: ポイントクラウドまたは 3D ガウシアンスプライト (Splat) 形式で世界データを出力。
  • 完全な 3D ワールドの創出:
    • 1 つの画像から新規視点と 3D ジオメトリを同時生成。
    • 入力動画に対して各フレームの深度を予測・統合し、未観測領域まで埋め込む。
    • この形式(Marble も使用)により、World Labs の他の製品と自然に統合可能。

空間・時間シミュレーションの詳細機能

Atlas は世界が時間の経過とともにどのように進化するかを理解する世界シミュレーターとして機能します。

ビデオのリフレーミング

  • スタジオレス制作: 高価な撮影スタジオや特殊機材を必要とせず、バックパックに収まるクリップと三脚で撮影された数人のエンジニアによる映像(3〜5 カメラ)を使用。
  • 不可能な視点の実現: 時間を停止させ、ショットをリフレーミングし、通常は不可能な角度からイベントを観察できる。

ロボティクスシミュレーション

  • 「リアルツーシム」のスケール化:
    • 数枚の画像で明示的な 3D 空間を再構成。
    • シミュレートされたロボットが移動するにつれて、センサーが観測する RGB データ深度データを同時に生成。
  • 多様な学習データの創出:
    • カジュアルな録画数本から物体の動きや相互作用も捉えたシミュレーションを構築。
    • 物体の種類・配置、ロボットの運動、照明、背景などを容易に変更可能(バリエーション変更)。
    • 剛体、関節機構、変形物体との物理的相互作用を再現しつつ、多様なテスト環境を提供。

画像生成と技術詳細

Atlas の主眼は世界モデル化ですが、強力な画像生成器としての能力も併せ持っています。テキストやプロンプトから複雑な描写、360 パノラマ画像を生成可能。

モデルアーキテクチャ

Atlas は空間制御を中心に据えたオムニモデルです。多モーダルな自己回帰型拡散トランスフォーマーとして設計されています。

特性説明
多モーダルテキスト、画像、カメラポーズ、3D 深度マップをネイティブ処理。動画は画像シーケンスとして表現。
自己回帰型シーケンス上の要素を順次生成。広範なタスクへ柔軟に適応可能。
拡散型ノイズ除去フローモデル。推論ステップ数を調整することで、スピードと品質のトレードオフが可能。
トランスフォーマー大規模行列乗算に基づく堅牢な骨格。現代のハードウェアに適応。
  • LLM の技術継承: KV キャッシング、キャッシュ対応ルーティング、集約化されていないサージングなどの高速化技術を利用。
  • 画像・動画モデルの技術継承: 潜在拡散モデル、拡散蒸留、分類器フリーガイダンス、シフトしたノイズスケジュール、VAE 設計の進歩を活用。

ベンチマーク評価

単一のベンチマークではなく、以下の主要タスクで特化モデルを上回る性能を証明しました。

  • カメラ条件付き生成: トップクラスの動画モデルと比較し、複雑なカメラ軌道に対する制御優位性が確認された。
  • 3D 再構成: 学術コミュニティから注目される疎な入力ビューからの再构成タスクにおいて、ベストなオープンソース特化型モデルを上回る結果を示した。

モデルのスケーリング

現代 AI の進歩はスケーリングによって牽引されてきました。Atlas も計算リソースの増加に伴い性能が向上し続ける傾向を示しています(Scaling Law)。多様な大量的多モーダルデータコーパスからゼロで事前学習を行い、新たなレベルの計算リソースを開錠してモデル能力を拡張します。

アクセスと採用

  • 早期アクセス: 選ばれたパートナー向けに開始済み。開発を進めたい場合はアクセス申請リンクへご応募ください。
  • 採用活動: 空間知能の進歩のため、研究・エンジニアリング部門での採用も募集中です。

引用先:

@article{worldlabs2026atlas,
    author = {World Labs Team},
    title = {Atlas: A World Model for Spatial Intelligence},
    journal = {World Labs Blog},
    year = {2026},
    note = {https://www.worldlabs.ai/blog/atlas}
}

同じ日のほかのニュース

一覧に戻る →

2026/09/02 2:53

Claude Fable 5.1 と Claude Mythos 5.1

## Japanese Translation: Anthropic は、一般利用のための Claude Fable 5.1 と、サイバーセキュリティおよび生命科学分野の信頼できる政府プログラムを通じた制限されたアクセス用の Claude Mythos 5.1 を公式にリリースしました。特に、これらは異なる安全対策レベルを持つ同一の基盤モデルの変種です。主要なアップデートとして、コストが削減されおり、典型的なワークロードでは価格低下率が 25%、複雑な自動化タスクでは 45% まで低下すると推定されています(キャッシュ要件の減少により、100 万トークンあたり 0.25 ドルへ)。エンタープライズ顧客は、秋以降に「Frontier Safeguards」を採用する予定で、顧客管理下のインフラストラクチャ上でのデータ保持ゼロを提供します。Mythos 5.1 は、分子結合体設計のヒットレートが 10〜15% からほぼ 50% に向上し、カスタムキャッシュにより深層学習のトレーニングを最大 2.5 倍加速させるなど、安全性と能力の向上を示しています。また、エクスプロイトコードの生成を防ぎつつ高忠実度の研究を支援するため、米国政府のプロトコルに厳格に準拠しています。8 月 2 日(2026 年)以降にリリースされる次期モデルには、EU AI 法への適合のために出力ウォーターマークの導入が義務付けられ、規制当局や企業向けのプライベートプレビュー検出 API が用意されます。

2026/09/02 3:35

Ed ゼイトロンの AI 懐疑論者の予言はどれほど正確だったのか?

## 日本語翻訳: 本テキストの核心的なメッセージは、技術懐疑主義者である Ed Zitron の産業崩壊が迫っているという予言が事実に反し、データによって裏付けられていない点にあります。彼の予測は、Meta、Alphabet、Microsoft といった大手企業が「死んでいる」と宣言し、生成 AI がピークに達したと主張していますが、これらは 2023 年から 2026 年の計画期間にかけて業界全体で見られた堅調な財務成長により直接反証されています。例えば、OpenAI は収益目標を上回り、CoreWeave は資金調達後に IPO 価格を倍額まで引き上げました。また、Cursor は 600 億ドルの評価額での exit を実現しており、これらは Zitron の敗北または低評価という悲惨な警告を直接的に否定しています。さらに具体的な指標に関するエラーも彼の信用力を損なっています:Meta の利用者数は不正確な Similarweb データを用いて誤算され、Gemini は 5 億ユーザーという目標を超えて 7.5 億ユーザーに達し、Google Search の問題は単にリーダーシップのせいであると単純化されており、エンジニア側はこれに反対しています。Zitron の経済分析は「絶対的なゴミ」と批判され、反駁されない点で批評家を圧倒するために「ギッシュ・ガロップ(gish gallop)」という戦術を用いる傾向があり、不正確なデータ源に依存しています。加えて、彼の文章スタイルは怒りと悪口を多用し、人々の心を改心させるのではなくエンゲージメントを高めることを目的としており、過去の過ちを認めなかった Paul Ehrlich などの破綻した未来学者と同じスタンスです。したがって、投資家や執行役員は、彼の自信に満ちた警告を企業の健全さを示す有効な指標ではなく、市場は彼のリズミカルなノイズにもかかわらず継続的に革新しているため、信頼性の低い distraction( distractions )として扱うべきです。

2026/09/02 7:06

Show HN: Weedout – YouTube のAI 評価動画を表示しないSafari拡張機能

## Japanese Translation: 新しい Mac 用アプリケーションは、フィード、検索結果、関連動画、および Shorts シェルフに表示される「AI で作成された」とラベル付けされた YouTube 動画を自動的にフィルタリングするプライバシーを最優先としたソリューションを提供します。このツールは完全にローカルで動作し、ユーザーアカウントやデータ収集を必要とせず、視聴習慣が秘密に保たれます。検出方法は YouTube の公式に提示されたバッジのみを使用するため、プラットフォーム自身によって明示的にマークされていない動画に対する誤った非難は回避され、そのコンテンツのみを隠します。パフォーマンステストの結果、アプリケーションはリアルタイムのストリームを約半秒で処理し、キャッシュ済みコンテンツは瞬時に処理します。現在、このツールは一般的な低品質な素材ではなく AI 生成物の公開情報のみに焦点を当てており、Shorts の自動スキップ機能や、動画がビューから削除される前に特定の動画を検証できるダークモードなどの有用な機能を備えています。将来のアップデートではロジックの拡張が行われる可能性がありますが、現在のバージョンは厳密に公式ラベルに従います。質問、バグレポート、あるいは検出漏れについては、masteranza@gmail.com 宛てにメールでサポートが可能です(偽陰性レポートには動画のリンクが必要です)。このアプローチにより、視聴者は手動操作や侵襲的な広告なしに直ちに人間が作成したコンテンツにアクセスでき、画面に表示される AI 生成物の雑多なものを単に我慢する対抗としての効果的な代替手段を提供します。

Atlas:空間知能のための世界モデル | そっか~ニュース