
2026/09/27 3:42
ホームボディ:自発的に探索・記憶し行動する人型ロボット
RSS: https://news.ycombinator.com/rss
要約▶
日本語翻訳:
HomeBody は、人間型ロボットが清掃など複雑で長期間にわたる家事を自律的に遂行できるようになることで、ロボット自律性の画期的な飛躍を示しています。特定の動作のために事前プログラミングされたスクリプトに依存していた従来のロボットとは異なり、このシステムは可視化された物体を直近の視野外にある記憶された位置と関連付ける内部空間地図を構築し、環境に対して動的に推論を行うことを可能にします。これを実現するために、カメラおよび LiDAR から得られるデータを「デジタルツイン」——正確な計画立案と誤り訂正に使用する仮想シミュレーション——へ統合しています。先進的な視覚言語モデルによって支えられ、HomeBody は下部身体による locomotion と上部身体の高頻度制御の双方を用いて、引き出しを開けるや腐敗した食品を廃棄するなど洗練されたスキルをシーケンスします。現在のハードウェア耐久性および計算遅延に関する課題は残存していますが、この拡張可能なフレームワークは、ロボットが単なる堅く孤立したタスクを実行するのではなく現実世界の文脈に適応できる家庭へと移行する決定的な転換点であり、より広範な家用利便性への道を開くものです。
本文
HomeBody:長期計画と自己記憶を持つヒューマノイドロボット
概要
HomeBody は、視界外(エゴビュー)の情報を把握し、空間的記憶を活用して自律的に行動できるヒューマノイドロボットのシステムです。このシステムは、大規模言語モデル(VLM)を中核としたモジュール化可能なスキルを組み合わせています。
- 内部空間モデル: 可視化された物体と記憶された場所をつなぐモデルにより、曖昧な指示の解決が可能になります。
- 文脈認識: 「どこへ向かうべきか」「何を操作すべきか」「動作順序は?」という判断を支援します。
- フィードバックループ: 空間記憶と動作の結果に基づくフィードバックをもとに、次の判断を見直す設計になっています。
タスクデモンストレーション
キッチン整理
- 指示例: 「コーヒーバッグの袋をすべて集めて島の中央に置くなり、傷んでいる牛乳やオレンジジュースのパックを捨てなさい。」
- 概要:
- 残すべき物体と廃棄すべき物体を識別し、各物体を適切な場所へ移動させます。
- HomeBody は中島にあるコーヒーバッグを集め、指定されたパックを処分します。
- 部屋全体をまたぐ複数の往復、グリップ動作、配置動作を調整して実行します。
- 視界の変化: 各動作で視界が変わるため、記憶と動作フィードバックを用いて完了した作業と未完了の作業を追跡します。
薬品の回収
- 指示例: 「薬を忘れてしまったのですが、代わりに持ってきてくれませんか?また、そのついでに傷んでいるパックも捨ててください。」
- 概要:
- 視界外の検索: 当初視界外にあった薬品は、保存されたキーフレーム(画像の断片)を用いて引き出しの場所を探します。
- 両腕の協調: 右腕で引き出しの手すりにつかみ開け、薬を回収して渡した後、左腕でパックを廃棄します。
- 空間的アクセス: 体の両側に位置する目標にアクセスできるよう、両腕の間を選択します。
システムパイプライン
ステップ 1:探索(Exploration)
ヒューマノイドの役割を文脈化し、環境を探索させます。
- 収集データ: iPhone 映像、D435i カメラ観測、LiDAR スキャン(SLAM)、関節ポーズ、Astra によるウェイポイント。
- 目的: ヒューマノイド自身の視点から部屋全体を記録し、移動や相互作用で得た可視情報を基盤に空間的文脈を確立します。
- 機能: 探索データをガイドとして保存することで、後のタスクでの利用を可能にします。
ステップ 2:Real2Sim(現実からシミュレーションへ)
Astra を Real2Sim エージェントとして使用し、デジタルツイン(仮想空間モデル)を構築します。
- グラウンドイング: 収集したデータ(SLAM 幾何学、エゴビュー、関節状態など)に基づき、Isaac Sim 内の仮想環境に正確な位置合わせを行います。
- 目的: 「自分自身の視点」を超えた場所についても VLM が論理的に推論できるように支援します。
ステップ 3:日常タスクの実行
ロボットに具体的な指示を与え、アクションレベルの脚本書き込みなしに行動を選択・実行します。
- 指示例: 「キッチンを片付ける。コーヒーバッグを島の中央に置き、傷んでいるパックを捨てること。」
- 機能: 空間的な文脈を活用し、再構築された環境上で示範実行を行います。
実装詳細:拡張可能なスキルライブラリ
ヒューマノイドの移動、グリップ、配置、引き出し開閉は HomeBody の動作語彙を形成します。これらのスキルは共通のインターフェース(ターゲット指定と実行結果)を共有しており、VLM はこれらを組み合わせることで新しいタスクを実行できます。
| スキル ID | プラットフォーム | 機能説明 |
|---|---|---|
| スキル 01 | リアルロボット (1.25x) | ピック: エゴ画像で選択された物体を掴み、持ち上げます。 |
| スキル 02 | リアルロボット (1.25x) | プレース: 保持している物体を選択した 3D 解放点へ移動させます。 |
| スキル 03 | リアルロボット (1.25x) | ドラワープン: ハンドルと位置合わせし、フックして後ろ向きに歩行することで引き出しを開けます。 |
| スキル 04 | リアルロボット (14x → 4x) | Drawerピック: 開いた引き出しの中に手を突っ込み、物体を縁の外に持ち上げます。 |
| スキル 05 | リアルロボット (1.25x) | ナビゲーション: Real2Sim マップ上の地点までの計画された経路に沿って移動します。 |
- 独自のスキルの追加: 学習済みポリシーや古典的なアルゴリズムを共有インターフェースを通じて接続可能です。VLM はこれらを連鎖させて新しいタスクを実行します。
- 注意点: プレビュー映像は約 7〜10 秒にスピードアップされています。「引き出しから拾う」などのスキルでは、連続した再試行の過程を経て成功するのみを表示しています。
アーキテクチャと FAQ
正確な Real2Sim 再構築には何が必要ですか?
- 人間が撮影したビデオ: 豊富な視覚的詳細を提供し、部屋の外観に一致するように再構築と位置合わせを助けます。
- SLAM リファレンス: 自己の探索データ(カメラ観測、SLAM 幾何学、関節ポーズ、ウェイポイント)を用いて、空間の意味的理解に加え、幾何学的に正確な推論を支援します。
HomeBody はどのように自己位置推定(ローカライゼーション)を行いますか?
- グラウンドイング: Super Odometry を用いてロボットの自己位置推定を行い、SLAM マップと再構築されたシミュレーションを点対点法(ICP)で位置合わせします。
- 保存機能: 共有フレーム内でエゴカメラの観測データを保存し、記録された位置へ戻れるようにしています。
HomeBody は VLM の決定を実際の動作に変換しますか?
はい。VLM は構造化されたツールコールを通じてスキルとその対象を選択し、実際の運動を計画・実行します。具体的には以下の通りです。
- ピック(掴み): 0〜1000 に正規化された画像上の点と使用する腕を指定。「Fast-FoundationStereo」で深度を推定し、カメラ較正によって幾何学を 3D 空間に投影してグリップ姿勢を予測します。
- プレース(置く): 使用する腕、胴体座標系内の 3D 解放ターゲット、および解放距離を指定して手を開放します。
- 引き出し開閉: ハンドルとの位置合わせ、フック姿勢、後ろへの歩行を一つのスキルに統合し、移行を調整します。
HomeBody はどのようにミスを修正し、再試行しますか?
- トラッキング: 目標がカメラビュー内でシフトすると、SAM 2.1 のトラッキング(SAMURAI メモリ選択)で追跡し、ビジュアルサーボイングにより位置合わせを修正します。
- グリップ回復: グリップ失敗時には別のグリップ候補を試したりスタンスを調整します。回復手段を使い果たした場合は理由を VLM に返し、計画の変更やターゲットの再選択を行えます。
移動とマニピュレーションの協調はどうなっていますか?
- 制御: 上肢操作時に下半身のバランスを維持するため、AMO(Adaptive Motion Optimization) を使用しています。このモデルは腕のターゲットも考慮した全身制御を行います。
- 周波数: 腕・手へのコマンドは 250Hz で実行され、AMO ポリシーは 50Hz(毎回の制御ティックの 5 回ごと)で更新されます。
HomeBody はどのような計算リソースで動作しますか?
- 構成: システムは単一の RTX 4090 GPU を搭載する Razer Blade ノートパソコン上で動作します。
- ネットワーク: 推論モデル(GPT Astra)は遠隔地から動作し、スキル要求や実行結果をノートパソコンと通信することで、現場での軽量化を実現しています。
スコープと限界点
- Real2Sim 再構築: セットアップ時間の追加と API コストが発生します。
- タスクの長さ: ロボットの到達範囲、マニピュレーション能力、ハードウェアの耐久性(長時間稼働時の過熱など)によって制約されます。
- 推論遅延: GPT Astra の推論によりスキル間の一時停止が発生します。
- ハードウェア依存度: 現在のローカルスタックでは RTX 4090 ノートパソコン GPU が必須です。重いモデルやスキルを追加する場合は追加リソースが必要になります。
謝辞・参考文献
- 支援者: Gio Huh は、Mark Reinecke SURF Fellow として Caltech の支援を受けています(スタンフォード大学 The Movement Lab)。
- 施設提供: スタンフォードロボティクスセンター(SRC)および The Movement Lab(TML)に感謝します。
- 参考文献:
- Super Odometry (IMU 中心の LiDAR-Visual-Inertial Estimator)
- NVIDIA Isaac Sim
- SAM 2 (Image and Video Segmentation)
- Fast-FoundationStereo (Real-time Zero-shot Stereo Matching)
- SAMURAI (Segment Anything Model for Zero-shot Visual Tracking)
- AMO (Adaptive Motion Optimization)
引用情報
Gio Huh, et al. "HomeBody: A Humanoid That Explores, Remembers, and Acts on Its Own." 2026.
@misc{huh2026homebody, author = {Huh, Gio and Gu, Cayden and Truong, Takara E. and Liu, C. Karen and Tevet, Guy}, title = {{HomeBody}: A Humanoid That Explores, Remembers, and Acts on Its Own}, year = {2026}, url = {https://tml.stanford.edu/homebody/} }