ホームボディ:自発的に探索・記憶し行動する人型ロボット

2026/09/27 3:42

ホームボディ:自発的に探索・記憶し行動する人型ロボット

RSS: https://news.ycombinator.com/rss

要約▶

日本語翻訳:

HomeBody は、人間型ロボットが清掃など複雑で長期間にわたる家事を自律的に遂行できるようになることで、ロボット自律性の画期的な飛躍を示しています。特定の動作のために事前プログラミングされたスクリプトに依存していた従来のロボットとは異なり、このシステムは可視化された物体を直近の視野外にある記憶された位置と関連付ける内部空間地図を構築し、環境に対して動的に推論を行うことを可能にします。これを実現するために、カメラおよび LiDAR から得られるデータを「デジタルツイン」——正確な計画立案と誤り訂正に使用する仮想シミュレーション——へ統合しています。先進的な視覚言語モデルによって支えられ、HomeBody は下部身体による locomotion と上部身体の高頻度制御の双方を用いて、引き出しを開けるや腐敗した食品を廃棄するなど洗練されたスキルをシーケンスします。現在のハードウェア耐久性および計算遅延に関する課題は残存していますが、この拡張可能なフレームワークは、ロボットが単なる堅く孤立したタスクを実行するのではなく現実世界の文脈に適応できる家庭へと移行する決定的な転換点であり、より広範な家用利便性への道を開くものです。

本文

HomeBody:長期計画と自己記憶を持つヒューマノイドロボット

概要

HomeBody は、視界外(エゴビュー)の情報を把握し、空間的記憶を活用して自律的に行動できるヒューマノイドロボットのシステムです。このシステムは、大規模言語モデル(VLM)を中核としたモジュール化可能なスキルを組み合わせています。

  • 内部空間モデル: 可視化された物体と記憶された場所をつなぐモデルにより、曖昧な指示の解決が可能になります。
  • 文脈認識: 「どこへ向かうべきか」「何を操作すべきか」「動作順序は?」という判断を支援します。
  • フィードバックループ: 空間記憶と動作の結果に基づくフィードバックをもとに、次の判断を見直す設計になっています。

タスクデモンストレーション

キッチン整理

  • 指示例: 「コーヒーバッグの袋をすべて集めて島の中央に置くなり、傷んでいる牛乳やオレンジジュースのパックを捨てなさい。」
  • 概要:
    • 残すべき物体と廃棄すべき物体を識別し、各物体を適切な場所へ移動させます。
    • HomeBody は中島にあるコーヒーバッグを集め、指定されたパックを処分します。
    • 部屋全体をまたぐ複数の往復、グリップ動作、配置動作を調整して実行します。
    • 視界の変化: 各動作で視界が変わるため、記憶と動作フィードバックを用いて完了した作業と未完了の作業を追跡します。

薬品の回収

  • 指示例: 「薬を忘れてしまったのですが、代わりに持ってきてくれませんか?また、そのついでに傷んでいるパックも捨ててください。」
  • 概要:
    • 視界外の検索: 当初視界外にあった薬品は、保存されたキーフレーム(画像の断片)を用いて引き出しの場所を探します。
    • 両腕の協調: 右腕で引き出しの手すりにつかみ開け、薬を回収して渡した後、左腕でパックを廃棄します。
    • 空間的アクセス: 体の両側に位置する目標にアクセスできるよう、両腕の間を選択します。

システムパイプライン

ステップ 1:探索(Exploration)

ヒューマノイドの役割を文脈化し、環境を探索させます。

  • 収集データ: iPhone 映像、D435i カメラ観測、LiDAR スキャン(SLAM)、関節ポーズ、Astra によるウェイポイント。
  • 目的: ヒューマノイド自身の視点から部屋全体を記録し、移動や相互作用で得た可視情報を基盤に空間的文脈を確立します。
  • 機能: 探索データをガイドとして保存することで、後のタスクでの利用を可能にします。

ステップ 2:Real2Sim(現実からシミュレーションへ)

Astra を Real2Sim エージェントとして使用し、デジタルツイン(仮想空間モデル)を構築します。

  • グラウンドイング: 収集したデータ(SLAM 幾何学、エゴビュー、関節状態など)に基づき、Isaac Sim 内の仮想環境に正確な位置合わせを行います。
  • 目的: 「自分自身の視点」を超えた場所についても VLM が論理的に推論できるように支援します。

ステップ 3:日常タスクの実行

ロボットに具体的な指示を与え、アクションレベルの脚本書き込みなしに行動を選択・実行します。

  • 指示例: 「キッチンを片付ける。コーヒーバッグを島の中央に置き、傷んでいるパックを捨てること。」
  • 機能: 空間的な文脈を活用し、再構築された環境上で示範実行を行います。

実装詳細:拡張可能なスキルライブラリ

ヒューマノイドの移動、グリップ、配置、引き出し開閉は HomeBody の動作語彙を形成します。これらのスキルは共通のインターフェース(ターゲット指定と実行結果)を共有しており、VLM はこれらを組み合わせることで新しいタスクを実行できます。

スキル IDプラットフォーム機能説明
スキル 01リアルロボット (1.25x)ピック: エゴ画像で選択された物体を掴み、持ち上げます。
スキル 02リアルロボット (1.25x)プレース: 保持している物体を選択した 3D 解放点へ移動させます。
スキル 03リアルロボット (1.25x)ドラワープン: ハンドルと位置合わせし、フックして後ろ向きに歩行することで引き出しを開けます。
スキル 04リアルロボット (14x → 4x)Drawerピック: 開いた引き出しの中に手を突っ込み、物体を縁の外に持ち上げます。
スキル 05リアルロボット (1.25x)ナビゲーション: Real2Sim マップ上の地点までの計画された経路に沿って移動します。
  • 独自のスキルの追加: 学習済みポリシーや古典的なアルゴリズムを共有インターフェースを通じて接続可能です。VLM はこれらを連鎖させて新しいタスクを実行します。
  • 注意点: プレビュー映像は約 7〜10 秒にスピードアップされています。「引き出しから拾う」などのスキルでは、連続した再試行の過程を経て成功するのみを表示しています。

アーキテクチャと FAQ

正確な Real2Sim 再構築には何が必要ですか?

  • 人間が撮影したビデオ: 豊富な視覚的詳細を提供し、部屋の外観に一致するように再構築と位置合わせを助けます。
  • SLAM リファレンス: 自己の探索データ(カメラ観測、SLAM 幾何学、関節ポーズ、ウェイポイント)を用いて、空間の意味的理解に加え、幾何学的に正確な推論を支援します。

HomeBody はどのように自己位置推定(ローカライゼーション)を行いますか?

  • グラウンドイング: Super Odometry を用いてロボットの自己位置推定を行い、SLAM マップと再構築されたシミュレーションを点対点法(ICP)で位置合わせします。
  • 保存機能: 共有フレーム内でエゴカメラの観測データを保存し、記録された位置へ戻れるようにしています。

HomeBody は VLM の決定を実際の動作に変換しますか?

はい。VLM は構造化されたツールコールを通じてスキルとその対象を選択し、実際の運動を計画・実行します。具体的には以下の通りです。

  • ピック(掴み): 0〜1000 に正規化された画像上の点と使用する腕を指定。「Fast-FoundationStereo」で深度を推定し、カメラ較正によって幾何学を 3D 空間に投影してグリップ姿勢を予測します。
  • プレース(置く): 使用する腕、胴体座標系内の 3D 解放ターゲット、および解放距離を指定して手を開放します。
  • 引き出し開閉: ハンドルとの位置合わせ、フック姿勢、後ろへの歩行を一つのスキルに統合し、移行を調整します。

HomeBody はどのようにミスを修正し、再試行しますか?

  • トラッキング: 目標がカメラビュー内でシフトすると、SAM 2.1 のトラッキング(SAMURAI メモリ選択)で追跡し、ビジュアルサーボイングにより位置合わせを修正します。
  • グリップ回復: グリップ失敗時には別のグリップ候補を試したりスタンスを調整します。回復手段を使い果たした場合は理由を VLM に返し、計画の変更やターゲットの再選択を行えます。

移動とマニピュレーションの協調はどうなっていますか?

  • 制御: 上肢操作時に下半身のバランスを維持するため、AMO(Adaptive Motion Optimization) を使用しています。このモデルは腕のターゲットも考慮した全身制御を行います。
  • 周波数: 腕・手へのコマンドは 250Hz で実行され、AMO ポリシーは 50Hz(毎回の制御ティックの 5 回ごと)で更新されます。

HomeBody はどのような計算リソースで動作しますか?

  • 構成: システムは単一の RTX 4090 GPU を搭載する Razer Blade ノートパソコン上で動作します。
  • ネットワーク: 推論モデル(GPT Astra)は遠隔地から動作し、スキル要求や実行結果をノートパソコンと通信することで、現場での軽量化を実現しています。

スコープと限界点

  • Real2Sim 再構築: セットアップ時間の追加と API コストが発生します。
  • タスクの長さ: ロボットの到達範囲、マニピュレーション能力、ハードウェアの耐久性(長時間稼働時の過熱など)によって制約されます。
  • 推論遅延: GPT Astra の推論によりスキル間の一時停止が発生します。
  • ハードウェア依存度: 現在のローカルスタックでは RTX 4090 ノートパソコン GPU が必須です。重いモデルやスキルを追加する場合は追加リソースが必要になります。

謝辞・参考文献

  • 支援者: Gio Huh は、Mark Reinecke SURF Fellow として Caltech の支援を受けています(スタンフォード大学 The Movement Lab)。
  • 施設提供: スタンフォードロボティクスセンター(SRC)および The Movement Lab(TML)に感謝します。
  • 参考文献:
    1. Super Odometry (IMU 中心の LiDAR-Visual-Inertial Estimator)
    2. NVIDIA Isaac Sim
    3. SAM 2 (Image and Video Segmentation)
    4. Fast-FoundationStereo (Real-time Zero-shot Stereo Matching)
    5. SAMURAI (Segment Anything Model for Zero-shot Visual Tracking)
    6. AMO (Adaptive Motion Optimization)

引用情報

Gio Huh, et al. "HomeBody: A Humanoid That Explores, Remembers, and Acts on Its Own." 2026.

@misc{huh2026homebody,
  author = {Huh, Gio and Gu, Cayden and Truong, Takara E. and Liu, C. Karen and Tevet, Guy},
  title = {{HomeBody}: A Humanoid That Explores, Remembers, and Acts on Its Own},
  year = {2026},
  url = {https://tml.stanford.edu/homebody/}
}

同じ日のほかのニュース

一覧に戻る →

2026/09/25 22:48

ジョージ主義は機能するのか。五年後

## Japanese Translation: ヘンリー・ジョージの地価税(LVT)に関する立法の動量は、世界的に加速しており、これは擁護活動と、土地に対する財産税と建物に対するそれらを分離した分割率課税を可能にする新たな州法によって牽引されています。本年 4 月、バージニア州とケンタッキー州は、自治体が LVT に参加することを許すことを目的とした啓能法を可決し、2026 年の立法シーズンにおける主要な勝利者となりました。ワシントン州は、中心地であるランド・エコノミクス・センターを通じて新たな法案の検討を進めており、同センターは現在、ジョージ著『進歩と貧困』に関する 2021 年の書評で ACX コンテストを制したラルス・ドゥセツによって率いられています。その書評はゲーリズムに関する継続的な報道を引き起こしました。ニューヨーク州のゴシュル知事は、交通プロジェクトのために地価キャプチャーを使用することを都市に権限を与える期間を延長し、IBX の地下鉄拡張を含む可能性があります。国際的には、バーデン・ヴュルテンベルク州政府は裁判所の挑戦を乗り越えた後、2025 年 1 月に LVT を導入しました。イギリスの首相アンディ・バーナムと韓国大統領李在明も LVT を支援していますが、彼らの現在の野望は低水準の既存課税率に直面しています。ドゥセツは、多くの反対意見が誤解に基づくものだと指摘しており、例えば地価集中に関する誤解を挙げます。また、彼は効果的な実施には正確な評価が必要であり、データクリーニングが高度なアルゴリズムよりも重要で、適切に行えばコストアプローチも妥当であると述べています。陳腐化した評価はピッツバーグに見られるように反発を引き起こすことができ、一方韓国では組織化されたシステムによって 5 ヶ月以内に個々の区画全体に対する完全な年間評価を達成しました。CivicMapper などのツールは、低価値の使用に割当てられた高価値の土地(例:地上駐車)を視覚化するのに役立ちます。AI は上昇する地価価格が注目を集めることで支持を加速させる可能性がありますが、採用度は管轄区によって異なります。経済学者たちは LVT を理想的な税制政策として概ね受け入れているものの、実現可能性については議論が続いています。成功した実施は、現在のいくつかの地域の効果的な税率が modest なままであり地域産業の複雑さが実用的な障壁となる場合でも、大規模なインフラプロジェクトの資金調達が可能になりつつ土地使用の不効率を是正する可能性があります。 ## Text to translate: Legislative momentum for Henry George's land value tax (LVT) is accelerating globally, driven by advocacy and new state laws enabling split-rate taxation—separating property taxes on land from those on buildings. In April this year, Virginia and Kentucky passed enablement laws allowing municipalities to opt into LVT, making them major winners in the 2026 legislative season. Washington State is collaborating on new bills through the Center for Land Economics, which Lars Doucet now leads after winning an ACX contest with a 2021 book review of George's *Progress and Poverty* that sparked ongoing coverage on Georgism. New York Governor Hochul extended authority for cities to use land value capture for transit projects, potentially including the IBX subway expansion. Internationally, Baden-Württemberg implemented LVT in January 2025 after surviving a court challenge; UK PM Andy Burnham and South Korea's President Lee Jae Myung advocate for LVT, though their current ambitions face low existing rates. Doucet argues many objections stem from misunderstandings—such as misconceptions about land value concentration—and notes that effective implementation requires accurate assessments: data cleaning outweighs advanced algorithms, and the cost approach is sound when done correctly. Stale valuations can trigger revolt, as seen in Pittsburgh, whereas Korea's organized system achieved full annual valuation across individual parcels in five months. Tools like CivicMapper help visualize high-value land dedicated to low-value uses (e.g., surface parking). AI may accelerate support as rising land prices capture attention, but adoption will vary by jurisdiction. Economists broadly accept LVT as the ideal tax policy, though feasibility remains debated; successful implementation could fund large infrastructure projects while correcting land use inefficiencies, even if current effective rates in some places remain modest and local industry complexity presents practical barriers.

2026/09/27 3:22

DeepSeek エラスティックコンピューティング(DSec)

## Japanese Translation: 要約は理解しやすく、しかし「重要ポイントリスト」で示された詳細な技術情報が不足しています。以下は、その不足している具体的な情報を統合しつつ、流れを保った改良版です: **改良された要約:** DeepSeek Elastic Compute(DSec)は、大規模な大言語モデル(LLM)のトレーニングと評価のための堅牢で生産環境に準拠したサンドボックスプラットフォームです。その核心的な革新点は、巨大クラスター全体にわたるリソース配分および状態保存を統括する統一システムとして機能することにあります。DSec は、メモリ共有、回収、高度な CPU スケジューリング機構などを統合し、複数のサンドバックエンド(FnCall、コンテナ、マイクロ VM、フル VM)を公開する単一の開発インターフェースを通じてこの効率性を達成します。アーキテクチャはデータ読み込みとトレーニングプロセスを分離しており、Fire-Flyer ファイルシステム(3FS)を利用してバージョン付けされた層から環境を構築します。強化学習フレームワークと共に重要な意味で共同設計されており、DSec は報酬ハッキングなどのエージェントの不適切な行動を防ぎ、ロールアウト状態を維持するために、ステートフルなロールアウト実行と非予約 GPU トレーニングを分離しています。このアプローチは、過剰な環境設定時間やイメージ配布のオーバーヘッドといった業界上の課題に対処します。実際の運用では、約 160 ノードに及ぶ単一のプロダクションスケールユニットは、毎日 300 万回以上のサンドボックス作成を維持し、約 38 万の同時利用可能なサンドボックスを提供することができます(作成速度は毎秒 5,000 回を超えます)。これにより、テクノロジー企業が負荷下でもレイテンシに敏感なパフォーマンスを損なうことなく、急速な実験とスケーラブルな AI 開発を実施できるようになります。

2026/09/25 19:55

PipePipe:SponsorBlock を実装した NewPipe のハードフォーク

## Japanese Translation: PipePipe は、2022 年初頭に NewPipe から派生した独立した Android メディアプレイヤーであり、開発哲学の相違により別プロジェクトとして確立され、アップストリームのコードベースに対する更新共有や変更プッシュを行わない状態で運営されています。同アプリは YouTube と Bilibili の高度なストリーミング機能を備え、プライバシー保護、SponsorsBlock を利用した広告なし視聴、クッキーベースのログインによる制限コンテンツへのアクセスを重視しています。アプリは高品質な AV1 および VP9 コーデック対応、Danmaku チャットオーバーレイ、バックグラウンド音楽再生、スワイプによる探索ナビゲーション、Shorts と有料動画のブロックに対応します。追加機能として、非ローカライズされたオリジナルタイトルの表示、高度な検索フィルタリング、キーワード/チャンネル管理、完全なプレイリストダウンロード、アラームタイマー(スリープタイマー)、再生速度制御が含まれます。寄付を介した Ko-Fi および Liberapay を通じてコミュニティによって開発が行われた PipePipe は、公式アプリに関連するデータ追跡なしでユーザーにメディア消費の深い制御を提供します。

ホームボディ:自発的に探索・記憶し行動する人型ロボット | そっか~ニュース