Gemini ロボティクス 2 でロボットに全身知能をもたらす

2026/07/31 0:15

Gemini ロボティクス 2 でロボットに全身知能をもたらす

RSS: https://news.ycombinator.com/rss

要約

Japanese Translation:

Google Robotics から、ロボットを複雑な物理的作業と安全な人間の相互作用に適応可能なアシスタントに変容させる画期的な知性層「Gemini Robotics 2」が発表されました。このスイートには、3 つの新しいモデルが含まれています。Gemini Robotics VLAは、足先から指先までの完全なヒューマノイドの全身制御を可能にし、Gemini Robotics ER 2は身体に埋め込まれた推論を伴う長期的かつ多段階のタスクに対応し、Gemini Robotics On-Device 2は最小限のデータを用いて新たな動きを習得でき、Dexmate や SO101 など未慣れなハードウェアにも即座に適応します。システムは、繊細な作業に対応できる特製の 5 本指ハンド(SharpaWave)による高度な巧緻性を示すとともに、複雑な操作には標準の 2 本指グリップサーとも対応しています。多ロボット協調が主要な特徴であり、異なるタイプのロボット同士が通信して単一のユニットでは解決できないワークフローを完了させることができます。安全性は ASIMOV-Agentic など高度なベンチマークを通じて厳格に検証され、安全な近接応答と不安全なツールの呼び出しに対する拒否能力が確保されています。現在、Google AI Studio を通じて早期アクセスパートナーおよびエンタープライズユーザーに利用可能です。これらの革新により、多様な環境において広範な再学習なしに効率的な多ロボットワークフローを実現できます。

Text to translate:

Google Robotics introduces Gemini Robotics 2, a groundbreaking intelligence layer that transforms robots into adaptable assistants capable of complex physical tasks and safe human interaction. The suite includes three new models: Gemini Robotics VLA for whole-body control of full humanoids (feet to fingertips), Gemini Robotics ER 2 for long, multi-step tasks involving embodied reasoning, and Gemini Robotics On-Device 2 which allows robots to master new movements using minimal data, adapting instantly to unfamiliar hardware like the Dexmate or SO101. The system demonstrates advanced dexterity through specialized five-fingered hands (SharpaWave) capable of delicate tasks, while also supporting standard two-fingered grippers for complex manipulation. Multi-robot collaboration is a key feature, enabling different robot types to communicate and complete workflows that a single unit cannot solve alone. Safety is rigorously validated via advanced benchmarks like ASIMOV-Agentic, ensuring secure proximity responses and the ability to refuse unsafe tool calls. Currently available to early-access partners and enterprise users via Google AI Studio, these innovations enable efficient multi-robot workflows across diverse environments without extensive retraining.

本文

ジェミニロボットクス 2:知覚から行動への変革と新しいロボティクスの進化

Google は、ジェミニロボットクス 2(Gemini Robotics 2)のリリースを発表しました。これにより、ロボットは単なる自動機の枠を超え、知的全体-body コントロール精緻な操作能力、そして複数ロボットのチームワークを獲得します。

🌍 ロボトティクスの現状と課題

現在のロボット技術には以下の制限があります。

  • プログラム依存: 限定的で反復的なタスクのみを事前プログラムか遠隔操作で実行可能。
  • 適応力の欠如: 自律学習や予測不可能な環境への適応能力に劣る。
  • スキル転移の困難さ: 学習されたスキルのロボット間の移転が極めて難しい。

これらを解決するためには、あらゆる形状のロボットが AI モデルによって思考・行動・対話を行うことが不可欠です。

🚀 ジェミニロボットクス 2 の概要

ジェミニのマルチモーダル理解力を駆使し、現実世界でのアクションを実現する「知能層」です。主要な機能は以下の通りです。

  • 論理推論の付与: あらゆる動きを通じて思考能力を可能にし、幅広いタスクを遂行。
  • 人間型動作の実現: 歩く、しゃがむ、体を伸ばす、物体操作など、ヒューマノイド特有の動作が可能に。
  • 複数ロボットの連携: 他のロボットと連携して作業効率化を実現。
  • 高速適応: ローカル実行が可能で、数時間で全く新しいロボット本体(ボディー)に適応。

3 つの高機能モデル

  1. ジェミニロボットクス 2(VLA モデル)

    • 視覚と言語の入力を運動制御に変換する最高峰の**ビジョン・ランゲージ・アクション(VLA)**モデル。
    • 足先から指の先までの人間型ロボットの全身制御に対応。
    • 両手およびグライバーにおいて、新しいレベルの繊細な操作を実現。
  2. ジェミニロボットクス ER 2(エムボディッド・リーズニング モデル)

    • 最も能力のある**エムボディッド・リーズニング(ER)**モデル(VLM)。
    • ロボットに「脳」として機能させ、人間との対話や多段階タスクの計画を可能にする。
    • 複数ロボット協調機能の導入により、チームとして協力する能力を獲得。
  3. ジェミニロボットクス オンデバイス 2(On-Device モデル)

    • ロボットデバイス上でローカルに動作するように最適化された効率的な VLA モデル
    • 僅か数時間の学習データで新規ロボットの実装に適応可能。
    • ネットワークなしでも動作し、低遅延を確保。

💪 具体的な機能強化と実用例

🦾 動き続けるヒューマノイドによる全体-body タスク管理

従来のモデルが上肢(腕)に限定されていた制御を、全身運動へ拡張しました。

  • 事例: Apptronik の Apollo 2 ヒューマノイドへの指示「緑色のゴミ箱(下段棚)に水やり用の壺を置け」。
  • 動作: 机まで歩き→壷を持ち上げ→移動→正確な位置へ配置と、全身協調が必要なタスクを実行。

🖐️ 手とグライバーへの高度な操作能力

家庭や職場での実用性を高めるため、異なるエンドエフェクターを通じて飛躍的な操作性を実現しました。

  • SharpaWave ハンド(五指・22 ドフリー): 結び目(ネクタイ)の結びやジップロック袋の封じなど、繊細な動作を実行。
  • Franka Duo プラットフォーム(二本指グライバー): 密充填など複雑な操作性タスクに対応。

🧠 エージェント推論と複数ロボット協調

長期にわたる多段階タスクを自律的に管理・実行できるようになりました。

  • 高位の「脳」による監視: ジェミニロボットクス ER 2 がタスク全体を追跡し、失敗を検知して自己修正。
  • 長時間タスクの実行: 数百回の判断を伴う数分間持続するタスクシーケンスを確実な遂行。
  • 複数ロボットの協業: 異なるタイプのロボット同士が通信・協力し、単独では達成できない複雑なワークフローを解決。

⚡ あらゆるロボットに適応するための高速オンデバイスモデル

ネットワーク接続なしでの動作や、多様なロボットへの即座の適応を実現しました。

  • モーション転送技術: 新規ロボット(Dexmate、SO101、Trossen など)に対し、数時間での学習で対応。
  • 汎用性: 形状・センサー・自由度が異なるロボットでも通用する設計。

🛡️ 安全かつ責任あるロボット技術へのコミットメント

安全性を最優先し、不確実な状況下でも安全に動作するモデルです。

  • ASIMOV-Agentic ベンチマークの導入:
    • 不安全なツールコール(コマンド)を拒否する能力を検証。
    • 実行不可能なタスクでは人間の介入を積極的に求める能力を検証。
  • 強化されたエムボディッド・リーズニング:
    • 人間接近検知の精度向上と安全な停止機構の実装。
    • 協力的安全性規格における重要な要件を満たす世界最高峰の安全性。

🌐 汎用的物理 AI(AGI)への道標

単一タスク自動化から汎用的知能へ移行するための重要なマイルストーンです。

  • 物理世界の AI が人間の協力で複雑な課題を解決できる「コアインテリジェンス」の構築を目指す。
  • ロボットの真の潜在能力を解き放ち、汎用的物理 AI の実現に向けた一歩。

同じ日のほかのニュース

一覧に戻る →

2026/07/31 2:04

この TV ストックを買う前に読んでください

## Japanese Translation: Bitsight のセキュリティ研究者ペドロ・ファレ(Pedro Falé)が、汎用的な H96 ストリーミングデバイスが秘密裏に自身を携帯電話(サムスン、ビボ、華為(Huawei)、シャオミなど)として偽装し、中国の Fengwo グループ(浙江省 Fengwo IoT Technology Ltd.)が運営する AI 生成ウェブサイト上で広告をクリックさせることを暴露しました。同グループは、これらのデバイスを広告不正のための captive traffic ソースとし、またテレビに接続した際に IP アドレスを貸し出す住宅プロキシとして利用しています。Bitsight は、かつてテレメトリ用に使用された無効化ドメインを経由して「ホームへ電話」している約 38,000 台のそのようなユニットを追跡しました。影響を受けたすべての H96 デバイスには、Fengwo の名称で登録された特許を通じて特定されるように、同グループによってインストールされた 2 つのプロプライエタリなアプリが存在し、低スキルオペレーターが偽装サイトを作成し不正実行ルーチンを動作させることを可能にする簡易的な視覚的プログラミングツール(Google Blockly ベースの実装)を採用しています。ネットワークの AI 生成コンテンツは金融、医療、教育、ゲーム、音楽、食品などのカテゴリにわたっていますが、広告はそのトラフィックが偽装されたモバイルプロファイルから来ている場合에만提供されます。単一の古いドメインからのテレメトリだけでも、この操業は毎日約 50,000 ドルを発生させており、ファレはそれが代金を含めて考慮されていないため控えめであることを警告しました。また、消費者向け IoT における不正プロキシソフトウェアやボットネットについて FBI が警告しているにもかかわらず、Amazon、ベストバイ、Newegg などの主要小売業者は依然として、これら不安全で無印の Android ボックスを販売し続けています。Google は購入者に Play Protect 認証の確認を推奨しており、Synthient は事前にプロキシソフトウェアがプリインストールされた既知の悪意のある IoT デバイスのリストを維持しています。記載されたメールアドレスへの Fengwo グループとの連絡尝试は、受信トレイ容量不足や配信問題のために失敗しました。

2026/07/31 1:26

GitHub に Stacked PR が実装されました

## Japanese Translation: GitHub は、「Stacked Pull Requests」という新機能を導入し、大規模な変更をレビューとマージのために小さな順序付きのレイヤーに分割します。チームは各レイヤーを個別にレビュー・検証でき、個別にマージするか、1 回のクリックですべて準備が整ったレイヤーをまとめてマージできます。このアプローチは、集中したレビューを通じて高いコード品質を維持しつつ、大規模な更新を並列で効率的に進めるように設計されています。既存のブランチ保護設定とシームレスに連携し、GitHub ウェブインターフェース、CLI、モバイルアプリ、Copilot などの AI コーディングエージェント(`gh-stack` スキルを通じて)全体で使用可能です。ユーザーは CLI 拡張機能(`gh extension install github/gh-stack`)をインストールすることで、スタックの作成を 1 分未満で開始できます。現在はすべてのリポジトリで公開プレビュー中であり、自動化されたマージキューへの追加サポートは今後数週間で展開されます。

2026/07/31 4:34

ASD-STE100 シンプル英語でドキュメント強制を行うエージェントスキル

## Japanese Translation: `AminBlg/SimpleEnglish` スキルは、LLM に ASD-STE100 シンプルテクニカル英語規格を適用し、航空宇宙業界で 1983 年以来開発されてきた制御された言語を用いて技術ドキュメントの曖昧さを排除することを強制します。本スキルは Cursor、VS Code Copilot、Claude Code、Gemini CLI を含む各種 AI ハーネスと互換性があり、`npx skills add AminBlg/SimpleEnglish` を使用してインストールするか、ターミナルサポートがない環境では特定のプロンプトファイルを介して直接適用できます。本規格は、指示あたりの最大 20 語(1 語=1 つの意味)、単数形時制、能動 voice、"might" や "should" などの保留語を除外することといった厳格な制約を強制します。6 つのモデルを対象としたベンチマークでは、このスキルを適用することでベースラインエージェントとの比較において規則違反が 72.9% 減少し、出力トークンも減少することが示されました(ベースラインエージェントは本来、架空の規則番号を発明したり、過度に長い文を書く傾向があります)。本スキルはエラーメッセージ、インシデント報告書、リリースノートに対して特化された適応版を提供しますが、マーケティングコピーやブログ記事の作成はその範囲から明確に除外されています。非公式に開発され MIT ライセンスの下で提供されている本プロジェクトは、特定の技術的問題に対する TDD(テスト駆動開発)手法を用いてその有効性を評価し、教育資料において固有の仕様テキストを複製することはありません。

Gemini ロボティクス 2 でロボットに全身知能をもたらす | そっか~ニュース