
2026/09/26 6:02
ポケモンで遊ぶために世界モデルを教える
RSS: https://news.ycombinator.com/rss
要約▶
Japanese Translation:
Yann LeCun 率いるチームは、Joint Embedding Predictive Architecture (JEPA) の変種である LeWorldModel1 を用いて、消費向け RTX 3080 Ti コンピューターだけで高度な AI ワールドモデルを訓練可能であることを示しました。このモデルは、生のピクセル処理を行うのではなく、抽象的な「latent embeddings」を推定することで Pokémon Red の未来のゲーム状態を予測し、スーパーコンピュータや大規模 GPU クラスタなしに一般化可能な計画立案を実現しました。一般的な問題である「latent collapse」(モデルが単一の自明な状態に簡略化する現象)を防ぐために、チームは Epps–Pulley テストから導き出された特定の統計的ペナルティを用いた SIGReg(Sketched Isotropic Gaussian Regularization)を採用し、embeddings の安定化を図りました。システムはエミュレーターから取得した 1,009 軌跡にわたる 42,382 フレームのグレースケール画像を学習データとして使用し、ノイズのある経路も含めて頑健性を確保しました。初期の計画立案試行では、モデルが自身の過去の推測のみに基づいて未来状態を予測した際に誤差が蓄積され失敗しましたが、これは各ステップで予測を実際のスクリーンショットと整合わせるための特定のファインチューニングプロセスによって解決されました。最終的なモデルは lePokeRed に実装され、約 1,250 万パラメータを持ち、スースターとしてカメールを選択することに成功しました(計画した 100 回の試行のうち 52 回成功し、ランダム選択では 0 回)。このモデルはローカルハードウェアで洗練された計画立案能力を証明しましたが、難易度が計画長さに指数関数的に比例するため、より困難な課題である他のトレーナーへの勝利などへの拡張は未挑戦です。
Text to translate:
Yann LeCun's team demonstrated that an advanced AI world model can be trained entirely on a consumer-grade RTX 3080 Ti computer using a variant of the Joint Embedding Predictive Architecture (JEPA), called LeWorldModel1. This model predicts future game states in Pokémon Red by estimating abstract "latent embeddings" rather than processing raw pixels, thereby achieving generalizable planning without supercomputers or massive GPU clusters. To prevent the common issue of "latent collapse"—where the model simplifies to a single trivial state—the team employed SIGReg (Sketched Isotropic Gaussian Regularization), which stabilizes embeddings using a specific statistical penalty derived from the Epps–Pulley test. The system was trained on 42,382 grayscale frames across 1,009 trajectories from an emulator, including noisy paths to ensure robustness. Initial planning attempts failed due to error accumulation when the model predicted future states based solely on its own previous guesses; this was resolved through a specific fine-tuning process that aligned predictions with real screenshots at each step. The final model, implemented in lePokeRed with approximately 12.5 million parameters, successfully selected Squirtle as a starter Pokémon (achieving success in 52 out of 100 planned attempts versus zero for random selection). While the model has proven capable of sophisticated planning on local hardware, extending these capabilities to more difficult challenges like beating other trainers remains unattempted due to the exponential scaling of difficulty with plan length.
本文
人工知能:ワールドモデル(World Models)とポケモン「紅」への挑戦
人工知能の分野において特に注目を集めるのが「ワールドモデル(World Models)」です。現在、この用語は多用されていますが、ヤン・レクン氏による JEPA(Joint Embedding Predictive Architecture:統合埋め込み予測アーキテクチャ) のアプローチが特に魅力的です。ここでは、コンパクトでローカル学習可能な**
LeWorldModel1** を用いて、ゲーム『ポケットモンスター 紅』をモデル内で理解・計画するまでの研究と課題について解説します。
1. 研究の背景:ポケモン『紅』の世界
サンフランシスコで行われた世界選手権の騒ぎから着想を得て、1996 年発売の**『ポケットモンスター 紅(Red)』**をターゲットに選定しました。
ゲームのメカニクス
- 操作: 方向キーで移動・メニュー操作、A ボタンで相互作用・確認、B ボタンでキャンセル・戻る。
- ストーリー冒頭: オーク研究所にて、「フシギダニ」「ヒトカゲ」「ゼニガメ」から一つを選択(スタートポケモン)し、主人公として冒険を始める。
- 目標タスク: 以下のステップを達成することを目指しました。
- オーク研究所へ移動
- オーク博士との会話終了
- スタートポケモンを選択
- 研究所を出る
- オークの孫と対戦し勝利
初期計画では目標が広すぎたため、**「セーブポイントからスタートし、三匹のスタートポケモンのうちいずれか一つを獲得する」**ことに焦点を絞りました。
2. ワールドモデルとは何か
ワールドモデルは、現在の状態(観察)と行動から未来の状態を予測するモデルです。
基本概念
- 入力: 現在のスクリーンショット ($o_t$) と行動(ボタン操作 $a_t$)。
- 出力: 次のスクリーンショット ($o_{t+1}$)。
- 学習目的: 「左を押せば左に動く」といった因果関係やダイナミクスを一般化して学ぶこと。
- 特徴: 報酬信号なし(reward-free)で環境の仕組みを理解します。
予測の仕組み
モデルは画像そのものを予測するのではなく、**埋め込み空間(latent space)**での予測を行います。
- エンコーダ ($E$): スクリーンショット $x_t$ をベクトル $z_t$ に変換。
- 予備器 ($P$): 現在の埋め込み $z_t$ と行動 $a_t$ から、未来の埋め込み $\hat z_{t+1}$ を予測。
- 教師データ: 次の実際のスクリーンショット $x_{t+1}$ をエンコーダに通して得られる $z_{t+1}$ と比較。
$$ \hat z_{t+1} \approx z_{t+1} $$
損失関数(予測ロスの崩壊)
平均二乗誤差(MSE)を使用しますが、これには大きなリスクがあります。
- 問題: エンコーダと予備器が互いに楽な解を見つけ、「すべての画像を同じ埋め込みベクトル $c$ に圧縮してしまう」という**「潜在空間の崩壊(latent collapse)」**が発生します。 $$ \mathcal L_{\mathrm{pred}} = \frac{1}{D} \sum_{d=1}^{D}(\hat z_{t+1,d}-z_{t+1,d})^2 $$
3. 課題の解決:SIGReg(埋め込み空間の有効化)
埋め込みを一点に圧縮することを防ぐため、SIGReg(Sketched Isotropic Gaussian Regularization) という手法を採用しました。
シグニフィケーション(Shape of Information)
- 目標: 埋め込みの分布が「標準的な等方的ガウス分布 $\mathcal N(0, I_D)$」を維持すること。
- 二次元なら「円形雲」、一次元では「幅広がり」。
- 手法: ランダムな方向 $u$ に投影した数値 $h_i = u^\top z_i$ が標準ガウス分布に従うか確認。
特徴関数を用いた検証
確率分布の形状を記述する**特徴関数(characteristic function)**を使用します。 $$ \phi_X(t) = \mathbb{E}[e^{i t^\top X}] $$ 等方的なガウス分布であれば、どの方向から見ても同じ形となるため、この特性を利用して分布から逸脱しているかどうかを検出・ペナルティ化します。
最終的な学習目標
$$ \mathcal L = \mathcal L_{\mathrm{pred}} + 0.1,\operatorname{SIGReg}(Z) $$
- 係数 0.1: 埋め込みの多様性を維持する正規化項の強さを制御。
4. トレーニングデータと評価
データセットの準備
- ソース: エミュレーターから記録したグレースケール画像(計 42,382 フレーム)。
- 構成: 1,009 つの経路(trajectory)にグループ化。
- スクリプトされたルートと、ノイズのあるランダムな移動を混在させました。
- 理由: 「クリーンなルート」のみ学習すると、例外時の対応ができません。失敗事例も含めることで汎用性を高めます。
埋め込み情報の確認(線形プローブ)
モデル内に「ポケモンを持っているか」という情報が含まれているかを確認するため、エンコーダを固定し分類器を訓練しました。
- 結果: 予備器は単なるコピー機能よりも性能が高く、誤ったボタン操作では予測精度が低下することが確認できました。
5. 計画立案(Planning)の実行と課題
学習済みモデルを使って「ゼニガメを選択する」というタスクを計画し、実行しました。
プランニング手法:クロスエントロピー法(CEM)
14 スロット分のボタン操作シミュレーションを行い、目標(ポケモン取得)に最も近い埋め込み軌跡を持つシーケンスを選ぶアプローチです。
アルゴリズムの流れ:
- サンプリング: 512 つの計画案をランダムに生成。
- 評価: 各案の最終状態が目標どれほど近いか(最小埋め込み距離)でスコア化。
- 選別: スコアの良い上位 64 案を残す。
- 更新: 残った 64 案中の共通するボタン操作パターンを重み付けして、次のラウンドでの確率を高める(確率的な改善)。
なぜ最初の計画が失敗したか
- 問題点: モデルは「目標に近づく」ことを予測しましたが、エミュレーターではポケモンを取得できませんでした。
- 原因: 予測ロスの学習時と計画時のリセットの不一致。
- 学習時: 各ステップごとに実際のスクリーンショットからやり直せる(誤差のリセット)。
- 計画時: 推測された状態からのみ次の推測を行うため、小さな誤差が累積(エラーの堆積)。
- CEM の悪影響: モデルが間違っているシーケンスも「目標に近い」というシグナルで選別されるリスク。
6. 改善:ロールアウト・ファインチューニングと再挑戦
予測誤差の蓄積を修正するため、**ロールアウト(Rollout)**を用いたファインチューニングを行いました。
手法の概要
- プロセス: 実際のスクリーンショットから開始し、予備器が推測した状態を基準に連続して予測する訓練を行います。
- 最初は短い経路から始め、徐々に長いロールアウトへ。
- 学習対象: エンコーダは固定し、予備器と行動エンコーダのみを更新。
結果の改善
- ステップ 12 の MSE 低下: 0.4224 $\rightarrow$ 0.3045(予測精度向上)。
- 特性: 推測からの誤差増は緩やかになり、長期的な計画が可能に。
成功事例: ファインチューニング後、モデルは「A ボタンを 12 回押す」という単純ルートではなく、ゼニガメを選択する複雑なシーケンスを自ら見つけ出しました。
- 初期状態: パーティ数 0
- 計画結果: ゼニガメを選択 $\rightarrow$ パーティ数 1(成功)
一般化性能の検証
ランダムなシードで 100 通りの条件からテストを開始:
- 学習モデル: 52 件中 52 件が成功(※一部成功、残り失敗)。
- ※注記:原文によると「100 件中 52 件」とありますが、直前の文脈「ゼニガメのランは単なる幸運」および後述の実装テスト結果より、完全な一般化ではなく**「約半数で成功・半数で失敗」**の状態でした。
- ランダムシードのみ: 0 件成功。
- 未訓練モデル: 1 件成功。
この結果は、学習済みモデルが有用だが、完全に信頼できるわけではないことを示しています。
7. まとめと今後の展望
現状の評価
- 達成感: オークの孫(ブルージョン)への挑戦は叶いませんでしたが、ゼニガメの獲得に成功しました。
- モデル概要: エンドツーエンドでゼロから学習され、約1,250 万パラメータの規模です。
今後の可能性と課題
- より複雑なシナリオ: オーク博士の研究所を出て、博士自身と会話し、スタートポケモンを選ぶような長期的な計画への拡張。
- 懸念: ロールアウトが長くなるほど難易度は指数関数的に高まります。
- 実装リポジトリ:
での公開済み。lePokeRed
人工知能によるゲームの理解と制御は、単純な画像認識を超え、**「世界モデルを構築し、その中で意味のある計画を立てる」**という高度な能力への一歩です。