カスタム WebGPU カーネルによるポーカーの解法

2026/07/31 0:38

カスタム WebGPU カーネルによるポーカーの解法

RSS: https://news.ycombinator.com/rss

要約

Japanese Translation:

概要:

新たなプロジェクトにおいて、PyTorch などの重い外部ライブラリの必要性を回避し、カスタム WebGPU カーネルを使用して完全に Web ブラウザ内で動作するオープンソースのポーカーソルバーが成功裏に作成されました。大規模言語モデル(LLM)を利用して从零で高性能なコードを生成することにより、このシステムは従来の実装よりも 10 倍超の速度を達成しています。コア技術は、仮想後悔最小化(Counterfactual Regret Minimization)アルゴリズムとニューラルネットワークを組み合わせ、最適戦略を瞬時に算出します。以前のアプローチでは複雑なコーディングタスクに失敗することが多かったが、現在のモデルではすでに DeepStack や ReBeL の論文などで示された手法を用いた研究上の概念全体を効率的に機能するソフトウェアへと変換する能力を持っています。この飛躍的な進展により、プレイヤーは高価なハードウェアや数ヶ月の手動計算設定を必要とすることなく、ナッシュ均衡戦略—that is、数学的に不敗とするプレイスタイル—to 無償でアクセスできます。現時点では 2 人対戦のシナリオに限られ、ノードロックなど高度な商業機能を備えておらず、エージェントの計画および判断に関する制限により人間の監督を数ヶ月必要としたものの、このプロジェクトは、人工知能がオンラインに公開されたソースコードを通じてコンシューマーデバイス上で直接複雑なゲーム理論ツールを民主化する方法における強力な転換を示しています。

本文

WebGPU カスタム実装によるポーカー求解器の構築:ライブラリ不要のケース

コーディングエージェントが高度に進歩した現在でも、汎用テンソルライブラリは不可欠な場合があります。この記事では、PyTorch 相当の機能を持たない環境で WebGPU を使いこなすためのアプローチと、その成果について解説します。

背景:なぜ自前で書くのか

ポーカー求解器の構築において、ブラウザ上で動作するオープンソース版を求めましたが、既存の解決策には以下の課題がありました。

  • 商用求解器の高コスト: 従来の高性能求解器は利用に多額の費用が必要でした。
  • 汎用ライブラリの欠如: WebGPU でモデルを実行するには WebAssembly が有効ですが、PyTorch に相当する汎用的なテンソルライブラリは存在しませんでした
  • 従来手法の限界: 数ヶ月間 PyTorch で検証しても、それをブラウザ環境(WebGPU)で再現できる手段がありませんでした。

解決策:カスタム WebGPU カーネルの構築

2026 年現在の状況では、既存ライブラリに依存せず、以下の手順で独自実装を構築しました。

  • PyTorch を「正解のオラクル」として利用:
    • PyTorch の実装を参照基準とし、Codex(AI アジェンツ)に対して等価な WebGPU カーネル生成を指示しました。
    • 単一のプロンプトで等価性テストをパスさせました。
  • 自動化による高速化と最適化:
    • 検証通过后、エージェントに最適化タスクを一晩放置するよう指示しました。
    • 結果:初回生成から10 倍以上の高速化を達成し、活性化関数の切り替えなどの性能向上も提案されました。

このアプローチが有効な理由

通常、「正しいかつ高速なコードを書くコスト」は多数の利用者で償却されるため汎用ライブラリが存在します。しかし、生成コストが安く検証可能な場合にはこのバランスが逆転し、カスタムカーネルの方が勝つことがあります。

重要な条件:

  • 計算内容が明確に定義されていること。
  • 参考実装(オラクル)の信頼性が高いこと。
  • テストが重要な動作を網羅していること。

LLM の時代において、「すべての関連動作を網羅したテストスイート」は仕様書よりも強力な存在となります。

実際の運用:CFR アルゴリズムの実装進化

ポーカー求解器の核心である「仮想的後悔最小化(CFR)」アルゴリズムの実装プロセスは劇的に変化しました。

昨年の秋:手動実装と困難さ

  • 主要な作業: LLM への依存度が高く、動作するコード生成が困難でした。
  • 技術的課題:
    • eager モードでもテンソルに対する
      for
      ループを多用しがち(禁忌)。
    • 非標準的な演算に対応したカスタムカーネルの作成に失敗しました。

現在の状況:自律的な開発が可能に

数ヶ月を経て、以下のタスクをアジェンツに委任できるようになりました。

  • 全体的な実装: 論文全体からゼロベースで正しいコードを書けるレベルに達しました。
  • 自律的な実験サイクル:
    • CFR バリエーションの文献調査、実装、パフォーマンス比較を自動実行。
    • 超パラメータ最適化やスケール則の導出を実行。
    • WebGPU タスクにおいて、検証可能な報酬があるため長時間の実行(数時間〜数日)が成果につながります。

人間と AI の役割分担

  • AI(エージェント): コード記述のほぼ全てを行います。
  • 人間: 計画立案と意思決定を担当します。
    • 「何を」「どう作るか」という方向性は依然として人間が判断し、監督しています。

結論

ライブラリや言語への依存度が下がり、コードのリファクタリングも容易になりました。

  • 商用求解器の代替:
    holdem.computer
    で入手可能です。
  • ソースコード: 完全にオープンソース化されており、以下の GitHub リポジトリで確認できます。
    https://github.com/phulin/poker2
    

付記:プロジェクト情報と制限事項

本プロジェクトはニューヨークのプログラム・リトリート「Recuse Center」参加者として行われました。学術文献内の手法(DeepStack、ReBeL など)を組み合わせて実装しています。

現状のモデルへの制約

現在のライブモデルには以下の制限があります:

  • 性能: 史上最強の求解器ではありません。
  • 対局形式: 2 名のみ(「ヘッドズ・アップ」モード)。
  • 機能不足: 商用求解器にある「ノードロック」(相手の非均衡戦略への対策提示)機能は未実装です。
  • 計算量: 学術論文で報告されているモデルの約1/100のトレーニング計算量です。

より強力なプレイヤーになるためには、基盤モデルに大幅な GPU リソースを投入する必要があります。また、TensorFlow JS (TFJS) は現在サポートが減少しており、必要な基礎演算に対応しておらず、実装テストでは低速でした。

同じ日のほかのニュース

一覧に戻る →

2026/07/31 2:04

この TV ストックを買う前に読んでください

## Japanese Translation: Bitsight のセキュリティ研究者ペドロ・ファレ(Pedro Falé)が、汎用的な H96 ストリーミングデバイスが秘密裏に自身を携帯電話(サムスン、ビボ、華為(Huawei)、シャオミなど)として偽装し、中国の Fengwo グループ(浙江省 Fengwo IoT Technology Ltd.)が運営する AI 生成ウェブサイト上で広告をクリックさせることを暴露しました。同グループは、これらのデバイスを広告不正のための captive traffic ソースとし、またテレビに接続した際に IP アドレスを貸し出す住宅プロキシとして利用しています。Bitsight は、かつてテレメトリ用に使用された無効化ドメインを経由して「ホームへ電話」している約 38,000 台のそのようなユニットを追跡しました。影響を受けたすべての H96 デバイスには、Fengwo の名称で登録された特許を通じて特定されるように、同グループによってインストールされた 2 つのプロプライエタリなアプリが存在し、低スキルオペレーターが偽装サイトを作成し不正実行ルーチンを動作させることを可能にする簡易的な視覚的プログラミングツール(Google Blockly ベースの実装)を採用しています。ネットワークの AI 生成コンテンツは金融、医療、教育、ゲーム、音楽、食品などのカテゴリにわたっていますが、広告はそのトラフィックが偽装されたモバイルプロファイルから来ている場合에만提供されます。単一の古いドメインからのテレメトリだけでも、この操業は毎日約 50,000 ドルを発生させており、ファレはそれが代金を含めて考慮されていないため控えめであることを警告しました。また、消費者向け IoT における不正プロキシソフトウェアやボットネットについて FBI が警告しているにもかかわらず、Amazon、ベストバイ、Newegg などの主要小売業者は依然として、これら不安全で無印の Android ボックスを販売し続けています。Google は購入者に Play Protect 認証の確認を推奨しており、Synthient は事前にプロキシソフトウェアがプリインストールされた既知の悪意のある IoT デバイスのリストを維持しています。記載されたメールアドレスへの Fengwo グループとの連絡尝试は、受信トレイ容量不足や配信問題のために失敗しました。

2026/07/31 1:26

GitHub に Stacked PR が実装されました

## Japanese Translation: GitHub は、「Stacked Pull Requests」という新機能を導入し、大規模な変更をレビューとマージのために小さな順序付きのレイヤーに分割します。チームは各レイヤーを個別にレビュー・検証でき、個別にマージするか、1 回のクリックですべて準備が整ったレイヤーをまとめてマージできます。このアプローチは、集中したレビューを通じて高いコード品質を維持しつつ、大規模な更新を並列で効率的に進めるように設計されています。既存のブランチ保護設定とシームレスに連携し、GitHub ウェブインターフェース、CLI、モバイルアプリ、Copilot などの AI コーディングエージェント(`gh-stack` スキルを通じて)全体で使用可能です。ユーザーは CLI 拡張機能(`gh extension install github/gh-stack`)をインストールすることで、スタックの作成を 1 分未満で開始できます。現在はすべてのリポジトリで公開プレビュー中であり、自動化されたマージキューへの追加サポートは今後数週間で展開されます。

2026/07/31 0:15

Gemini ロボティクス 2 でロボットに全身知能をもたらす

## Japanese Translation: Google Robotics から、ロボットを複雑な物理的作業と安全な人間の相互作用に適応可能なアシスタントに変容させる画期的な知性層「Gemini Robotics 2」が発表されました。このスイートには、3 つの新しいモデルが含まれています。**Gemini Robotics VLA**は、足先から指先までの完全なヒューマノイドの全身制御を可能にし、**Gemini Robotics ER 2**は身体に埋め込まれた推論を伴う長期的かつ多段階のタスクに対応し、**Gemini Robotics On-Device 2**は最小限のデータを用いて新たな動きを習得でき、Dexmate や SO101 など未慣れなハードウェアにも即座に適応します。システムは、繊細な作業に対応できる特製の 5 本指ハンド(SharpaWave)による高度な巧緻性を示すとともに、複雑な操作には標準の 2 本指グリップサーとも対応しています。多ロボット協調が主要な特徴であり、異なるタイプのロボット同士が通信して単一のユニットでは解決できないワークフローを完了させることができます。安全性は ASIMOV-Agentic など高度なベンチマークを通じて厳格に検証され、安全な近接応答と不安全なツールの呼び出しに対する拒否能力が確保されています。現在、Google AI Studio を通じて早期アクセスパートナーおよびエンタープライズユーザーに利用可能です。これらの革新により、多様な環境において広範な再学習なしに効率的な多ロボットワークフローを実現できます。 ## Text to translate: Google Robotics introduces Gemini Robotics 2, a groundbreaking intelligence layer that transforms robots into adaptable assistants capable of complex physical tasks and safe human interaction. The suite includes three new models: **Gemini Robotics VLA** for whole-body control of full humanoids (feet to fingertips), **Gemini Robotics ER 2** for long, multi-step tasks involving embodied reasoning, and **Gemini Robotics On-Device 2** which allows robots to master new movements using minimal data, adapting instantly to unfamiliar hardware like the Dexmate or SO101. The system demonstrates advanced dexterity through specialized five-fingered hands (SharpaWave) capable of delicate tasks, while also supporting standard two-fingered grippers for complex manipulation. Multi-robot collaboration is a key feature, enabling different robot types to communicate and complete workflows that a single unit cannot solve alone. Safety is rigorously validated via advanced benchmarks like ASIMOV-Agentic, ensuring secure proximity responses and the ability to refuse unsafe tool calls. Currently available to early-access partners and enterprise users via Google AI Studio, these innovations enable efficient multi-robot workflows across diverse environments without extensive retraining.