ブロードウォーベンチ

2026/09/19 23:44

ブロードウォーベンチ

RSS: https://news.ycombinator.com/rss

要約

日本語訳:

元要約は主たるナラティブの構成(Codex の優位性、その理由、ベンチマーク設定、将来展望)を的確に捉えており堅牢である。しかし、要点リストと厳密に整合させ、特定の証拠を省略したり、暗黙的な矛盾を正したりすることなく、若干洗練されたバージョンであればより適切である。指示が「必要に応じて」 Improved summary を求めることとし、元の版は非常に良いものの粒度不足(具体的には破壊メカニズムとリソース管理のニュアンス)を含んでいるため、これらの点をより緊密に統合しつつ読みやすさを維持する版本を提供する。

改良版要約:

Codex Astra/xhigh は StarCraft II: Brood War ベンチマークにおいて支配的な勢力として台頭し、厳格な 19x19 ラウンドロビンマトリックス(19 の異なる構成を含む)の中で、他のすべてのテスト AI モデルに対し 100% の勝率を達成している。この優位性は、独自のアグレッシブな「disruption(破壊)」戦略を実行する能力に起因する。具体的には、マップ全体を通じて Probe を送り出してお雇い人員や建物などを harassment することにより、対戦相手を軍を構築するどころか長期間の反応時間に追い込む。これに対し、競合他社は躊躇によって失敗することが多く、例えば Grok 4.6 モデルは高いトークン生成量(最大 11,138 トークン)にもかかわらず著しく苦戦した。これは命令バッチを発する間に時間を過剰に消費して思考しているためである。旧来の Codex バージョンや一部の新しいものも「ターン制」なプレイスタイルを示し、思考フェーズ中に破壊されたり、より優れた AI が耐え得る単純な攻撃(光子ランなど)によって失われたりする状況が生じた。また、Claude Fable などのモデルは高階層の構造を管理することに成功したが、その実行はアグレッシブな戦術に対して容易に崩壊した。さらにリソース分析には顕著な効率性の差が明らかとなった:Codex Astra は圧倒的な速度により約$240 の未使用資金を残す一方、Grok 4.6 は先行する収入率にもかかわらず、アクションタイミングの鈍さを理由に$530 以上を無駄にした。現在、どのモデルも専門家レベルで Brood War を掌握していない(多くのモデルは複雑な軍隊構築や防衛的深度が不足している)が、このベンチマークは Codex Astra/xhigh を現在の RTS AI の頂点として確立し、将来のモデルが乗り越えるべき新たな標準(戦術実行とリソース効率において)を設定した。

本文

ブラッドウォー(Brood War)における AI モデルのベンチマーク結果

📝 結論:どのモデルが勝っているか?

  • Codex Astra が明確なリーダーであり、他のすべてのモデルを一貫して勝利させています。
  • 重要な事実: 今回の実験環境では、どのモデルも初心者レベルを凌駕するプレイはできませんでした。プロのプレイヤーでも余裕で勝てます。
  • Grok モデルの評価: まだブラッドウォー(RTS ゲーム)の本質を十分に理解するほど知能が高すぎません。
    • 古いモデルや低コスト設定には「 RTS をターン制ゲームのようにプレイしてしまう」傾向がありました。
    • 「考えることのコスト」を意識する度合いは、新しいモデルの方がはるかに高いですが、それでも完全な勝利に至っていません。

📊 ランキング表(勝率・費用・AP)

順位システム勝数ゲームあたり AP (平均)ゲームあたり費用 ($)勝率
🥇Codex Astra / xhigh18010.54$12.6100.0%
🥈Codex Astra / medium16215.11$17.288.9%
🥉Claude Fable15312.24$12.683.3%
4Codex Astra / low14421.07$25.777.8%
5Codex 5.6 Sol / medium1355.12$10.172.2%
6Codex 5.6 Sol / low1269.23$18.166.7%
7Claude Opus 512620.78$10.566.7%
8Codex 5.6 Sol / xhigh1173.23$8.061.1%
9Codex 5.6 Luna / low990.42$23.850.0%
10Codex 5.6 Terra / xhigh992.10$15.850.0%

🎮 コンテキスト:実験の背景

  • Brood War Bench は、友人たちが独自に遊べるよう開発されたエージェント専用ブラッドウォーです。
  • 当初は『スタークラフト』をプレイしたことがほとんどない人々でしたが、驚くほど高い成績を残しました。
  • 正体の解明: 「何も特別なことはしていない」。ただエージェントに「攻撃しろ」と頼み、彼らが小さな軍団を構築して全力で突撃させるだけでした。

🔍 観察記録:各モデルの挙動

1. Codex:「チーシング(奇策)」による勝利

  • 撹乱戦術の成功: プロテスズ対戦において、プローブをマップ横断させ、相手の労働者や建造物に攻撃させる作戦を採用しました。
    • 相手エージェントは何十秒もの間、「そのプローブに対応するべきか」思考を巡らせ、他の行動を放棄します。
  • 弱点: 持続的な生産力では著しく弱いです。
    • 技術研究の遅延。
    • 防衛された基地への基礎ユニット投入は微量。
    • 労働者を最後の戦いまで温存する傾向があります。
  • 意思疎通の問題: 経済管理、生産、指揮を異なるサブエージェントに任せる際、相互コミュニケーションが不十分でした。
    • 軍隊を担当するエージェントが、大規模な軍勢の構築や計画された攻撃タイミングを見失って、単発攻撃を繰り返す傾向があります。
  • 執念: G009 の対戦では、基地を失った後にもコマンドセンターを持ち上げて角へ移動し、6 分間生存しました。

例:マップ横断する 6 体のプローブ

  • プローブが飛び立ち、ゼアロトが点滴状に出現。
  • 最終的にコマンドセンターまで稼働中。

2. Grok:思考はするが行動しない

  • 過剰な思考プロセス: G043 の xhigh ルンでは、11,138 トークンの思考ログを生成しましたが、戦闘ユニットをフィールドに出すことができませんでした。
    • 43 分間にわたりわずか 6 つのコマンドバッチのみ。
  • 実行力不足: 観測と行動を継続することに失敗した状態です。
    • G003: 3 マリンを生産しましたが敵基地に到達せず。
    • G002: 2 体のゼアロトを生産しましたが展開できていません。

3. Fable:真摯なゲームプレイ

  • 戦略的野心: 最初のユニットで満足せず、経済構築やテクノロジーツリーの進捗を試みました。
    • G007: レッドドア → スパイア → ムタリスクスで勝利。
    • G027: ロボットス施設 → アダンシテアデル → 観測所 → テンプレアー・アーカイブで勝利。
  • 失敗例: G036 ではファクトリーとアカデミーを建てましたが、Opus 5 に占領されてしまいました(野心的なプランが必ずしも成功を保証しないことを示唆)。

📈 ゲーム進行状況の分析

種別比較(技術・労働者・軍団・構造物)

項目Codex AstraClaude FableGrok 4.6
技術研究レベル0.3 → 1.50.2 → 2.00.5 → 1.5
労働者数(生存)8 → 14.716 → 16.77.4 → 24
軍団規模2 → 8.30 → 7.64 → 2
構造物数7 → 6.214 → 7.421 → 4.5

リソース残高と使用量

  • 鉱石・ガスの管理: Grok は初期に大量の鉱石(1,000)を保有しており、対戦終盤では依然として多量に保持しました。Codex と Fable はほぼ底まで使い切っています。
  • 供給量(Production Supply):
    • Codex Astra: 26.5
    • Claude Fable: 26.6
    • Grok 4.6: 11.3 (効率的な生産を示唆)

対戦終了時間分布

  • Codex Astra: 中央値 8:10。多くの対戦が早期(5:00〜10:00)に終了しました。
  • Claude Fable: 中央値 10:37。分布は均等で、中盤~終盤までゲームが続きました。
  • Grok 4.6: 中央値 9:15。早期集中と終了直前のスパイクが見られます。

🥊 ベンチマークの実行方法

  • マトリクス構成: モデルとエフォート設定の組み合わせからなるラウンドロビンマトリクスを構築し、全設定間の対戦を行いました。
  • 環境: Freestyle VM を並列化してマッチアップを実行。ゲームエンジンデータおよびエージェントログを保存。

勝敗マトリックス(W=勝利 / L=敗北 / T=タイムリミット)

システムCodex Astra(xh)Codex Astra(med)Codex Astra(low)Sol(xh)Sol(med)Sol(low)Luna(xh)Luna(med)Luna(low)Terra(xh)FableOpus5SonnetHaikuGrok(xh)Grok(med)Grok(low)
Codex Astra (xhigh)-WWWWWWWWWWWWWWWW
Codex Astra (medium)L-WWWWWWWWWWLWWWW
Codex Astra (low)LL-WWWWWWWWWLLWWW
Sol (xhigh)LLL-WWWLWWWWLWWWW
Sol (medium)LLLL-WWWWWLWWWWWW
Sol (low)LLLLL-WWWWWWWWWWW
Luna (xhigh)LLLLLL-WLWLWLWWWW
Luna (medium)LLLLLLL-LLLLWWWWW
Luna (low)LLLLLLLL-WLWWLLWW
Terra (xhigh)LLLLLLLLL-WLWWWWW
Claude FableLWWWWWLWWWWW-WWWW
Opus 5LWLWLWWLLWLWL-WWW
SonnetLLLLLLLLLLLLLL-WW
HaikuLLLLLLLLLLLLLLL-T
Grok 4.6 (xhigh)LLLLLLLLLLLLWWLL-
Grok 4.6 (medium)LLLLLLLLLLLLWLLLL
Grok 4.6 (low)LLLLLLLLLLLLWLLLL

:

-
は自身との対戦です。
W
が勝利、
L
が敗北、
T
がタイムリミット到達を示します。

  • Codex Astra (xhigh) は表中のすべての他モデルを**完勝(180 勝中 0 敗)**しています。

🚀 今後の展望:自分専用のエージェントで遊ぼう!

  • 現状: すべてのモデルは初心者レベルであり、Photon Rush のような高度な戦略を展開することはできていません。
  • 興奮点: エージェントがゲームをプレイする様子を見ることは、未開拓の領域です。
  • 可能性: これらのベンチマークは遠くまで到達していません。エージェントに何を学ぶべきか、どのような課題を与えるべきかはまだ不明ですが、彼らが成長する様子を見ることを楽しみにしています。

呼びかけ: 自分のエージェントを持ってきて、友人たちとブラッドウォーを楽しんでみてください。

同じ日のほかのニュース

一覧に戻る →

2026/09/19 19:46

1 年前に RL を用いた非自己回帰型決定モデルを構築した

## Japanese Translation: 本テキストは、エンタープライズワークフローを悩ませてきた高遅延と幻覚(ハルシネーション)のリスクを排除することを目的として設計された画期的な完全にオープンソースの AI モデル「Laya」を紹介する。標準的な生成型大規模言語モデルがしばしば 500〜2,000 ミリ秒の遅延を経験するのに対し、Laya は単一の GPU で顕著な 32.8 ms の遅延を実現し(バッチ処理された質問の場合には 7.2 ms)、これを達成するためには形式自由なテキスト生成を完全に回避し、代わりに辞書からオプションを選択する「choice」命令、順序付けされた評価基準レベルを割り当てる「score」命令、および真理値論理によって有用でない出力を示す「noul」という 3 つの特定の決定プリミティブのみを通じて構造化データのみを出力することを行っている。この建築学的なシフトは、ルーティングやスパム検出などの重要なタスクに対して瞬時に数学的に校正された確率を確保し、100 言語以上をカバーしている。TypeSafe の「Jev」といったプロプライエタリ競合製品に優越するように開発された Laya は、企業がローカルで展開することを可能にし、API 手数料と運用コストを大幅に削減する。将来的な改良により、現在のトークン予算の制限を超えたより大きなオプションセットを処理することが予想され、英語専用モデルに見られる一般的な失敗がないグローバルかつマルチスキーマの意思決定のための堅牢なソリューションとなるだろう。

2026/09/19 18:20

生成 AI で作られたポスターがひどいものに終わる必要はありません。

## Japanese Translation: チャットGPT は、AI アートにしばしば関連づけられる反復的・一般的な外見を避け、独自で高品質なポスターデザインを容易に生成できます。初期の要求では標準的なテンプレートが生成される場合もありますが、具体的な指示を与えることで、文脈に応じたテキストオーバーレイ付きのバウハウス幾何学や日本のミニマリズムなど、多様な芸術スタイルを解き放つことができます。以前の批評において「すべての AI 画像は同一である」と主張されていた点とは対照的に、洗練されたプロンプティングは、鑑賞者が直ちに機械生成であると特定しにくい独自性のある視覚コンテンツの作成が可能であることを証明しています。さらに、Claude や Gemini などの他の高度なモデルも、編集可能なテキスト層を含む PDF や HTML ファイルといった実用的に使用可能な形式を出力し、デザイナーが必要なグラフィックアセットを素早く取得する際に実践的な利便性を提供します。これらの成功した結果を他者が再現できるようにするために、著者は様々なポスタースタイルを網羅した 100 の即座に使用できるプロンプトのカタログを編纂しました。このリソースにより、各新しいプロジェクトに対して複雑な手動指示を必要とせずに、多様な視覚コンテンツを迅速に生成できるようになります。結局のところ、効果的なプロンプティングは、AI を退屈なデフォルトの源から、実世界のデザイン基準を満たすプロフェッショナルでユニークなグラフィックを作成する強力なツールへと変革します。

2026/09/20 5:00

インターネット検閲を測定し、最大級のオープンデータセットに貢献しましょう。

## 日本語訳: オニー・プローブは、インターネット検閲に関する世界の最大のオープンデータセットの中核を成すものであり、主に異なる国でどの特定のウェブサイトやアプリがブロックされているかを検証することを目的として設計されています。该软件の核心には、WhatsApp、Facebook Messenger、Telegram などの主要プラットフォームが利用者のネットワーク上でアクセス可能であることを確認するテストが含まれています。さらに重要なのは、M-Lab と共同で作成された標準化された測定方法である NDT テストを活用して、一般インターネットの速度と安定性を評価することです。このツールは Linux および macOS で動作し、個人の利用者がデジタル自由の解決策(例えば回避アプリ)が実際にはローカルの制限に対して機能しているかどうかを検証する能力を付与します。個人の検証を超えて、オニー・プローブ は研究者や組織に、世界の検閲トレンドを追跡するための不可欠なデータを提供します。M-Lab と協力することで、オープンソースコミュニティ全体で一貫性のある信頼できるパフォーマンス指標が確保されています。

ブロードウォーベンチ | そっか~ニュース