
2026/09/04 4:45
ARC-AGI-3 上で動作する OpenAI の GPT-6 アストラ
RSS: https://news.ycombinator.com/rss
要約▶
Japanese Translation:
GPT-6 Astra は、ARC-AGI-3 ベンチマークにおいて最先端の性能を達成し、現在の AI と真の人工汎用知能(AGI)の間の「残留ギャップ」を縮小しました。Provider Adapter ハネスが高度な推論努力で稼働した場合、Astra は ARC-AGI-3 Semi-Private タスクにおいて 99.9% の精度を達成し、max-standard-harness スコアの 62.7% を上回るとともに、実行速度を約 3.66 倍に向上させ、トークン使用量を約 49%削減しました。本システムは、平均してテストされた人間の中央値より少ないアクション数を必要とする点において、96% のレベルで人間のアクション効率基準を上回りました。
これらの結果は、対象の状態とルールを追跡するためのカスタム代数表記を含む緊密な「記号的ワールドモデル」の採用、および盤面パーサー、探索アルゴリズム、ナビゲーションと戦闘用のゲームライブラリなどの専用ツールの開発に由来します。ベンチマークは、探究、モデリング、目標設定、計画・実行という 4 つのエージェント能力を、新規かつ抽象的なターン制環境で評価します。
重要な促進要因として、モデルがどのノートを選択して保持するかを許す Standard ハネスから、コンテキスト管理機能(例:不透明な推論状態の保存、対話圧縮)を活用する Provider Adapter ハネスへの切り替えが挙げられます。これらの画期的成果にもかかわらず、専門家たちは、この達成が完全な AGI の確立を保証するものではなく、むしろ境界モデルが因果推論と自律的な目標設定を習熟していることを示していると強調しています。業界にとっては、これは単なる指示従属を超えた AI に対する期待を変革し、人間レベルの効率性を持ちつつはるかに低い計算コストで自動化を実現することを意味します。
本文
GPT-6 Astra:ARC-AGI-3 ベンチマークでの歴史的スコア達成
GPT-6 Astra は、ARC-AGI-3 Semi-Private ベンチマークにおいて最先端のスコアを達成しました。各ハルネス(環境設定)ごとの結果と主要な能力は以下の通りです。
- 標準ハルネス(Standard Harness)
- 費用:26,000 ドル
- スコア:62.7%
- 特徴:モデルが環境全体を通じて持ち運びたいメモを自律的に選択・引き継ぐことを可能にします。
- プロバイダーアダプターハルネス(Provider Adapter Harness)
- 費用:19,000 ドル
- スコア:99.9%
- 特徴:リクエスト間の不透明な推論状態を保持し、長 conversational な対話においてコンパクション機能を活用。モデルが以前の仕事を引き続き再利用可能にします。
主要な能力
- アクション効率性
- アクション効率において人間の基準線を上回りました。
- 中央値レベルの人間よりも**96%**少ないアクションで課題を解決しました(fewer actions)。
- 象徴的な世界モデル
- 未慣れな環境をコンパクトな象徴的な世界モデルに変換しました。
- ゲームメカニズムを論理的な規則として表現し、独自のカスタムドメイン固有言語の簡易記法を開発しました。
ARC-AGI-3 とは?
ARC-AGI-3 は、新規かつ抽象的なターン制環境を通じて「エージェント型知能(agentic intelligence)」を研究することを目的としたベンチマークです。
特徴
- 自律的な計画:明示的な指示なしで周囲を探検し、目標を推測し、環境の内蔵モデルを構築して効果的に行動します。
- 制限された前提知識:コアとなる知識の事前情報のみを含み、人間参加者との制御されたテストを通じて難易度が調整されています。
- 人間の到達可能性:人間はこれらの環境の**100%**を解決することができます。
目的
ARC-AGI シリーズは、現在の人工知能と汎用人工知能(AGI)との間の「残余ギャップ」を計測します。AGI は、人間が持つあらゆるスキルを効率的に習得できるシステム能力として定義されています。本ベンチマークは前世代(ARC-AGI-1, ARC-AGI-2)を拡張し、単なるタスク完了を超えたエージェント型能力を検証します。
テストされる 4 つのエージェント型知能の構成要素
- 探検(Exploration):受動的に情報を得るのではなく、周囲と相互作用して能動的に情報を収集します。
- モデリング(Modeling):生データから将来の状態や結果を予測できる汎用化可能なモデルへと変換します。
- 目標設定(Goal-setting):疎な報酬のみを頼りにし、ターゲットとなる未来の状態を特定します。
- 計画と実行(Planning and Execution):現状から目標への経路を描き出し、新たな情報に応じて修正します。
GPT-6 Astra の詳細結果
GPT-6 Astra は、両方のハルネスにおいて ARC-AGI-3 で最先端のスコアを達成しました。
重要な知見:より高い推論レベルはコストが低くなることが一般的です。Astra がゲームを fewer なアクションで解決するため、モデル呼び出しとトークンの総数を削減できます。
ハルネス比較概要
| ハルネス種別 | 主な機能 |
|---|---|
| 標準(Standard) | モデルが環境全体を通じて持ち運びたいメモを自律的に引き継ぐことを可能にします。 |
| プロバイダーアダプター(Provider Adapter) | リクエスト間の不透明な推論状態を保持し、長 conversational な対話においてコンパクションを活用してモデルの再利用を可能にします。 |
性能内訳
スコアと費用の比較:
- 標準ハルネス(最大推論):62.7% / 費用 26,098 ドル
- プロバイダーアダプターハルネス(高推論):99.9% / 費用 18,817 ドル
どちらも最先端のスコアです。
コスト効率性:最大推論努力下において、Astra はゲームをより効率的に解決し、結果として低い推論努力レベルに対する総コストを引き下げます。
推論レベル別の詳細スコア
| 推論レベル | 標準ハルネス スコア / コスト | プロバイダーアダプターハルネス スコア / コスト |
|---|---|---|
| 最大(Max) | 62.7% / 26,098 ドル | 98.6% / 17,332 ドル |
| x 高(xhigh) | — | 98.4% / 18,147 ドル |
| 高(High) | 59.3% / 37,317 ドル | 99.9% / 18,817 ドル |
| 中程度(Medium) | 54.8% / 40,705 ドル | 98.4% / 19,285 ドル |
| 低(Low) | 38.6% / 48,090 ドル | 98.0% / 21,298 ドル |
| なし(None) | 17.5% / 38,166 ドル | 96.7% / 23,457 ドル |
※注:"—"はその特定のセルについてソースコンテキストで報告されていないことを示します。
人間コストとの比較(経済的評価)
テスト参加者の報酬構造:
- 時間代:90 分間のセッションあたり 115 ドル。
- 成功ボーナス:完了したゲームごとに 5 ドル。
- ゲーム数:参加者はセッションあたり約 9 ゲームを試みました(ゲームあたり平均約 12.78 ドル)。
コストの内訳分析:
- 時間価値:料金の大部分は、参加者の時間代およびテストを受ける意思に対する対価です。
- エネルギーコスト:脳エネルギー(電気料として価格設定)のみを考慮した場合:
- セッションあたり約 0.6 セント。
- 試みたゲームあたり約 0.067 セント。
アナリシス:スコアを超えて
プレイバック(replays)の分析から、未慣れなメカニズムの扱い方に関する以下の 3 つの主要な知見が得られました。
- コンパクトな代数記法:状態を追跡するための独自な簡易記法の開発。
- アクション効率性:人間ベースラインとの比較。
- カスタムツール:外部ソフトウェアライブラリおよびパースアの作成。
1. カスタム代数記法(Compact Algebraic Notation)
ARC-AGI-3 のプレイ中、Astra はどの戦略メモを引き継ぐかを選択します。オブジェクト、座標、規則、未完了の計画を追跡しつつ、オンザフライで生成された独自のカスタムドメイン固有言語を使用しています。これは完全なプログラミング言語ではなく、シーンをコンパクトな象徴モデルへと精製した代数簡易記法です。
このモデルでは、オブジェクトの位置、相互作用、アクションの実行順序を示します。
Astra の記法の例:
- ゲーム状態:
L8: hub q2 (8↓). Lengths: 14=1…- レベル、ローカル回転インデックス、メカニズムの長さを記録します。
- マルチステップ計画:
extend8 to3; retract10 to2; shorten8 to1- 色メカニズムに対する順序化された変化のシーケンスを記録します。
- 制御と座標:
9−=(39,4), rotate=(49,18), 14+=(59,11)- 操作を実行する制御の座標にマッピングします。
- 時間と位置:
Turn 5: P=(24,20), empty, facing west- ターンカウンター、プレイヤーの位置、持ち運ぶ状態、および方位を組み合わせています。
2. 人間とのアクション効率性の比較
ベースラインの確立: ベンチマークローンチ前に約 500 名の一般市民がテストされ、「人間のベースライン」が確立されました。各レベルにおけるベースラインは、それを完了したプレイヤーたちの中間値(中位数)のアクション数で定義されます。
- 結果:プロバイダーアダプターハルネスにおいて、Astra(最大推論)は **96.0%**のレベルで人間ベースラインよりも fewer なアクションを使用しました。
- 平均:51.7% fewer なアクション/レベル。
結論: このマイルストーンは、Astra が人間の効率性を凌駕したことを意味します。機械的アプローチはメカニズムを理解した後であってもより多くの探検(アクション)を必要としますが、フロンティア AI はバイナリのようなパターンを示し、「理解」が生じれば実行効率は人間の範囲内に収まります。
3. エージェントハルネスにおけるカスタムツール
Astra はPRO-LONG ハルネス(初期のレッドチームパートナーセットアップ)で評価され、カスタムコードを実行するサンドボックスへのアクセスを持っていました。
- ツールセットの作成:各ゲームのために独自のカスタムツールセットを作成しました(ボードパースア、ゲーム状態モデル、検索アルゴリズム、プランナー、持続可能なメモなど)。
- ライブラリの生成:複雑な実行において、小さなゲーム固有のソフトウェアライブラリを生成しました。
例(ゲーム tu93): ガードと移動するパトロールを備えた迷路のような環境において、Astra は以下のものを構築しました。
:ナビゲーション処理。maze_solver.py
:戦闘ルールの追加。combat_solver.py
:移動するパトロールのモデル化。patrol_solver.py
:予言を観察結果と比較して検証。sync_state.py
※注:これらの結果はモデルとそのツールの統合されたパフォーマンスを表しており、人間のテスト参加者はコードインタプリターやスラッチパッドへのアクセスを持っていませんでした。
2 つのハルネス、2 つの問いかけ
我々の評価フレームワークは、以下の 2 つの明確な問いかけに対処します。
- 標準ハルネス
- 問い:モデルは同じ最小限かつプロバイダー中立なインターフェースの下でどのように比較されるか?
- 意義:必要な情報を提供しつつ、モデルが可視メモにおいて何を保持すべきか決定する責任を負わせます。これにより、将来の AGI が解決できるかを検証し、プロバイダー間でのリンゴとリンゴの比較(公平な比較)を確保できます。
- プロバイダーアダプターハルネス
- 問い:モデルは、そのプロバイダーによって設計されたコンテキスト管理機能をどのように活用してパフォーマンスを発揮するか?
- 意義:リクエスト間の不透明な推論状態を保持し、長 conversational な対話を管理するためにコンパクションを活用します。
プロバイダーアダプターの影響
- 最高スコアは、標準ハルネスの 62.7%から99.9%へと劇的に増加しました。
- 速度向上:集計記録経過時間において約3.66 倍速いものでした。
- トークン削減:両方のハルネスで解決された 167 のゲーム推論ペア全体で、49% fewer な総トークンを使用しました。
今後の方針:ARC-AGI リーダボードでは、標準ハルネスとプロバイダーアダプターハルネスの両方の結果を報告し、各評価条件は明確にラベル付けされます。
結論
ARC-AGI-3 は、研究者およびエージェントが未慣れな環境を探検し、規則を発見し、相互作用を通じて学習することを続ける有用なプレイグラウンドとして機能します。Astra の結果は、フロンティアモデルの能力における顕著な**ステップファンクション変化(段階的進化)**を表す主要なマイルストーンです。
AGI に関する注記
- ベンチマークを飽和させることは「AGI を達成したことの証明」となりません。
- Astra は一般化に向けて意味のある進歩を示していますが、これが AGI と主張するわけではありません。
- このシリーズは、新出現の研究課題と AI の能力の間のフィードバックループを生み出すように設計されています。
ARC-AGI-3 は、AI に具体的な指示なしで因果的世界モデルを合成し目標達成を求める最初のインタラクティブベンチマークでした。Astra はこれをクリアしましたが、これは決定論的で閉じたエンドのメカニズムを持つ限定されたスコープであり、現実世界の完全な複雑さや開かれた終わりを代表していません。我々は、递归的自己改善および開かれた終わりへのイノベーションを含む次世代ベンチマークの問いかけを積極的に探求しています。
謝辞: この投稿の早期レビューにあたり、François Chollet, Mike Knoop, Matt Mazur, Ethan Bond, および Derek Smith に感謝いたします。
フットノート:
- 脳代謝電力推計:脳代謝電力 20W、電気代 $0.20/kWh を仮定すると、セッションあたり約 $0.006(試みたゲームあたり約 $0.00067)に相当します。
- セキュリティ確認:サンドボックスから抜け出すことを試みる証拠は見られませんでした。