ARC-AGI-3 上で動作する OpenAI の GPT-6 アストラ

2026/09/04 4:45

ARC-AGI-3 上で動作する OpenAI の GPT-6 アストラ

RSS: https://news.ycombinator.com/rss

要約

Japanese Translation:

GPT-6 Astra は、ARC-AGI-3 ベンチマークにおいて最先端の性能を達成し、現在の AI と真の人工汎用知能(AGI)の間の「残留ギャップ」を縮小しました。Provider Adapter ハネスが高度な推論努力で稼働した場合、Astra は ARC-AGI-3 Semi-Private タスクにおいて 99.9% の精度を達成し、max-standard-harness スコアの 62.7% を上回るとともに、実行速度を約 3.66 倍に向上させ、トークン使用量を約 49%削減しました。本システムは、平均してテストされた人間の中央値より少ないアクション数を必要とする点において、96% のレベルで人間のアクション効率基準を上回りました。

これらの結果は、対象の状態とルールを追跡するためのカスタム代数表記を含む緊密な「記号的ワールドモデル」の採用、および盤面パーサー、探索アルゴリズム、ナビゲーションと戦闘用のゲームライブラリなどの専用ツールの開発に由来します。ベンチマークは、探究、モデリング、目標設定、計画・実行という 4 つのエージェント能力を、新規かつ抽象的なターン制環境で評価します。

重要な促進要因として、モデルがどのノートを選択して保持するかを許す Standard ハネスから、コンテキスト管理機能(例:不透明な推論状態の保存、対話圧縮)を活用する Provider Adapter ハネスへの切り替えが挙げられます。これらの画期的成果にもかかわらず、専門家たちは、この達成が完全な AGI の確立を保証するものではなく、むしろ境界モデルが因果推論と自律的な目標設定を習熟していることを示していると強調しています。業界にとっては、これは単なる指示従属を超えた AI に対する期待を変革し、人間レベルの効率性を持ちつつはるかに低い計算コストで自動化を実現することを意味します。

本文

GPT-6 Astra:ARC-AGI-3 ベンチマークでの歴史的スコア達成

GPT-6 Astra は、ARC-AGI-3 Semi-Private ベンチマークにおいて最先端のスコアを達成しました。各ハルネス(環境設定)ごとの結果と主要な能力は以下の通りです。

  • 標準ハルネス(Standard Harness)
    • 費用:26,000 ドル
    • スコア:62.7%
    • 特徴:モデルが環境全体を通じて持ち運びたいメモを自律的に選択・引き継ぐことを可能にします。
  • プロバイダーアダプターハルネス(Provider Adapter Harness)
    • 費用:19,000 ドル
    • スコア:99.9%
    • 特徴:リクエスト間の不透明な推論状態を保持し、長 conversational な対話においてコンパクション機能を活用。モデルが以前の仕事を引き続き再利用可能にします。

主要な能力

  • アクション効率性
    • アクション効率において人間の基準線を上回りました。
    • 中央値レベルの人間よりも**96%**少ないアクションで課題を解決しました(fewer actions)。
  • 象徴的な世界モデル
    • 未慣れな環境をコンパクトな象徴的な世界モデルに変換しました。
    • ゲームメカニズムを論理的な規則として表現し、独自のカスタムドメイン固有言語の簡易記法を開発しました。

ARC-AGI-3 とは?

ARC-AGI-3 は、新規かつ抽象的なターン制環境を通じて「エージェント型知能(agentic intelligence)」を研究することを目的としたベンチマークです。

特徴

  • 自律的な計画:明示的な指示なしで周囲を探検し、目標を推測し、環境の内蔵モデルを構築して効果的に行動します。
  • 制限された前提知識:コアとなる知識の事前情報のみを含み、人間参加者との制御されたテストを通じて難易度が調整されています。
  • 人間の到達可能性:人間はこれらの環境の**100%**を解決することができます。

目的

ARC-AGI シリーズは、現在の人工知能と汎用人工知能(AGI)との間の「残余ギャップ」を計測します。AGI は、人間が持つあらゆるスキルを効率的に習得できるシステム能力として定義されています。本ベンチマークは前世代(ARC-AGI-1, ARC-AGI-2)を拡張し、単なるタスク完了を超えたエージェント型能力を検証します。

テストされる 4 つのエージェント型知能の構成要素

  1. 探検(Exploration):受動的に情報を得るのではなく、周囲と相互作用して能動的に情報を収集します。
  2. モデリング(Modeling):生データから将来の状態や結果を予測できる汎用化可能なモデルへと変換します。
  3. 目標設定(Goal-setting):疎な報酬のみを頼りにし、ターゲットとなる未来の状態を特定します。
  4. 計画と実行(Planning and Execution):現状から目標への経路を描き出し、新たな情報に応じて修正します。

GPT-6 Astra の詳細結果

GPT-6 Astra は、両方のハルネスにおいて ARC-AGI-3 で最先端のスコアを達成しました。

重要な知見:より高い推論レベルはコストが低くなることが一般的です。Astra がゲームを fewer なアクションで解決するため、モデル呼び出しとトークンの総数を削減できます。

ハルネス比較概要

ハルネス種別主な機能
標準(Standard)モデルが環境全体を通じて持ち運びたいメモを自律的に引き継ぐことを可能にします。
プロバイダーアダプター(Provider Adapter)リクエスト間の不透明な推論状態を保持し、長 conversational な対話においてコンパクションを活用してモデルの再利用を可能にします。

性能内訳

スコアと費用の比較:

  • 標準ハルネス(最大推論):62.7% / 費用 26,098 ドル
  • プロバイダーアダプターハルネス(高推論):99.9% / 費用 18,817 ドル

どちらも最先端のスコアです。

コスト効率性:最大推論努力下において、Astra はゲームをより効率的に解決し、結果として低い推論努力レベルに対する総コストを引き下げます。

推論レベル別の詳細スコア

推論レベル標準ハルネス スコア / コストプロバイダーアダプターハルネス スコア / コスト
最大(Max)62.7% / 26,098 ドル98.6% / 17,332 ドル
x 高(xhigh)98.4% / 18,147 ドル
高(High)59.3% / 37,317 ドル99.9% / 18,817 ドル
中程度(Medium)54.8% / 40,705 ドル98.4% / 19,285 ドル
低(Low)38.6% / 48,090 ドル98.0% / 21,298 ドル
なし(None)17.5% / 38,166 ドル96.7% / 23,457 ドル

※注:"—"はその特定のセルについてソースコンテキストで報告されていないことを示します。

人間コストとの比較(経済的評価)

テスト参加者の報酬構造:

  • 時間代:90 分間のセッションあたり 115 ドル
  • 成功ボーナス:完了したゲームごとに 5 ドル
  • ゲーム数:参加者はセッションあたり約 9 ゲームを試みました(ゲームあたり平均約 12.78 ドル)。

コストの内訳分析:

  • 時間価値:料金の大部分は、参加者の時間代およびテストを受ける意思に対する対価です。
  • エネルギーコスト:脳エネルギー(電気料として価格設定)のみを考慮した場合:
    • セッションあたり約 0.6 セント
    • 試みたゲームあたり約 0.067 セント

アナリシス:スコアを超えて

プレイバック(replays)の分析から、未慣れなメカニズムの扱い方に関する以下の 3 つの主要な知見が得られました。

  1. コンパクトな代数記法:状態を追跡するための独自な簡易記法の開発。
  2. アクション効率性:人間ベースラインとの比較。
  3. カスタムツール:外部ソフトウェアライブラリおよびパースアの作成。

1. カスタム代数記法(Compact Algebraic Notation)

ARC-AGI-3 のプレイ中、Astra はどの戦略メモを引き継ぐかを選択します。オブジェクト、座標、規則、未完了の計画を追跡しつつ、オンザフライで生成された独自のカスタムドメイン固有言語を使用しています。これは完全なプログラミング言語ではなく、シーンをコンパクトな象徴モデルへと精製した代数簡易記法です。

このモデルでは、オブジェクトの位置、相互作用、アクションの実行順序を示します。

Astra の記法の例:

  • ゲーム状態:
    L8: hub q2 (8↓). Lengths: 14=1…
    • レベル、ローカル回転インデックス、メカニズムの長さを記録します。
  • マルチステップ計画:
    extend8 to3; retract10 to2; shorten8 to1
    • 色メカニズムに対する順序化された変化のシーケンスを記録します。
  • 制御と座標:
    9−=(39,4), rotate=(49,18), 14+=(59,11)
    • 操作を実行する制御の座標にマッピングします。
  • 時間と位置:
    Turn 5: P=(24,20), empty, facing west
    • ターンカウンター、プレイヤーの位置、持ち運ぶ状態、および方位を組み合わせています。

2. 人間とのアクション効率性の比較

ベースラインの確立: ベンチマークローンチ前に約 500 名の一般市民がテストされ、「人間のベースライン」が確立されました。各レベルにおけるベースラインは、それを完了したプレイヤーたちの中間値(中位数)のアクション数で定義されます。

  • 結果:プロバイダーアダプターハルネスにおいて、Astra(最大推論)は **96.0%**のレベルで人間ベースラインよりも fewer なアクションを使用しました。
    • 平均:51.7% fewer なアクション/レベル。

結論: このマイルストーンは、Astra が人間の効率性を凌駕したことを意味します。機械的アプローチはメカニズムを理解した後であってもより多くの探検(アクション)を必要としますが、フロンティア AI はバイナリのようなパターンを示し、「理解」が生じれば実行効率は人間の範囲内に収まります。

3. エージェントハルネスにおけるカスタムツール

Astra はPRO-LONG ハルネス(初期のレッドチームパートナーセットアップ)で評価され、カスタムコードを実行するサンドボックスへのアクセスを持っていました。

  • ツールセットの作成:各ゲームのために独自のカスタムツールセットを作成しました(ボードパースア、ゲーム状態モデル、検索アルゴリズム、プランナー、持続可能なメモなど)。
  • ライブラリの生成:複雑な実行において、小さなゲーム固有のソフトウェアライブラリを生成しました。

例(ゲーム tu93): ガードと移動するパトロールを備えた迷路のような環境において、Astra は以下のものを構築しました。

  1. maze_solver.py
    :ナビゲーション処理。
  2. combat_solver.py
    :戦闘ルールの追加。
  3. patrol_solver.py
    :移動するパトロールのモデル化。
  4. sync_state.py
    :予言を観察結果と比較して検証。

※注:これらの結果はモデルとそのツールの統合されたパフォーマンスを表しており、人間のテスト参加者はコードインタプリターやスラッチパッドへのアクセスを持っていませんでした。


2 つのハルネス、2 つの問いかけ

我々の評価フレームワークは、以下の 2 つの明確な問いかけに対処します。

  1. 標準ハルネス
    • 問い:モデルは同じ最小限かつプロバイダー中立なインターフェースの下でどのように比較されるか?
    • 意義:必要な情報を提供しつつ、モデルが可視メモにおいて何を保持すべきか決定する責任を負わせます。これにより、将来の AGI が解決できるかを検証し、プロバイダー間でのリンゴとリンゴの比較(公平な比較)を確保できます。
  2. プロバイダーアダプターハルネス
    • 問い:モデルは、そのプロバイダーによって設計されたコンテキスト管理機能をどのように活用してパフォーマンスを発揮するか?
    • 意義:リクエスト間の不透明な推論状態を保持し、長 conversational な対話を管理するためにコンパクションを活用します。

プロバイダーアダプターの影響

  • 最高スコアは、標準ハルネスの 62.7%から99.9%へと劇的に増加しました。
  • 速度向上:集計記録経過時間において約3.66 倍速いものでした。
  • トークン削減:両方のハルネスで解決された 167 のゲーム推論ペア全体で、49% fewer な総トークンを使用しました。

今後の方針:ARC-AGI リーダボードでは、標準ハルネスとプロバイダーアダプターハルネスの両方の結果を報告し、各評価条件は明確にラベル付けされます。


結論

ARC-AGI-3 は、研究者およびエージェントが未慣れな環境を探検し、規則を発見し、相互作用を通じて学習することを続ける有用なプレイグラウンドとして機能します。Astra の結果は、フロンティアモデルの能力における顕著な**ステップファンクション変化(段階的進化)**を表す主要なマイルストーンです。

AGI に関する注記

  • ベンチマークを飽和させることは「AGI を達成したことの証明」となりません。
  • Astra は一般化に向けて意味のある進歩を示していますが、これが AGI と主張するわけではありません。
  • このシリーズは、新出現の研究課題と AI の能力の間のフィードバックループを生み出すように設計されています。

ARC-AGI-3 は、AI に具体的な指示なしで因果的世界モデルを合成し目標達成を求める最初のインタラクティブベンチマークでした。Astra はこれをクリアしましたが、これは決定論的で閉じたエンドのメカニズムを持つ限定されたスコープであり、現実世界の完全な複雑さや開かれた終わりを代表していません。我々は、递归的自己改善および開かれた終わりへのイノベーションを含む次世代ベンチマークの問いかけを積極的に探求しています。

謝辞: この投稿の早期レビューにあたり、François Chollet, Mike Knoop, Matt Mazur, Ethan Bond, および Derek Smith に感謝いたします。

フットノート:

  • 脳代謝電力推計:脳代謝電力 20W、電気代 $0.20/kWh を仮定すると、セッションあたり約 $0.006(試みたゲームあたり約 $0.00067)に相当します。
  • セキュリティ確認:サンドボックスから抜け出すことを試みる証拠は見られませんでした。

同じ日のほかのニュース

一覧に戻る →

2026/09/04 3:32

Cerebras に Qwen 3.8 27B が登場、1500 トokens/秒で提供中

## Japanese Translation: Cerebras の公開エンドポイントは、無料トライアルおよび従量課金プランの両方で、オープンソースモデルの元の未トリミングバージョンを独占的にホストし、最高の品質と透明性を保証します。多くのサービスがデータを静かに圧縮するのに対し、Cerebras はストレージ効率とアーキテクチャの完全性の厳格な分離を行います。ウェイトは 4 ビットや 8 ビットの低位精度形式で保存してスペースを節約しますが、機密性が高い層はフルプレシジョンで保存され、オンザフライでのデクアンタ化が行われるため、演算は高精度で行われます。重要なのは、処理中에도活性化、注意機構、および kv キャッシュが精度低下やクアンタ化を行わずにフルプレシジョンのまま保たれ、数値誤差を防ぐことです。プラットフォームは、「クアンタ化」を単にストレージのためにデータの精度を下げずアーキテクチャを変更しないものと、「トリミング」をモデルのアーキテクチャの一部を永続的に削除するものとして区別します。REAP テクニクスを使用するようなトリミングされたモデルは、Cerebras REAP Collection という名前の Hugging Face などのプラットフォーム上で研究用としてのみ提供され、生产サービスとは決して混在させられません。Cerebras が将来の圧縮手法を検討する場合、既存のエンドポイントを改変するのではなく、明確な命名規則を持つ別々のエンドポイントとして展開します。したがって、この API を利用する開発者は、背後にあるモデル構造に対する隠れた妥協や予期せぬ変化なしに一貫した高忠実度のパフォーマンスを受け取り、品質が実験的な目標のために決して犠牲にされないことを保証されます。

2026/09/03 23:54

ドメイン名の廃止

## 日本語訳: Verisign は、2026 年 2 月までに「.name」トップレベルドメイン階層全体を廃止する計画を持っており、登録有効期限が 2040 年以降とされるにもかかわらず、同意なくかつ補償なしに約 2 万 2,000 人のユーザーのインターネットサービスを実質的に停止します。この劇的な措置は、Verisign がグローバルネームレジストリを收购した後、ICANN で正式に承認されました(2026 年 7 月 28 日)。著者は、廃止案への信頼不足および非道徳的な姿勢がこの決断の主要な要因であると指摘しています。直後の影響により、個人ウェブサイト(例:`neil.fraser.name`)、メールアドレス(例:`beverly.fraser.name`)、IoT デバイスを含む重要なインフラが一夜にして機能を停止します。削除後、空いた第二レベルドメインは、認証情報を利用した自動ボットによって即時に乗っ取られる危険性に直面します。主な危険はデータ損失だけでなく、何千もの個人が同時に自分のデジタルアイデンティティの支配権を失うことにより生じる体系的な脆弱性まで及びます。

2026/09/04 8:00

AI 時代におけるエンジニアのスキル保護

## 日本語訳: この文章は、原子力発電所とソフトウェアの両方で完全自律システムが導入された結果、人間のオペレーターにおける不可欠な「マニュアル」技能が侵食され、危害をもたらしたことを論じている。最も重要な点は、自動化が優位になる際にも技術の退廃を防ぐために、意図的かつ実践的な訓練を保持することが極めて重要であるということだ。ハーバード大学、スタンフォード大学、ニューヨーク連邦準備制度理事会(NY Fed)の証拠は、生成 AI の採用により若手雇用の減少が既に起きていることを示しており、これは部分的には遠隔勤務がメンターシップを断ち切ったため、企業がい経験のない労働者の訓練を行わなくなったことに起因している。このリスクは、自動化によって条件付けられたパイロットたちが機体の致命的な故障時にマニュアル操縦で飛行機を救えず、エア・フランス 447 号機の墜落事故という悲劇的な事例で示された。政治的 reason よりも提案された原子力発電所計画が頓挫した一方で、航空業界は乗組員がマニュアル飛行の技能を実践し続けるために、燃料効率を犠牲にすることを要求することで対応した。将来の危機を防ぐために、研究者たちは AI ワークフローにおける「マニュアルゲート」の導入を提唱しており、これは自動化された支援を受ける前に人間が特定の技能を発揮することを強いるものである。このような構造化された中断なしには、AI が単独で解決できない複雑な状況に対処するために必要な基盤的な専門知識を失うリスクがあり、その結果、以前数年間の経験がないままにエントリレベルの役割を果たすことが不可能になる可能性がある。

ARC-AGI-3 上で動作する OpenAI の GPT-6 アストラ | そっか~ニュース