
2026/09/09 23:37
GPT-6 Astra、ループ変換器、そして隠れた推論
RSS: https://news.ycombinator.com/rss
要約▶
Japanese Translation:
OpenAI は、パラメータ数を増やさずに問題を解決するため、トランスフォーマーの重みを複数のパスで再利用する「リカレント深さ」または「ループ型トランスフォーマー」アーキテクチャを採用したモデル GPT-6 Astra を発表した。このアプローチは、ARC-AGI-3 といった複雑なベンチマークにおいて前代モデルである GPT-5.6 Sol の 7.8% に対し 99.9% という先端的な性能を実現しており、コーディング、数学、3D レンダリングで顕著な向上を示している。Universal Transformers や ByteDance の Ouro-Thinking、Mixture-of-Recursions などの概念の影響を受け、このアーキテクチャはより深い層を追加するのではなくループ機構を通じて計算グラフを最適化する。最近の研究、特に SMELT (2026) の結果によれば、これらのループ型トランスフォーマーは固定された計算予算内でモデルの品質を向上させるとともに、情報取得容量を増やすことなく効率的な問題解決を可能にし、トレーニングに必要な計算リソースを最大 18% 削減できる。その結果、NVIDIA はこの大幅な効率化への移行に対応するため GPU クラスターを拡張している。業界がこのアーキテクチャを標準として採用するにつれ、将来のバージョンは隠された内部論理よりも効率的な問題解決を重視する傾向が強まるだろう。専門家によれば、開発者は GPT-6 Astra において、隠された論理によるものではなくバックトラッキングの削減から生じる短い推論トレースを観測することを想定すべきであり、また思考連鎖(chain-of-thought)の監視は今やアーキテクチャ以外の理由からネガティブなトレンドにあることを指摘している。
Text to translate:
OpenAI has launched GPT-6 Astra, a model utilizing a "recurrent depth" or "looped transformer" architecture that reuses transformer weights across multiple passes to solve problems without increasing parameter counts. This approach achieves frontier-level performance on complex benchmarks like ARC-AGI-3, where GPT-6 Astra scored 99.9% compared to only 7.8% for its predecessor, GPT-5.6 Sol, demonstrating significant gains in coding, math, and 3D rendering. Influenced by concepts such as Universal Transformers, ByteDance's Ouro-Thinking, and Mixture-of-Recursions, the architecture optimizes computation graphs through looping mechanisms rather than adding deeper layers. Research, including recent findings like SMELT (2026), indicates these looped transformers can improve model quality at a fixed compute budget—requiring up to 18% less training compute—while enabling efficient problem-solving without increasing information retrieval capacity. Consequently, NVIDIA is scaling GPU clusters to support this shift toward massive efficiency. As the industry adopts these architectures as a standard, future iterations will increasingly prioritize efficient problem-solving over hidden internal logic. Experts also suggest that developers should expect shorter reasoning traces in GPT-6 Astra resulting from reduced backtracking rather than hidden logic, and note that chain-of-thought monitoring is currently trending negatively for non-architectural reasons.
本文
OpenAI の GPT-6「Astra」:性能評価と新アーキテクチャの解読
過去数週間に起こった多くの出来事を受け、特に OpenAI の最新モデル GPT-6 Astra への注目が集まっています。性能の評価、ループ型トランスフォーマー(Recurrent Depth) という新しいアーキテクチャ、そして推論過程が隠されているとの噂について議論されています。
この記事では、以下の観点から解説します。
- GPT-6 Astra への簡潔な感想と現状の方向性
- 「ループ型トランスフォーマー」の詳細な仕組み
- 推論過程(Chain of Thought)が隠蔽されている理由とその真実
- 直近の研究論文から得られた新たな知見
1. GPT-6 Astra の基本評価と性能分析
OpenAI は大規模イベントと共に GPT-6 Astra をリリースしました。実際に数日間使用した印象は以下の通りです。
- 圧倒的な性能: 現時点で使用した中で最も秀逸なモデルであり、先代の GPT-5.6 を大幅に凌駕しています。
- 得意分野の明確化:
- 3D レンダリング・アニメーションタスク: 他のモデルに対して圧倒的に優れています。
- 数学・コーディング: 広範なカテゴリーで先代を大きく引き離しており、実世界での利用に近いベンチマークで特に差が顕著です。
- ベンチマーク結果の具体分析:
| ベンチマーク項目 | GPT-6 Astra のスコア/性能 | 対照モデル (GPT-5.6 Sol) | 備考 |
|---|---|---|---|
| ARC-AGI-3 (論理的パズル) | 99.9% | 7.8% | 一般化能力と論理的推論が極めて優れています。 |
| Artificial Analysis Coding Agent Index v1.4 | 最先端を走る | - | コーディングタスクで明確なリーダーシップを示します。 |
| Artificial Analysis Intelligence Index v4.2 | 高スコア | - | コーディングだけでなく、多様なタスクでも優位です。 |
- ベンチマークの信頼性について:
- 「Artificial Analysis」の利点は、モデル開発者による自己評価ではなく、独立したハネス(評価環境)を使用している点です。
- 一部のハネス(例:
,GDPval-AA
)ではオープンソースかつ最小限な設定が使われており、公平な比較が可能です。AA-Briefcase - 一方で、モデルは特定の主要なハネスに合わせてファインチューニングされているため、他ハネスとの比較では性能が低く見積もられる可能性があります(リンゴとオレンジを比べる問題)。
2. コンピューター使用能力の進化と訓練方法
Astra が特に強いのは画像・レンダリングタスクおよびコンピューター使用能力です。
-
GUI 操作の習熟: ブラウザ上の MS Paint でマウス操作を通じて絵を描き直すなど、ソフトウェアを直接制御できるデモが実現されています。
-
強化学習による訓練(RLVR): OpenAI は強化学習のために何万台もの Mac Mini や Mac Studio を購入しました。
- GPU でモデルを訓練するのではなく、macOS オペレーティングシステム自体を「環境」として利用しています。
- 訓練ワークフローの概要:
- モデルにタスクを指示(例:「アプリ xyz を開く」)。
- ハネスが Mac のインターフェースをキャプチャし、LLM に提示する。
- LLM がマウス/キーボードアクションを予測。
- ハネスがそのアクションを実際に Mac で実行。
- 結果のスクリーンショットを次の入力として提供(反復処理)。
- 成功・失敗のフィードバックに基づき強化学習で改善する。
-
未来への展望:
- 今後数年間は、コンピューター使用能力が洗練化していく時代です。
- 「ChatGPT、私の所得税確定申告をお願いします」のような日常タスクの実行が可能になるでしょう。
3. ループ型トランスフォーマーとは?
The Information が報じた通り、Astra は**「ループ型トランスフォーマー(Recurrent Depth)」または「回帰的深度」**の概念を使用している可能性があります。これは推論過程を遮断する機構であり、従来の固定深さのモデルとは異なります。
基本構造の仕組み
- 定義: 同じトランスフォーマーブロックのスタックを、入力を一度に通すのではなく、複数の回通します。
- 特徴: ブロックを通る際、その重みは変更されず共有されます(「トリック」として機能)。
- 目的: 新しいパラメータを追加せずに、有効な計算深さ(Effective Depth)を高めること。
代表例:Nanbeige4.2-3B
- 同じ 22 トランスフォーマーブロックのスタックを2 回適用します(計 44 ブロック分の計算)。
- メリット: パラメータ数を削減しつつ、深い層を持つモデルと同様の性能を出せます。
- 例:44 ブロック分使う場合、Nanbeige は同じ重みを再利用するためメモリ負荷を減らしつつパラメータ数を削減できます。
適用ループ数の決定方法
- Universal Transformer (2018): 「適応的停止(Adaptive Halting)」を採用。モデル内で学習された確率に基づき、各トークンごとにループ回数を動的に調整します。
- Mixture-of-Recursions (2025):
- 小さな学習された「ルーティング関数」を使い、各トークンがどの程度の計算(何回のループ)を受けるか決定します。
- 「People」という単語の出現位置や前後文脈によって、処理に必要な計算量を柔軟に割り当てます。
RNN(リカレントニューラルネットワーク)との違い
- RNN: 重みを時間ステップ全体で再利用し、隠れ状態を次のトークンへ引き継ぐ。
- ループ型トランスフォーマー: トークンの間には注意機構(Attention)があり、アーキテクチャ全体の深さ方向にループを行います。単なる RNN の延長ではなく、大規模な Transformer で重みを共有して深さを増幅する技術です。
4. 推論痕跡(Chain of Thought)の隠蔽について
「Astra は思考過程を隠している」という噂に対し、以下の点が重要です。
隠蔽されるのは本当か?
- 事実: OpenAI は GPT-5.6 および o1 からユーザーに対して推論痕跡の大半を非表示にしています。
- ループ型アーキテクチャの影響:
- モデル内部では追加的な計算(ループ)が行われますが、これが外部への思考トークンを減らすわけではありません。
- むしろ、固定精度において GPT-6 Astra は GPT-5.6 Sol よりも少ないトークン数で同じタスクを解決しており、これは「より賢くミスが減った」ということと同義です。
- 解釈可能性への懸念:
- 短い推論痕跡が「偽の思考」や「欺き」に繋がっているという確かな証拠はありません。
- 短い痕跡は、モデルが内部計算を効率的に行っている証拠であり、単なる欠陥ではありません。
Jakub Pachocki(OpenAI チーフサイエンティスト)の見解
「混乱した報道によって引き起こされた非可視性への競争を防ぎたい。私達の現在の最先端モデル、Astra を含むものの計算グラフの深度は GPT-4 の 2 倍以内である。OpenAI は最初の推論モデル以来、連鎖思考(Chain-of-Thought)の監視を維持および利用することに努めてきた。」
- 結論: アーキテクチャの変化(ループ型トランスフォーマー)によるものではなく、トレーニング分布や整合性に関する一般的な課題として Chain of Thought を管理し続けています。
- 研究の方向性: 推論過程の可視化や強化は今後の研究プログラムの核心的な目標です。
その他の関連研究の知見
- Latent Reasoning (Geiping et al.): トレーニング中にループ数を可変にし、推論時に計算リソース(8, 32, 64 ループなど)を固定予算で制御できます。
- 結果:HellaSwag などのタスクでは約 8 ループで性能が頭打ちになりますが、数学問題(GSM8K)などではさらに多くの計算から恩恵を受けます。
- 情報の保存 vs 推論: ループは「知識の記憶」とは無関係であり、追加的な計算を伴う「推論能力」そのものを向上させます。
- SMELT (2026): Mixture-of-Experts と組み合わせることで、従来のトランスフォーマーより少ない計算量(約 6.8-18%)で同等の損失に達できることを実証しました。
- Full-bandwidth Transformer (2026): 入力トークンの最終状態をフィードバックすることで、推論痕跡を短縮できますが、これはインストラクションチューニング後のモデルでは効果が薄れる可能性があります。
まとめ
GPT-6 Astra は以下の点で画期的です。
- 性能: 数学、コーディング、特に**コンピューター使用(GUI 操作)**において圧倒的な進化を示しています。
- アーキテクチャ: ループ型トランスフォーマーを採用している可能性が高く、固定計算予算内でより高品質なモデルを生成する技術革新です。
- 推論の効率化: 短い推論痕跡は「賢さ」の表れであり、内部計算が増えた結果の副作用と捉えるのが妥当です。
今後の展望: コンピューター使用能力は、今後数ヶ月〜数年でオープンソースおよびプロプライエタリなハネスにおける主要な焦点領域になるでしょう。特にローカル環境での安全性確認(Harness の検査)が重要になります。
もし推論モデルの構築や AI 分野への深い理解をお求めであれば、著者の書籍『Build a Reasoning Model From Scratch』をご参照ください。事前学習済み LLM から始めて、コードを実行して実験できるステップバイステップの内容となっています。