
2026/07/18 20:00
『ペルソナ』5対GPT-5.6:NP困難問題におけるSolへのアプローチ:/goalが役立つか?
RSS: https://news.ycombinator.com/rss
要約▶
Japanese Translation:
NP 難な未公開のファイバ・ネットワーク設計問題(KIRO)に対する厳格なベンチマーク——元々は 2018 年の工学部学生プロジェクトとして、532 のノードと 11 のハブを連結するための構造的制約付きソリューションを開発したものであり——は、Claude Fable 5 が常に GPT-5.6 Sol より優れているとは必ずしも示さないことを示している。KIRO の目標はループおよび短いチェーンを使用して総ケーブル長を最小化することである。
主な発見事項:
- Fable 5 は前例のない一貫性を持ち、全体として最良のソリューションを生み出しており、通常モードでは 319 ポイントの結果範囲内に留まった一方で、GPT-5.6 Sol の通常モードは 1,958 ポイントにわたっていた。
モードは個別の実験 6 つ中 4 つで勝利したが、両モデルの平均ケーブル長をそれぞれ Fable 5 で +759、GPT-5.6 Sol で +868 増加させた。/goal- よりも良いクリーンスコア:Fable 5 は目標モードで 31,934 を達成し、GPT-5.6 Sol は通常モードで 33,581 を達成した。
モードは一般的な「より努力する」スイッチではなく、制御ループおよび検索パスを変化させる。それはより良い盆地を見出すのを助けることができるが、また悪い設計案に成熟する時間を増やすこともあり、結果としてケーブル長が長く become る可能性がある。最適化問題において、/goal
モードはエージェントが高速コンパイルされたポートフォリオを維持するか、または包括的なアンカースキャンにコミットするかに応じて、良いか悪いかの決断を増幅させる。/goal- 実装の詳細:Claude Code においては、
はセッションスコープを持ち、ファイルアクセスまたはツールの使用なしでトランスクリプトを読む独立した Haiku エバлюエータが使用される;Codex CLI v0.144.4 においては、目標は SQLite に格納されたスレッドステートとして永続化され、目標が依然としてアクティブなまま完了宣言が可能になる。/goal - ベンチマーク環境に関する注記:メタデータが 1 つと宣言していたにもかかわらず、8 つの CPU が露出しており、これは Fable の並列ポートフォリオに有利に働いた;全てのスコアリング出力はラッパー要件により有効であった。
- 完全なコード、プロンプト、結果テーブル、分析スクリプト、図生成器、および証拠メモは、CLIArena のベンチマークタスク、ラッパー、分析スクリプト、図生成器、および完全な証拠メモの下で利用可能である。
結論:この特定のクラスの困難な最適化問題に対して、Fable 5 の通常モードは一貫性とソリューション品質のより信頼可能なバランスを提供する。これらのモデルを評価している企業は、
/goal を慎重に取り扱うべきであり、標準モードでのより高い一貫性は、困難な問題における攻撃的な設定よりも依存できるソリューションをもたらすことが多いと認識すべきである。本文
クロード Fable 5 と GPT-5.6 Sol の性能比較:NP ハードな最適化問題「KIRO」における /goal
モードの実証
/goal概要
未発表(unpublished)の NP ハードな最適化問題KIROにおいて、Claude Fable 5 と GPT-5.6 Sol の両モデルをベンチマークしました。ネイティブ
/goal モードの有無を比較した結果、以下の事実が明らかになりました。
- Fable 5 は圧倒的な性能を発揮しました。
- 一方、
モードの導入は劇的な向上をもたらすものではありませんでした。むしろ平均パフォーマンスにおいては劣化が見られました。/goal
詳細なコード、プロンプト、結果テーブルは CLIArena で公開されています。
問題背景:KIRO(ファイバネットワーク設計)
2018 年に行われた工学部の学生向け課題です。グレンノーブル、ニース、パリの 3 つの都市間の距離行列を与えられ、以下の制約で配分ハブと端末を最適化する問題です。
- 目的関数: ケーブルの総長を最小化(値が小さいほど良い)。
- 構造制約:
- 冗余地あるループ: 配分ハブを中心とした構造であり、その上に短いブランチ(分岐)がぶら下がっている。
- 各タワーの出現: タワーは恰好一度現れる必要がある。
- ケーブル区間: 反転するとコストに変化が生じる。
探索空間の規模
この問題は単一の計算式で表すほど単純ではなく、解法にはループ数、サイズ、アンカー位置などが複雑に絡み合っています。しかし、$10^{1223}$ という膨大な数の可能性を含むことが確認できました。
- 割り当てるパターンの下界:
- 532 ターミナルを 11 配分ハブの一つに割り当てるとした場合:$11^{532}$ パターン。
- より強い下界(意図的に制限されたケース):
- ブランチなしで、各ループ 28 ターミナル×19 ループの構造。
- 計算式: $\frac{532!}{19!} \times 11^{19}$
- 結果: $\approx 10^{1223}$
ベンチマーク実験設計
探索空間を意図的に狭く設定し、主要なモデルとの対照実験を行いました。
使用モデルと環境
| カテゴリ | 詳細 |
|---|---|
| モデル | Fable: Fable 5, Opus 4.8, Sonnet 5 Sol: GPT-5.6 Sol, Terra, Luna |
| モード | プレーン(標準); ネイティブ モード |
| 最適化予算 | 30 分 |
| 外層エージェントタイムアウト | 1,900 秒 |
| 推論設定 | 各モデルで利用可能な最大設定 |
| 実行環境 | Harbor 0.1.43, Docker, サブスクリプション認証 |
実験手順
- 対照実験: ヒントなしで、すべてのモデルに対して「ペア 1」の試験を 30 分間実施。
- 旗艦ペア比較: Fable 5 と GPT-5.6 Sol について、それぞれ 3 つの対照実験(マッチド・ラン)を繰り返し実施。
実験結果分析
1. 個別の実行結果(スコア:小さいほど良い)
負の値は
/goal モードの方が優れていたことを示します。
- Fable 5 Run 1: プレーン:
| Goal:32,197
(差: -263) ✅31,934 - Fable 5 Run 2: プレーン:
| Goal:32,516
(差: -192) ✅32,324 - Fable 5 Run 3: プレーン:
| Goal:32,446
(差: +2,732) ❌35,178 - GPT-5.6 Sol Run 1: プレーン:
| Goal:33,581
(差: +5,790) ❌39,371 - GPT-5.6 Sol Run 2: プレーン:
| Goal:35,539
(差: -2,836) ✅32,703 - GPT-5.6 Sol Run 3: プレーン:
| Goal:33,663
(差: -350) ✅33,313
2. 平均パフォーマンスとリスクの偏り
「Goal が 6 回の試行のうち 4 回勝った」という表面の結果に注意が必要です。
- Fable 5 の平均効果:
- プレーン平均:
| Goal 平均:32,386
(差: +759 の劣化)33,145 - 中央値効果: -192(改善)
- プレーン平均:
- GPT-5.6 Sol の平均効果:
- プレーン平均:
| Goal 平均:34,261
(差: +868 の劣化)35,129 - 中央値効果: -350(改善)
- プレーン平均:
結論: 両モデルとも通常は小幅のメリットを得て、稀に大きな性能低下を被ることがありました。これが
/goal が試行数では優位ながら、平均パフォーマンスが悪化する理由です。Fable プレーンの方が最も安全で安定した構成でした。
モデル間比較(Fable の優位性)
- Fable 5 の強さ: プレーン平均が Sol よりも 1,875 ポイント高。Goal モード時でも 1,984 ポイント高な差を維持。
- 安定性: Fable プレーンはわずか 319 ポイントの狭い範囲に留まったのに対し、Sol プレーンは 1,958 ポイントものばらつきを示しました。
/goal
コマンドの仕組みと限界
/goal実装の違い:Claude Code vs Codex
同じコマンド名でも、背後にあるシステムは根本的に異なります。
Claude Code(独立した評価者)
- 仕組み: セッションスコープの Stop フックとして実装。メインモデルのターン後、小さな評価モデル(デフォルト Haiku)が条件と履歴を判定し「Yes/No」を返す。
- 制限: 評価モデルはツールやファイル検索が使えず、トランスクリプト(会話履歴)のみを見て判断。
- 問題点: 早期終了を検知できるが、1,000 万回の求解器反復を追加して得られる価値を測ることができない。
Codex(永続化された状態とライフサイクルツール)
- 仕組み: ゴールをアクティブスレッドの状態として永続化 (
,create_goal
,get_goal
ツール使用)。update_goal - 特徴: スレッドがアイドルでも目的付きで継続ターンを生成し、永続ゴールのまま実行可能。
- 違い: Claude は判定を別モデルに委譲するが、Codex はワーキングモデル自身に完了宣言させ、自身の作業を評定している点。
なぜデフォルトでは劣化するか?
通常のコーディングタスクとは異なり、最適化問題では**「追加の時間は良い判断も悪い判断も増幅」**させます。
- 助けになる場合: 高速コンパイルポートフォリオ(Fable)や成功したチェーン再分配(Sol)を維持できた時。
- 害を及ぼす場合: 遅い求解器を作ったり(Fable)、網羅的アンカースキャンに固執したりした場合(Sol)。
核心: ループ自体の質よりも、そのループが「何を維持し続けて実行するかの質」が重要なのです。
実験の限界と注意点
- 非公開ベンチマーク: 一般的なコーディングリーダーボードではなく、unpublished の NP ハードタスクです。
- 比較対象の制限: Fable と Sol のみが 3 つのクリーンな対照ペアを持っています。他のモデルはプロンプトやバージョンが混在しており、ドリフト可能性があります。
- リソース偏り: コンテナは宣言通りとは別に 8 CPU を公開しており、Fable の並列ポートフォリオを有利にしました。
- 評価基準: スコアリングされた出力はすべて有効です。これはラッパーが早期チェックポイントと最終検証を要求していたためです。
再現性
完全な証拠メモや分析スクリプトは CLIArena に公開されています。
主なコマンド
RUN_ID=article-kiro-YYYYMMDD-clean \ PHASE=nohint-all \ ./scripts/run_subscription_article_matrix.sh uv run python scripts/summarize_subscription_article_results.py RUN_ID... uv run python scripts/analyze_subscription_article_results.py RUN_ID...
結論
- Fable 5 は、複雑な最適化問題において人間を超える一貫性と性能を示しました。
モードは万能スイッチではなく、制御ループや探索経路を変化させるものであり、必ずしも良い結果につながるわけではありません。/goal- NP ハード問題においては、試行数での勝利が平均パフォーマンスの改善につながらないケースが存在することが実証されました。