『ペルソナ』5対GPT-5.6:NP困難問題におけるSolへのアプローチ:/goalが役立つか?

2026/07/18 20:00

『ペルソナ』5対GPT-5.6:NP困難問題におけるSolへのアプローチ:/goalが役立つか?

RSS: https://news.ycombinator.com/rss

要約

Japanese Translation:

NP 難な未公開のファイバ・ネットワーク設計問題(KIRO)に対する厳格なベンチマーク——元々は 2018 年の工学部学生プロジェクトとして、532 のノードと 11 のハブを連結するための構造的制約付きソリューションを開発したものであり——は、Claude Fable 5 が常に GPT-5.6 Sol より優れているとは必ずしも示さないことを示している。KIRO の目標はループおよび短いチェーンを使用して総ケーブル長を最小化することである。

主な発見事項:

  • Fable 5 は前例のない一貫性を持ち、全体として最良のソリューションを生み出しており、通常モードでは 319 ポイントの結果範囲内に留まった一方で、GPT-5.6 Sol の通常モードは 1,958 ポイントにわたっていた。
  • /goal
    モードは個別の実験 6 つ中 4 つで勝利したが、両モデルの平均ケーブル長をそれぞれ Fable 5 で +759、GPT-5.6 Sol で +868 増加させた。
  • よりも良いクリーンスコア:Fable 5 は目標モードで 31,934 を達成し、GPT-5.6 Sol は通常モードで 33,581 を達成した。
  • /goal
    モードは一般的な「より努力する」スイッチではなく、制御ループおよび検索パスを変化させる。それはより良い盆地を見出すのを助けることができるが、また悪い設計案に成熟する時間を増やすこともあり、結果としてケーブル長が長く become る可能性がある。最適化問題において、
    /goal
    モードはエージェントが高速コンパイルされたポートフォリオを維持するか、または包括的なアンカースキャンにコミットするかに応じて、良いか悪いかの決断を増幅させる。
  • 実装の詳細:Claude Code においては、
    /goal
    はセッションスコープを持ち、ファイルアクセスまたはツールの使用なしでトランスクリプトを読む独立した Haiku エバлюエータが使用される;Codex CLI v0.144.4 においては、目標は SQLite に格納されたスレッドステートとして永続化され、目標が依然としてアクティブなまま完了宣言が可能になる。
  • ベンチマーク環境に関する注記:メタデータが 1 つと宣言していたにもかかわらず、8 つの CPU が露出しており、これは Fable の並列ポートフォリオに有利に働いた;全てのスコアリング出力はラッパー要件により有効であった。
  • 完全なコード、プロンプト、結果テーブル、分析スクリプト、図生成器、および証拠メモは、CLIArena のベンチマークタスク、ラッパー、分析スクリプト、図生成器、および完全な証拠メモの下で利用可能である。

結論:この特定のクラスの困難な最適化問題に対して、Fable 5 の通常モードは一貫性とソリューション品質のより信頼可能なバランスを提供する。これらのモデルを評価している企業は、

/goal
を慎重に取り扱うべきであり、標準モードでのより高い一貫性は、困難な問題における攻撃的な設定よりも依存できるソリューションをもたらすことが多いと認識すべきである。

本文

クロード Fable 5 と GPT-5.6 Sol の性能比較:NP ハードな最適化問題「KIRO」における
/goal
モードの実証

概要

未発表(unpublished)の NP ハードな最適化問題KIROにおいて、Claude Fable 5 と GPT-5.6 Sol の両モデルをベンチマークしました。ネイティブ

/goal
モードの有無を比較した結果、以下の事実が明らかになりました。

  • Fable 5 は圧倒的な性能を発揮しました。
  • 一方、
    /goal
    モードの導入は劇的な向上をもたらすものではありませんでした
    。むしろ平均パフォーマンスにおいては劣化が見られました。

詳細なコード、プロンプト、結果テーブルは CLIArena で公開されています。

問題背景:KIRO(ファイバネットワーク設計)

2018 年に行われた工学部の学生向け課題です。グレンノーブル、ニース、パリの 3 つの都市間の距離行列を与えられ、以下の制約で配分ハブと端末を最適化する問題です。

  • 目的関数: ケーブルの総長を最小化(値が小さいほど良い)。
  • 構造制約:
    • 冗余地あるループ: 配分ハブを中心とした構造であり、その上に短いブランチ(分岐)がぶら下がっている。
    • 各タワーの出現: タワーは恰好一度現れる必要がある。
    • ケーブル区間: 反転するとコストに変化が生じる。

探索空間の規模

この問題は単一の計算式で表すほど単純ではなく、解法にはループ数、サイズ、アンカー位置などが複雑に絡み合っています。しかし、$10^{1223}$ という膨大な数の可能性を含むことが確認できました。

  • 割り当てるパターンの下界:
    • 532 ターミナルを 11 配分ハブの一つに割り当てるとした場合:$11^{532}$ パターン。
  • より強い下界(意図的に制限されたケース):
    • ブランチなしで、各ループ 28 ターミナル×19 ループの構造。
    • 計算式: $\frac{532!}{19!} \times 11^{19}$
    • 結果: $\approx 10^{1223}$

ベンチマーク実験設計

探索空間を意図的に狭く設定し、主要なモデルとの対照実験を行いました。

使用モデルと環境

カテゴリ詳細
モデルFable: Fable 5, Opus 4.8, Sonnet 5
Sol: GPT-5.6 Sol, Terra, Luna
モードプレーン(標準); ネイティブ
/goal
モード
最適化予算30 分
外層エージェントタイムアウト1,900 秒
推論設定各モデルで利用可能な最大設定
実行環境Harbor 0.1.43, Docker, サブスクリプション認証

実験手順

  1. 対照実験: ヒントなしで、すべてのモデルに対して「ペア 1」の試験を 30 分間実施。
  2. 旗艦ペア比較: Fable 5 と GPT-5.6 Sol について、それぞれ 3 つの対照実験(マッチド・ラン)を繰り返し実施。

実験結果分析

1. 個別の実行結果(スコア:小さいほど良い)

負の値は

/goal
モードの方が優れていたことを示します。

  • Fable 5 Run 1: プレーン:
    32,197
    | Goal:
    31,934
    (差: -263) ✅
  • Fable 5 Run 2: プレーン:
    32,516
    | Goal:
    32,324
    (差: -192) ✅
  • Fable 5 Run 3: プレーン:
    32,446
    | Goal:
    35,178
    (差: +2,732) ❌
  • GPT-5.6 Sol Run 1: プレーン:
    33,581
    | Goal:
    39,371
    (差: +5,790) ❌
  • GPT-5.6 Sol Run 2: プレーン:
    35,539
    | Goal:
    32,703
    (差: -2,836) ✅
  • GPT-5.6 Sol Run 3: プレーン:
    33,663
    | Goal:
    33,313
    (差: -350) ✅

2. 平均パフォーマンスとリスクの偏り

「Goal が 6 回の試行のうち 4 回勝った」という表面の結果に注意が必要です。

  • Fable 5 の平均効果:
    • プレーン平均:
      32,386
      | Goal 平均:
      33,145
      (差: +759 の劣化)
    • 中央値効果: -192(改善)
  • GPT-5.6 Sol の平均効果:
    • プレーン平均:
      34,261
      | Goal 平均:
      35,129
      (差: +868 の劣化)
    • 中央値効果: -350(改善)

結論: 両モデルとも通常は小幅のメリットを得て、稀に大きな性能低下を被ることがありました。これが

/goal
が試行数では優位ながら、平均パフォーマンスが悪化する理由です。Fable プレーンの方が最も安全で安定した構成でした。

モデル間比較(Fable の優位性)

  • Fable 5 の強さ: プレーン平均が Sol よりも 1,875 ポイント高。Goal モード時でも 1,984 ポイント高な差を維持。
  • 安定性: Fable プレーンはわずか 319 ポイントの狭い範囲に留まったのに対し、Sol プレーンは 1,958 ポイントものばらつきを示しました。

/goal
コマンドの仕組みと限界

実装の違い:Claude Code vs Codex

同じコマンド名でも、背後にあるシステムは根本的に異なります。

Claude Code(独立した評価者)

  • 仕組み: セッションスコープの Stop フックとして実装。メインモデルのターン後、小さな評価モデル(デフォルト Haiku)が条件と履歴を判定し「Yes/No」を返す。
  • 制限: 評価モデルはツールやファイル検索が使えず、トランスクリプト(会話履歴)のみを見て判断。
  • 問題点: 早期終了を検知できるが、1,000 万回の求解器反復を追加して得られる価値を測ることができない。

Codex(永続化された状態とライフサイクルツール)

  • 仕組み: ゴールをアクティブスレッドの状態として永続化 (
    create_goal
    ,
    get_goal
    ,
    update_goal
    ツール使用)。
  • 特徴: スレッドがアイドルでも目的付きで継続ターンを生成し、永続ゴールのまま実行可能。
  • 違い: Claude は判定を別モデルに委譲するが、Codex はワーキングモデル自身に完了宣言させ、自身の作業を評定している点。

なぜデフォルトでは劣化するか?

通常のコーディングタスクとは異なり、最適化問題では**「追加の時間は良い判断も悪い判断も増幅」**させます。

  • 助けになる場合: 高速コンパイルポートフォリオ(Fable)や成功したチェーン再分配(Sol)を維持できた時。
  • 害を及ぼす場合: 遅い求解器を作ったり(Fable)、網羅的アンカースキャンに固執したりした場合(Sol)。

核心: ループ自体の質よりも、そのループが「何を維持し続けて実行するかの質」が重要なのです。

実験の限界と注意点

  • 非公開ベンチマーク: 一般的なコーディングリーダーボードではなく、unpublished の NP ハードタスクです。
  • 比較対象の制限: Fable と Sol のみが 3 つのクリーンな対照ペアを持っています。他のモデルはプロンプトやバージョンが混在しており、ドリフト可能性があります。
  • リソース偏り: コンテナは宣言通りとは別に 8 CPU を公開しており、Fable の並列ポートフォリオを有利にしました。
  • 評価基準: スコアリングされた出力はすべて有効です。これはラッパーが早期チェックポイントと最終検証を要求していたためです。

再現性

完全な証拠メモや分析スクリプトは CLIArena に公開されています。

主なコマンド

RUN_ID=article-kiro-YYYYMMDD-clean \
PHASE=nohint-all \
./scripts/run_subscription_article_matrix.sh

uv run python scripts/summarize_subscription_article_results.py RUN_ID...
uv run python scripts/analyze_subscription_article_results.py RUN_ID...

結論

  • Fable 5 は、複雑な最適化問題において人間を超える一貫性と性能を示しました。
  • /goal
    モード
    は万能スイッチではなく、制御ループや探索経路を変化させるものであり、必ずしも良い結果につながるわけではありません。
  • NP ハード問題においては、試行数での勝利が平均パフォーマンスの改善につながらないケースが存在することが実証されました。

同じ日のほかのニュース

一覧に戻る →

2026/07/15 4:25

500kb以下のサイズで実装可能な音声認識とTTS

## Japanese Translation: 最も重要な教訓は、Moonshine Micro が極めて低コストのハードウェア、具体的には 80 セントの Raspberry Pi RP2350 マイコン上で高度な音声機能を実現することを通じて、先進的な AI を民主化することにあります。このオープンソース・ツールキットは、音声認識やニューラルテキスト読み上げといった洗練されたタスクが最小限のリソースで効率的に動作することを証明しており、SRAM は約 470 KB(468 KiB)、フラッシュメモリは約 3.6 MiB を使用し、全体としての分類から発声までのエンドツーエンドのサイクルを約 0.7〜1.0 セコンドという迅速な速度で達成しています。TensorFlow Lite Micro ライブラリを活用することで、システムは VAD(音声活動検出)、STT(音声認識)、カスタム単語認識、ニューラルテキスト読み上げ、ネットワーク対応エージェント向けの WiFi 設定といった主要機能をサポートしながら、計算要件をコンポーネントごとに分解しており、それぞれ VAD で約 0.8 MMAC/frame、STT で約 36 MMAC/s、TTS で最大 65 MMAC/s の性能を発揮します。すべてのコアコードとモデル(SpellingCNN および TinyVadCNN を含む)は、制限的な知的財産の障壁なく商用展開を可能にする寛容な MIT ライセンスの下で公開されています。現在の実施可能な機能を超えて、このプラットフォームは IoT プロジェクトへの参入障rier を大幅に低下させる標準化されたベンチマーク点として機能し、安価かつオープンソースの AI ソリューションの業界全体での採用を促進します。

2026/07/19 6:45

ハードコア・インディーウェブ:1 日わずか 0.01 ドルで、あなたのサイトを 100% 独立して運用する方法

## Japanese Translation: この記事は、複雑なサードパーティ製のデータベースやフレームワークを拒否し、個人ウェブコンテンツの完全な所有権を取り戻すことを目的とした「ハードコア・インディエブ」運動を称賛する。高額でサブスクリプション型のプラットフォームに依存し、ユーザーを引き留めるのではなく、データをローカルに保存し、単純なプレーン HTML ファイルを公開することで、真の自律性を確立する。核心的なメッセージは、単なる 3 つの基本ツールのみで真の自立が可能であるという点にある:投稿を書くためのテキストエディタ、アップロードするためのファイル転送ユーティリティ、そして月額わずか 0.25 ドルから利用可能な按分課金の安価なウェブホスティングである。 この方法論は、著者がサイト構造を手動で管理し、不透明なシステムに支配を委ねることなく、1990 年代のウェブ公開の簡素さを意図的に模倣している。各投稿に対して個別の HTML ファイルを使用し、フィードも手動で扱うことで、ユーザーは各エントリの独自のスタイルをカスタマイズしながら、完全な自律性を維持することができる。最も大きな利点はポータビリティであり、ホスティングプロバイダーが消滅した場合でも、所有者はそのサイトをデータ損失や移行手数料なしに瞬時に他場所へ移動できる。本文は、このデジタル自律性への回帰を実施するに関する支援とさらにの議論のために、オミグ・ドット・ロール (omg.lol) のコミュニティに参加することを愛好家たちに呼びかけて締めくくる。

2026/07/18 22:00

GPT-5.6 はプロンプトを用いて、凸最適化分野における30年間の空白を解消した

## Japanese Translation: GPT 5.6 Sol Pro は、凸最適化における画期的な定理を正式に証明し、特定の精度レベルにおける次元依存性に対する必要な二次の下界を示すことで、30年にわたる空白を解決した。この画期的な成果は、以前の方法が示していた上界と理論的に達成可能なものとの間に存在した長年の乖離を閉じるものであり、OpenAI の CDC プロンプティング手法を適用し、新しい数学的手法を導入するのではなく、既存の凸幾何学の理論的手法を成功裏に活用している。1996 年以来、Protasov アルゴリズムは上界として O(d²) の評価数を確立したが、下界は線形の Ω(d) で留まっていた。GPT 5.6 は、d⁻³ の精度達成には確かに O(d²) の評価数が必要であることを示し(当初はより厳密な d⁻⁴ の要件のために構成された)、これによりこれらの境界を同じ位数に揃えた。この結果は、応用数学博士号を保有する UC Berkeley 教授による著者の手により Lean で正式に検証されたものであり、それ以前のもっともーデル(GPT-5.4 および GPT-5.5)を用いた一連の試みでは成功しなかったため、1 年にわたる努力の結果である。この成果は、現代の AI が既存の枠組みを使用して複雑な理論的問題を解決する能力を確認するものである。本結果はいまだピアレビューを経ておらず、著者によって GitHub/ArXiv にホストされているため、形式的な検証が直ちに次のステップとなる。したがって、この分野は、現在の漸進的な技術で達成可能な問題から離れ、新たなアプローチを必要とする深い構造的課題へと焦点をシフトする可能性がある。

『ペルソナ』5対GPT-5.6:NP困難問題におけるSolへのアプローチ:/goalが役立つか? | そっか~ニュース