
2026/08/04 15:17
自己成長のためのハネスエンジニアリング
RSS: https://news.ycombinator.com/rss
要約▶
Japanese Translation:
人工知能分野は、リカursive自己改善(RSI)——この概念は I.J. グッドおよび Yudkowsky にさかのぼる——において決定的な転換点にあり、焦点は生粋の知能从事から、それを管理するシステムの工学へと移っています。Anthropic や OpenAI などのフロントヤードラボによる実証実験が進むこの実用的な進化は、「ハーネス工学」として知られるものであり、モデルの知能と並んでデプロイシステム(評価、オーケストレーション、ツール)が極めて重要になります。開発者は静的コードから離れ、文脈エンジニアリングやメタ・ハーネスアプローチなどによる動的環境へと移行しています:文脈エンジニアリングは文脈を専門エージェントにより管理される進化するプレイブックとして扱い、メタ・ハーネスアプローチではハーネスコード自体を最適化のための探索空間とみなします。AFlow のような Monte Carlo Tree Search(MCTS)を用いた自動設計手法や、厳密な可観測性の支柱を採用した propose-evaluate ループを実装する Agentic Harness Engineering(AHE)のようなフレームワークは、コア機能の再設計なくしてシステムが作業フローを反復的に洗練させることを可能にします。これらの進歩により、報酬ハッキングといった落とし穴を防ぎつつ、進化的探索とメタ最適化を通じて戦略を進化させながら複雑な数学問題やソフトウェア問題を安全に解決できる堅牢なエージェントシステムが実現されます。
本文
ハネスエンジニアリングと自己改善(Harness Engineering for Self-Improvement)
はじめに
- 反復的 자기 改良(Recursive Self-Improvement, RSI) の概念は、I. J. グッド(1965)が定義した「超知的機械」の起源に遡ります。
- ユドロフスキー(2008) は、「RSI」という用語を特定のフィードバックループのために採用しました:すなわち、人工知能が現在の知性を活用して自らの認知メカニズムを向上させるプロセスです。
- 現代の AI における RSI のフィードバックループは、以下のいずれかによりモデルの後継版を作り上げることを指します。
- モデルの重み(weights)を直接的に書き換えること。
- トレーニングパイプラインやデプロイメントシステム自体を改良すること。
- AI 分野の研究開発速度は、Anthropic や OpenAI の最前線の研究所で劇的な加速を示しています。
「ハネス(Harness)」の重要性
- 定義: ハネスとは、ベースモデルを取り囲むシステムであり、生モデルと現実世界のコンテキストの間にある層です。モデル自身の生の知能に匹敵するほど重要です。
- 役割: 実行のオーケストレーション、思考・計画方法の決定、ツールの呼び出し、行動の実行、文脈の管理、アーティファクトの保存、結果の評価などを担当します。
- 例示: Claude Code や Codex のような成功したコーディングエージェントがハネスの重要性を証明しています。
本投稿の焦点
- ハネスエンジニアリングに関する研究とそれがRSI にどのように寄与するかについて焦点を当てます。
- 関連する他の研究(自動リサーチ、自己改良エージェント、進化的なプログラム検索など)は RSI のビジョンと一致しますが、本稿の主要な対象ではありません。
ハネス設計パターン
初期のエージェントフレームワーク(LLM + メモリ + ツール + 計画 + 行動)に加え、ハネスエンジニアリングには以下が追加されます:
- ワークフロー設計(例:ループエンジニアリング)
- 評価と権限制御
- 永続的な状態管理
これらは単なるプロンプトテンプレートではなく、実行時のソフトウェアシステム設計に近く、モデルがどのように観測し、行動し、記憶し、自らをチェックして改善するかを定義します。
設計原則
- 意図的に簡潔かつ汎用的: 一般化を可能にする必要があります。
- 既存の知識への依存: 既存のソフトウェアエンジニアリングの実践(事前学習知識)からの恩恵を受けることが期待されます。
- OS に似た役割: OS のように、複雑なロジックをカプセル化しつつ、インターフェースをシンプルに保つべきです。
- 標準化の趋势: 設定ファイルやツールインターフェースは業界全体で徐々に標準化されていく可能性があります。
パターン 1: ワークフロー自動化
- 目標: モデルが動作し、テストし、反復できるワークフローを定義することです。
- 例: Karpathy の
リポジトリ。autoresearch - 一般的なサイクル: 計画 → 実行 → 観測・テスト → 改善 → 再度実行(ゴール達成まで)。
- 必要に応じて、ユーザーにタスク仕様や優先度について能動的なリクエストを行います。
- 分析: ワークフローグラフは静的なテンプレートではなく、「エージェントランタイム」を通じて自身の軌跡や失敗を分析し、進歩を繰り返します。
パターン 2: ファイルシステムを永続的メモリとして
- 理由: 長期的視野のエージェントシステムでは、コンテキストウィンドウよりも長いアーティファクト(実験ログ、コード差分、論文要約など)が発生します。
- 実装: ハネスはコンテキストにすべてのログを保持するのではなく、ファイルを介した堅牢な状態を維持する必要があります。
- スキル習得: ファイルシステムを読み書き・編集する方法(一般的には
コマンドを通じて)は LLM にとって基礎的であり、永続的メモリ管理はコア能力から自然に恩恵を受けます。bash
パターン 3: サブエージェントとバックエンドジョブ
- 機能: ハネスは複数のサブエージェントを生成して並列実行し、バックエンドジョブを監視できます。
- 用途: メインエージェントが仮説を検索したり、実験を実行したり、メインコンテキストを汚染せずに孤立したタスクに委任する際に有用です。
- 親エージェントの役割: プロセスマネージャーとして、ジョブの起動、ログ検査、失敗実行のキャンセル、結果の統合を担当します。
- 並行性の重要性: 出力を一時的なチャットコンテキストに留めると陳腐化しますが、ファイルやログとして保存することで、モデルは中断から回復し実行履歴を再考できます。
ケーススタディ:コーディングエージェントハネス
主流のコーディングエージェント(Claude Code, Codex, OpenCode, Cursor など)において安定しているコアインターフェースは、以下のループを使用します。
- ツールのセットへのアクセス: リポジトリ内で開発・デバッグを行い、人間が IDE を使うのと同様です。
ツール定義の一覧
| グループ | 具体的なツール例 |
|---|---|
| ファイルシステム | 発見 (glob, grep), 読み取り (read), 修正 (write, edit, apply_patch) |
| シェル実行 | , コマンド実行 |
| IO / バージョン管理 | LSP, ツール (status, diff, commit など) |
| 外部コンテキスト | MCP ツール、スキル |
| ウェブ検索 | web_search, web_fetch, ブラウザツール |
| アーティファクト | ドキュメント/画像の読み取り・生成 (HTML, 画像) |
| バックエンドプロセス | CronCreate, CronDelete, CronList など |
| エージェント委任 | spawn_agent, resume_agent, wait_agent, close_agent, interrupt_agent など |
ハネス層対コア知能?
RSI の短期経路は、モデルが直接的に重みを書き換えることから始まる可能性は低いです。
- 短期的展望:
- ハネスエンジニアリングはメタ手法論(より良い答えを得るための機械を改善し、その答え自体を改善する)の方向に進化するでしょう。
- ハネスシステム自体が最適化対象となり、ヒューリスティックな規則が減り、より一般的なメカニズムを持つようになります。
- 長期的展望:
- 成熟したハネスは自動リサーチを可能にし、より賢いモデルはハネスの過剰設計を防ぎます。
- 最終的には多くの改善がコアモデル行動に内部化される可能性がありますが、外部コンテキストおよびツールとのインターフェースは存続します。
- プロンプトエンジニアリングでも同様のパターン(手動のトリックは減少し、目標・制約・評価の指定が必要)が見られます。
ハネス最適化のプロセス
指示プロンプト → 構造化コンテキスト → ワークフロー → ハネスコード → オプタイマーコード モデルが賢くなるにつれ、ターゲットと方法はより複雑で一般的になります。
コンテキストエンジニアリング (ACE & MCE)
長文脈の拡大により制御不能になるのを防ぐために、LLM に対して構造化された簡潔なコンテキストを構築する層が必要です。
Agentic Context Engineering (ACE; Zhang ら 2025)
- 進化しているプレイブックとして扱い、3 つの構成要素でコンテキストプレイブック(箇条書き形式)を維持します:
- ジェネレーター: タスク軌跡を生成。
- リフレクター: 成功/失敗からの洞察を精製。
- キュレーター: 構造化コンテキストを更新(フルプロンプトを書き換えるのではなく、構造化項目への追加)。
- 設計選択: キュレーターは重複除去を行い、決定論的ロジックを用いてマージします。
Meta Context Engineering (MCE; Ye ら 2026)
- メカニズム(コンテキストの管理方法)とアーティファクトコンテンツを分離し、メタ最適化レベルでスキル進化を実行します。
- **スキル $s$**は文脈関数 $c_s=(\rho_s,F_s)$ を定義:
- $\rho_s$: 静的構成要素(プロンプト、知識ベース)。
- $F_s$: 動的オペレーター(検索、選択、フィルタリング)。
- 階層二重最適化:
- 内側ループ: トレーニングデータ上で最適なコンテキスト $c_s^*$ を見つける。
- 外側ループ: 検証セットで最良のパフォーマンスを提供する最適スキル $s^*$ を見つける。
Meta-Harness (Lee ら 2026)
- 最適化対象を決定し、モデルに保存すべき情報や提示すべき情報をコードとして最適化します(「メタ」の意味)。
- ハネス進化の特性: 新しいハネスを作成する提案者自体がコーディングエージェントであり、出力はパレト frontier 上の候補コレクションです。
ワークフロー設計
ハネスエンジニアリングにおけるワークフロー設計を自動リサーチを用いて検索・最適化します。
- AI Scientist (Lu ら 2026): 研究アイデアから原稿記述、ピアレビューまでを自動化するパイプライン。
- ScientistOne: 検証可能性を重視し、あらゆる主張が証拠源に追跡可能(Chain-of-Evidence)。
- Autodata (Kulikov ら 2026): データサイエンティストとして機能し、「ちょうどよい」難易度のデータを合成します。
- チャレンジャーの提示 → 弱求解器・強求解器の実行 → 検証者による評価 → プロンプト更新のループ。
- Automated Design of Agentic Systems (ADAS; Hu ら 2025): エージェント設計自体を最適化問題として定式化。
- メタエージェントが新しいワークフローの設計をコードで提案・自己改善(CoT, self-refine を用いたフィードバックループ)。
- AFlow (Zhang ら 2025): ワークフローをグラフとして表現し、MCTS(モンテカルロ木探索)を用いて最適化。
自己改良ハネス (Self-Harness)
単なるワークフローやコンテキスト管理だけでなく、全体の設計空間を検索し、ハネスそのものをコードとしてプログラム・最適化します。
Self-Taught Optimizer (STOP; Zelikman ら 2023)
- 目標: 改善器 $I$ そのものを進化させること(直接ソリューション $s$ を改善するだけでなく)。
- メカニズム: メタユーティリティを通じて改善器のパフォーマンスを測定し、反復的に新しいバージョンを得ます。
- 遺伝的アルゴリズムやベイズ最適化などの戦略を発見しました。
- 課題: ベースモデルはメカニズムを改善する能力が必要であり、弱いモデルでは劣化する傾向があります。
Work Self-Harness (Zhang ら 2026)
LLM エージェントが
propose-evaluate-accept ループを通じて自身のハネスを改善します。
- 弱点鉱掘り: 検証者による失敗パターン(タイムアウト、欠落など)をクラスタリングし、根本原因を特定します。
- ハネス提案: 有界なハネス編集を提案します。候補は多様で、解決可能且つ狭い変更であるべきです。
- 提案検証: キャンディデート編集を検証(回帰テスト)し、新しいハネス $h_{t+1}$ を作成します。
Agentic Harness Engineering (AHE; Lin ら 2026)
- ハネス進化のボトルネックは**可視性(observability)**にあります。
- 3 つの可視性の柱:
- コンポーネント可視性: ファイルシステム内に表現を持ち、7 つのコンポーネント(プロンプト、ツール説明など)を個別に追跡可能。
- 経験可視性: 軌跡を分析し、タスク毎の失敗レポートを生成(トークン効率的)。
- 決定可視性: 各編集は予言とペア付けられ、ファイルレベルで反証可能。報酬ハッキングを防ぐ制御が施されています。
進化的検索 (Evolutionary Search)
自然選択に触発された最適化手法です。ハネス検索に適しています。
- Promptbreeder: プロンプト自体を突然変異を通じて進化させる。
- AlphaEvolve: コーディングエージェントで候補プログラムを凍結 LLM で評価し、時間的に良いソリューションを発見。
- メタプロンプトも共進化します。
- Darwin Gödel Machine (DGM; Zhang ら 2025): エージェント自身のハネスコードリポジトリを進化させます。
- 固定モデル下で機能し、SWE-bench Verified などでの大幅な向上を実現しました。
進化的検索の利点と限界
- 適応: 広範で奇妙な形状の検索空間や、勾配計算が難しいケースに適しています。
- 課題: 計算効性と効果は懸念事項であり、評価が遅く曖昧なドメインでは困難です。
モデル重みとの共同最適化
ハネス進化だけでなく、モデル自体の重み更新と組み合わせる完全な自己改善も可能になります。
- SIA (Hebbar ら 2026):
- メタエージェント(提案)、タスクエージェント(実行)、フィードバックエージェント(更新選択)の 3 つからなる最適化ループを構築。
- トレーニング安定性やグードハート効果などの課題が残っています。
- Continual Harness (Karten ら 2026):
- ハネス更新と低報酬軌跡上で強力な教師モデルからのラベル蒸留による共学習を実験。
将来の課題とボトルネック
研究が進歩していますが、以下のボトルネックが存在します。
- 弱いおよび曖昧な評価器:
- 研究味や新規性は測定が困難です。「p-hacking and eureka-ing」による虚偽の成功宣言のリスクがあります。
- コンテキストおよびメモリのライフサイクル:
- 自律性の向上に伴いメモリ増大しますが、人間のように生涯維持する知能のコア部分としての管理が必要です。
- ネガティブ結果への対応:
- LLM はデータの不均衡により成功偏りを示す傾向があり、失敗から学ぶ能力が不足しています。
- 多様性の崩壊:
- 既知の高報酬パターンへの収束を防ぐメカニズムが必要です(研究の進展には重要)。
- 報酬ハッキング:
- ベンチマークやテスト自体を過学習するリスクがあり、評価器および権限制御はループの外側に置く必要があります。
- 長期成功:
- 短期的なタスク完了ではなく、リポジトリの長期的健康や保守性を考慮する必要があります。
- 人間の役割:
- ループから完全に除去せず、正しい時期に正しい抽象化レベルで監視(タッチポイント)を提供すべきです。
引用情報
論文タイトル: Harness Engineering for Self-Improvement
著者: Lilian Weng
公開日: 2026 年 7 月
URL: https://lilianweng.github.io/posts/2026-07-04-harness/
BibTeX 引用例
@article{weng2026harness, title = {Harness Engineering for Self-Improvement}, author = {Weng, Lilian}, journal = {lilianweng.github.io}, year = {2026}, month = {July}, url = "https://lilianweng.github.io/posts/2026-07-04-harness/" }
付録:有用なベンチマーク一覧
| ベンチマーク | 概要 | 主な特徴 |
|---|---|---|
| PaperBench | 論文の再現性評価 (ICML 2024 スポットライト 20 件) | 8,316 の基準事項。最良モデルは ML 博士課程学生より劣る。 |
| CORE-Bench | 計算再現性の評価 | 90 の論文に基づく 270 のタスク。最良エージェントも困難なタスクでは精度不足。 |
| ScienceAgentBench | データ駆動科学発見の評価 | 数学・化学・生物学・地理学のピアレビュー済みデータからの 102 タスク。 |
| RE-Bench | 現実的な ML 研究環境での評価 (人類専門家対) | 7 つの課題的エンジニアリング環境。短期予算では AI が上回るが、長期予算では人間の方が優れる。 |
| MLE-bench | オフライン Kaggle コンペティション評価 | 75 のコンペ。Kaggle プUBLIC リーダーボードを基準に、16.9% のコンペでメダルレベル達成。 |
| KernelBench | GPU カーネル生成の評価 | 250 の PyTorch タスク。高速かつ正しいカーネルの生成能力を測る ( インデックス)。 |
参考文献
- Good, I. J. "Speculations Concerning the First Ultraintelligent Machine." Advances in Computers, 6:31–88, 1965.
- Yudkowsky, Eliezer. "Recursive Self-Improvement." LessWrong, 2008.
- Choi, et al. "Anchored Self-Play for Code Repair." ICML 2026.
- Zhao, et al. "Absolute Zero: Reinforced Self-play Reasoning with Zero Data." arXiv preprint arXiv:2505.03335, 2025.
- Yuan, et al. "Self-Rewarding Language Models." arXiv preprint arXiv:2401.10020, 2024.
- Chen, et al. "Self-Play Fine-Tuning Converts Weak Language Models to Strong Language Models." ICML 2024.
- Zhang, et al. "Agentic Context Engineering: Evolving Contexts for Self-Improving Language Models." ICLR 2026.
- Ye, et al. "Meta Context Engineering via Agentic Skill Evolution." arXiv preprint arXiv:2601.21557, 2026.
- Lee, et al. "Meta-Harness: End-to-End Optimization of Model Harnesses." arXiv preprint arXiv:2603.28052, 2026.
- Lu, et al. "Towards end-to-end automation of AI research." Nature, 651:914–919, 2026.
- Meng, et al. "ScientistOne: Towards Human-Level Autonomous Research via Chain-of-Evidence." arXiv preprint arXiv:2605.26340, 2026.
- Kulikov, et al. "Autodata: An agentic data scientist to create high quality synthetic data." arXiv preprint arXiv:2606.25996, 2026.
- Hu, Lu, and Clune. "Automated Design of Agentic Systems." ICLR 2025.
- Madaan, et al. "Self-Refine: Iterative Refinement with Self-Feedback." NeurIPS 2023.
- Zhang, et al. "AFlow: Automating Agentic Workflow Generation." ICLR 2025.
- Zelikman, et al. "Self-Taught Optimizer (STOP): Recursively Self-Improving Code Generation." COLM 2024.
- Zhang, et al. "Self-Harness: Harnesses That Improve Themselves." arXiv preprint arXiv:2606.09498, 2026.
- Fernando, et al. "Promptbreeder: Self-Referential Self-Improvement Via Prompt Evolution." arXiv preprint arXiv:2309.16797, 2023.
- Agrawal, A. et al. "GEPA: Reflective Prompt Evolution Can Outperform Reinforcement Learning." arXiv preprint arXiv:2507.19457, 2025.
- Novikov, et al. "AlphaEvolve: A coding agent for scientific and algorithmic discovery." arXiv preprint arXiv:2506.13131, 2025.
- Lange, Imajuku, and Cetin. "ShinkaEvolve: Towards Open-Ended And Sample-Efficient Program Evolution." arXiv preprint arXiv:2509.19349, 2025.
- Wang, et al. "ThetaEvolve: Test-time Learning on Open Problems." arXiv preprint arXiv:2511.23473, 2025.
- Zhang, et al. "Darwin Gödel Machine: Open-Ended Evolution of Self-Improving Agents." arXiv preprint arXiv:2505.22954, 2025.
- Zhang, et al. "Hyperagents." arXiv preprint arXiv:2603.19461, 2026.
- Yuksekgonul, et al. "Learning to Discover at Test Time." arXiv preprint arXiv:2601.16175, 2026.
- Riaz, et al. "Epistemic Uncertainty for Test-Time Discovery." arXiv preprint arXiv:2605.11328, 2026.
- Hebbar, et al. "SIA: Self Improving AI with Harness & Weight Updates." arXiv preprint arXiv:2605.27276, 2026.
- Trehan and Chopra. "Why LLMs Aren't Scientists Yet: Lessons from Four Autonomous Research Attempts." arXiv preprint arXiv:2601.03315, 2026.
- Bubeck, et al. "Early science acceleration experiments with GPT-5." arXiv preprint arXiv:2511.16072, 2025.
- Starace, et al. "PaperBench: Evaluating AI's Ability to Replicate AI Research." ICML 2025.
- Wijk, et al. "RE-Bench: Evaluating frontier AI R&D capabilities of language model agents against human experts." ICML 2025.
- Chan, et al. "MLE-bench: Evaluating Machine Learning Agents on Machine Learning Engineering." arXiv preprint arXiv:2410.07095, 2024.
- Chen, et al. "ScienceAgentBench: Toward Rigorous Assessment of Language Agents for Data-Driven Scientific Discovery." ICLR 2025.
- Siegel, et al. "CORE-Bench: Fostering the Credibility of Published Research Through a Computational Reproducibility Agent Benchmark." TMLR 2024.
- Ouyang, et al. "KernelBench: Can LLMs Write Efficient GPU Kernels?" arXiv preprint arXiv:2502.10517, 2025.
- Lin, et al. "Harness Updating Is Not Harness Benefit: Disentangling Evolution Capabilities in Self-Evolving LLM Agents." arXiv preprint arXiv:2605.30621, 2026.
- Lin, et al. "Agentic Harness Engineering: Observability-Driven Automatic Evolution of Coding-Agent Harnesses." arXiv preprint arXiv:2604.25850, 2026.
- Karten, et al. "Continual Harness: Online Adaptation for Self-Improving Foundation Agents." arXiv preprint arXiv:2605.09998, 2026.
- Che, et al. "DemoEvolve: Overcoming Sparse Feedback in Agentic Harness Evolution with Demonstrations." arXiv preprint arXiv:2605.24539, 2026.