
2026/09/23 3:15
ユニリアル・エージェント
RSS: https://news.ycombinator.com/rss
要約▶
Japanese Translation:
The Unreal Agent harness は、ツールコールを非同期的に管理することにより、モデルが待機、ポーリング、ハートビートの管理を行う必要を取り除くことで、AI エージェントの効率を大幅に向上させます。このアーキテクチャの改善は、運用コストを削減し、実務負荷および Terminal-Bench 4.0、SWE-Atlas、DeepSWE、Agents' Last Exam などのベンチマークにおいて、Codex に比べて最大 40% の節約、Pi に比べて最大 20% の節約を実現します。また、開発者がツール完了を待たずにエージェントを導き、より生産的なタスクのスケジューリングを可能にします。CLI 指向の SDK(例:Claude のもの)はローカルセッションまたは複数プロバイダーソリューションについて不安定な仮定を負う傾向があり、互換性の問題に悩まされがちですが、Unreal Agent は決定論的な制約とトークン最適化された結果、ならびに最小限のスクリプトフッターを採用することでこれらのリスクを排除します。また、複雑なシステムで一般的な重厚な依存ツリーやサプライチェーンのリスクも回避します。本ソリューションは、Go ライブラリ、
claude -p/codex exec に似たランナー実行ファイル、または Harbor 互換のベンチマークランナーを通じてシームレスに統合でき、セキュリティは脆弱なフックではなくサンドボックスリングや粒度のあるアクセストークンによって担保されます。境界領域のコスト効率性に関する前進についての連携相談については contact@unreallabs.ai までご連絡ください。本文
AI エージェントの最先端コスト効率化:Unreal Agent による革新
AI エージェント分野における最先端のコスト効率化ソリューションを共同開発することをご案内します。詳細についてはお問い合わせください。
📧 連絡先: contact@unreallabs.ai
現場実装(the wild)において、私たちは応答速度の向上と実行コストの低減を最優先課題としてきました。その結果、エージェントがツールコール管理に多くの時間とトークンを浪費していることが明らかになり、モデル側のオーバーヘッド削減機能を備えた**「Unreal Agent」**を開発しました。
非同期管理によるアーキテクチャ革新
Unreal Agent のハルネス(ハーネス)は、ツールコールを完全に非同期で管理します。これにより、基盤モデルに対して完了待ち、ポーリング、ハートビートの監視などの処理を排除し、リソース効率を最大化しています。
このアプローチにより、以下の 2 つの主要な利点が生まれます:
- 即座の導航機能: ユーザーがエージェントを誘導する際、ツールコールの完了を待たずとも動作可能となります。
- 最適化されたコスト効率: モデル呼び出しの間にはより有用な作業をスケジューリングできるため、最先端のコスト効率性を達成します。
実証されたコスト削減効果
現在のバージョンにおけるベンチマーク結果は以下の通りです:
- Codex 比較: コスト削減 最大 40%
- Pi 比較: コスト削減 最大 20%
私たちは、ハルネスの設計を独立した研究分野と捉えており、さらに多くの有望なアイデアを検証・実装することを目標としています。
モチベーションとアーキテクチャ
製品開発において「あるべき正解のパターン」は存在せず、大手ベンダーの SDK もトレードオフに満ちています。Unreal Labs での数々のプロジェクトから得られた教訓が以下の通りです:
既存 SDK の課題
- CLI 指向の限界:
やClaude
など CLI 型の SDK は、ローカル環境やサブプロセス管理など前提条件が厳しく、生産環境への移植には独自のリサイクル管理が必要です。Codex - 互換性リスク: API モードの変更によるツールの破損や、SDK アップグレードに伴うメッセージ形式の変化は、インテグレーションの再構築を強いられます。また、重厚な依存関係はランタイムのメンテナンス性とサプライチェーンリスクを高めます。
- セキュリティと柔軟性の矛盾: ハルネスフックや特殊ツールへの依存は、サンドボックス制約や承認プロセスにおいて、より多くのメンテナンスを必要とし、堅牢性が低下します。
開発の目的
私たちは、ユーザーからの誘導メッセージを遅延なく処理し、追加の認知負荷をかけずに異種類のツールコールを並行実行できるハルネスの開発を目指していました。例えば、コードベースの探索やウェブ検索を行っている最中であっても、数分かかるセットアップ開始時に追加のトークンコストを発生させない仕組みを実装しました。
Unreal Agent は、ツールを発令するたびにイベントログレコードを即座に追加し、バックグラウンドで実行を続けます。完了時に結果をセッションログに追加し LLM を呼び出すこの仕組みは、キャッシュ破損なしの実現という興味深いエンジニアリング課題でもあります。
コスト効率性の要因
表面だけでは見えないコスト削減の背景には、以下の 2 つの設計思想があります:
- 最小限のフットプリント: シンプルなプロンプトを採用し、トークン最適化されたツール結果を提供します。サブエージェントやワークフローを使用しないことでリソースを圧縮しています。
- 高密度なツール作業量: LLM に対して明確に説明された直感的な非同期ツールコールモデルを採用しています。これにより、ポーリングや待機のための無駄なトークン消費を抑えつつ、1 ターンあたりより重い(複雑な)ツールコールを発令できます。
ベンチマーク結果
GPT-6 Astra (xhigh) を使用し、Codex と Pi との比較を行いました。パス率は僅かな差があり、これはベンチマークの変動によるものと判断されています。
Terminal-Bench 4.0
基準ライン:Codex (lb)
| エージェント | パス率 | 総コスト ($) | 入力/回試 (In/trial) | 出力/回試 (Out/trial) | ターン数 | ツール数 | ハーバーリンク |
|---|---|---|---|---|---|---|---|
| unreal-agent | 57.9% | 1,428 | 1.73M | 32k | 28 | 27 | リンク |
| Codex (リーダーボード) | 57.9% | 2,350 | — | — | — | — | — |
| Pi | 55.0% | 1,827 | 2.83M | 35k | 44 | 57 | リンク |
SWE-Atlas コードベース QnA
| エージェント | パス率 | 総コスト ($) | 入力/回試 (In/trial) | 出力/回試 (Out/trial) | ターン数 | ツール数 | ハーバーリンク |
|---|---|---|---|---|---|---|---|
| unreal-agent | 65.8% | 936 | 898k | 15k | 16 | 27 | リンク |
| Codex | 63.3% | 1,303 | 1.69M | 17k | 22 | 21 | リンク |
| Pi | 64.0% | 1,033 | 1.29M | 16k | 24 | 60 | リンク |
DeepSWE 1.1
| エージェント | パス率 | 総コスト ($) | 入力/回試 (In/trial) | 出力/回試 (Out/trial) | ターン数 | ツール数 | ハーバーリンク |
|---|---|---|---|---|---|---|---|
| unreal-agent | 72.4% | 1,367 | 1.60M | 28k | 26 | 38 | リンク |
| Codex | 69.0% | 1,633 | 2.19M | 30k | 30 | 29 | リンク |
| Pi | 69.6% | 1,584 | 2.21M | 30k | 40 | 75 | リンク |
Agents' Last Exam · ALE-CLI
完全パス率と平均スコアの比較(Harbor 未掲載実行結果)
| エージェント | 完全パス率 | 平均スコア | 総コスト ($) | タスク当たり入力 (In/task) | タスク当たり出力 (Out/task) | ターン数 | ツール数 |
|---|---|---|---|---|---|---|---|
| unreal-agent | 30.0% | 59.7 | 217 | 0.76M | 18k | 18 | 23 |
| Codex | 29.0% | 58.1 | 292 | 1.59M | 15k | — | 21 |
| Pi | 29.0% | 59.2 | 262 | 1.19M | 19k | 27 | 37 |
主にコーディング領域のベンチマークですが、Harbor 上で利用可能であり再現性が高いです。また、ハルネス自体はドメインに依存しない設計となっております。
Unreal Agent の使い方
現在提供されている機能セット:
- Go ライブラリ: コードベースへの直接統合が可能。
- ランナー実行可能ファイル:
やclaude -p
に似た操作性。codex exec - ベンチマークランナー: Harbor との完全互換性確保。
ご自身で試す際は、以下の GitHub リポジトリをご確認ください:
🔗 Unreal Agent GitHub リポジトリ