ユニリアル・エージェント

2026/09/23 3:15

ユニリアル・エージェント

RSS: https://news.ycombinator.com/rss

要約▶

Japanese Translation:

The Unreal Agent harness は、ツールコールを非同期的に管理することにより、モデルが待機、ポーリング、ハートビートの管理を行う必要を取り除くことで、AI エージェントの効率を大幅に向上させます。このアーキテクチャの改善は、運用コストを削減し、実務負荷および Terminal-Bench 4.0、SWE-Atlas、DeepSWE、Agents' Last Exam などのベンチマークにおいて、Codex に比べて最大 40% の節約、Pi に比べて最大 20% の節約を実現します。また、開発者がツール完了を待たずにエージェントを導き、より生産的なタスクのスケジューリングを可能にします。CLI 指向の SDK(例:Claude のもの)はローカルセッションまたは複数プロバイダーソリューションについて不安定な仮定を負う傾向があり、互換性の問題に悩まされがちですが、Unreal Agent は決定論的な制約とトークン最適化された結果、ならびに最小限のスクリプトフッターを採用することでこれらのリスクを排除します。また、複雑なシステムで一般的な重厚な依存ツリーやサプライチェーンのリスクも回避します。本ソリューションは、Go ライブラリ、

claude -p
/
codex exec
に似たランナー実行ファイル、または Harbor 互換のベンチマークランナーを通じてシームレスに統合でき、セキュリティは脆弱なフックではなくサンドボックスリングや粒度のあるアクセストークンによって担保されます。境界領域のコスト効率性に関する前進についての連携相談については contact@unreallabs.ai までご連絡ください。

本文

AI エージェントの最先端コスト効率化:Unreal Agent による革新

AI エージェント分野における最先端のコスト効率化ソリューションを共同開発することをご案内します。詳細についてはお問い合わせください。
📧 連絡先: contact@unreallabs.ai

現場実装(the wild)において、私たちは応答速度の向上と実行コストの低減を最優先課題としてきました。その結果、エージェントがツールコール管理に多くの時間とトークンを浪費していることが明らかになり、モデル側のオーバーヘッド削減機能を備えた**「Unreal Agent」**を開発しました。

非同期管理によるアーキテクチャ革新

Unreal Agent のハルネス(ハーネス)は、ツールコールを完全に非同期で管理します。これにより、基盤モデルに対して完了待ち、ポーリング、ハートビートの監視などの処理を排除し、リソース効率を最大化しています。

このアプローチにより、以下の 2 つの主要な利点が生まれます:

  • 即座の導航機能: ユーザーがエージェントを誘導する際、ツールコールの完了を待たずとも動作可能となります。
  • 最適化されたコスト効率: モデル呼び出しの間にはより有用な作業をスケジューリングできるため、最先端のコスト効率性を達成します。

実証されたコスト削減効果

現在のバージョンにおけるベンチマーク結果は以下の通りです:

  • Codex 比較: コスト削減 最大 40%
  • Pi 比較: コスト削減 最大 20%

私たちは、ハルネスの設計を独立した研究分野と捉えており、さらに多くの有望なアイデアを検証・実装することを目標としています。


モチベーションとアーキテクチャ

製品開発において「あるべき正解のパターン」は存在せず、大手ベンダーの SDK もトレードオフに満ちています。Unreal Labs での数々のプロジェクトから得られた教訓が以下の通りです:

既存 SDK の課題

  • CLI 指向の限界:
    Claude
    や
    Codex
    など CLI 型の SDK は、ローカル環境やサブプロセス管理など前提条件が厳しく、生産環境への移植には独自のリサイクル管理が必要です。
  • 互換性リスク: API モードの変更によるツールの破損や、SDK アップグレードに伴うメッセージ形式の変化は、インテグレーションの再構築を強いられます。また、重厚な依存関係はランタイムのメンテナンス性とサプライチェーンリスクを高めます。
  • セキュリティと柔軟性の矛盾: ハルネスフックや特殊ツールへの依存は、サンドボックス制約や承認プロセスにおいて、より多くのメンテナンスを必要とし、堅牢性が低下します。

開発の目的

私たちは、ユーザーからの誘導メッセージを遅延なく処理し、追加の認知負荷をかけずに異種類のツールコールを並行実行できるハルネスの開発を目指していました。例えば、コードベースの探索やウェブ検索を行っている最中であっても、数分かかるセットアップ開始時に追加のトークンコストを発生させない仕組みを実装しました。

Unreal Agent は、ツールを発令するたびにイベントログレコードを即座に追加し、バックグラウンドで実行を続けます。完了時に結果をセッションログに追加し LLM を呼び出すこの仕組みは、キャッシュ破損なしの実現という興味深いエンジニアリング課題でもあります。


コスト効率性の要因

表面だけでは見えないコスト削減の背景には、以下の 2 つの設計思想があります:

  1. 最小限のフットプリント: シンプルなプロンプトを採用し、トークン最適化されたツール結果を提供します。サブエージェントやワークフローを使用しないことでリソースを圧縮しています。
  2. 高密度なツール作業量: LLM に対して明確に説明された直感的な非同期ツールコールモデルを採用しています。これにより、ポーリングや待機のための無駄なトークン消費を抑えつつ、1 ターンあたりより重い(複雑な)ツールコールを発令できます。

ベンチマーク結果

GPT-6 Astra (xhigh) を使用し、Codex と Pi との比較を行いました。パス率は僅かな差があり、これはベンチマークの変動によるものと判断されています。

Terminal-Bench 4.0

基準ライン:Codex (lb)

エージェントパス率総コスト ($)入力/回試 (In/trial)出力/回試 (Out/trial)ターン数ツール数ハーバーリンク
unreal-agent57.9%1,4281.73M32k2827リンク
Codex (リーダーボード)57.9%2,350—————
Pi55.0%1,8272.83M35k4457リンク

SWE-Atlas コードベース QnA

エージェントパス率総コスト ($)入力/回試 (In/trial)出力/回試 (Out/trial)ターン数ツール数ハーバーリンク
unreal-agent65.8%936898k15k1627リンク
Codex63.3%1,3031.69M17k2221リンク
Pi64.0%1,0331.29M16k2460リンク

DeepSWE 1.1

エージェントパス率総コスト ($)入力/回試 (In/trial)出力/回試 (Out/trial)ターン数ツール数ハーバーリンク
unreal-agent72.4%1,3671.60M28k2638リンク
Codex69.0%1,6332.19M30k3029リンク
Pi69.6%1,5842.21M30k4075リンク

Agents' Last Exam · ALE-CLI

完全パス率と平均スコアの比較(Harbor 未掲載実行結果)

エージェント完全パス率平均スコア総コスト ($)タスク当たり入力 (In/task)タスク当たり出力 (Out/task)ターン数ツール数
unreal-agent30.0%59.72170.76M18k1823
Codex29.0%58.12921.59M15k—21
Pi29.0%59.22621.19M19k2737

主にコーディング領域のベンチマークですが、Harbor 上で利用可能であり再現性が高いです。また、ハルネス自体はドメインに依存しない設計となっております。


Unreal Agent の使い方

現在提供されている機能セット:

  • Go ライブラリ: コードベースへの直接統合が可能。
  • ランナー実行可能ファイル:
    claude -p
    や
    codex exec
    に似た操作性。
  • ベンチマークランナー: Harbor との完全互換性確保。

ご自身で試す際は、以下の GitHub リポジトリをご確認ください:
🔗 Unreal Agent GitHub リポジトリ

同じ日のほかのニュース

一覧に戻る →

2026/09/23 1:29

Claude Opus 5.5

## Japanese Translation: Anthropic は、新しい Claude 5.5 ファミリーにおける初モデルである Claude Opus 5.5 を導入しました。このモデルは、エリート「Fable」モデルと同等の性能を維持しつつ、大幅なコスト削減(一般的なタスクでは最大 40% のコスト低減、特定のコーディングタスクでは出力速度向上に伴い約 51% のコスト削減)を提供します。このリリースは、Anthropic が「フロンティアを調整する」という戦略的転換を示すものであり、外部評価機関である Frontier Design と METR による検証也得到了確認です。性能向上により、企業は数週間かかっていた大規模なコード移行を数日(例:68 万行のコード移行が 1 日以内に完了)で実行可能にされ、約 40 の複雑な Web ページの読み込み時間を改善できます。 安全性とセキュリティは最優先事項であり、Opus 5.5 はアライメントスコアの向上、プロンプトインジェクションに対する耐性、そして不可逆的な動作が起きる可能性の低減を示しています。サイバーセキュリティ対策として、Fable 5.1 と同等の safeguards が導入されており、多くのタスクは高レベルのセキュリティを持つ Opus 4.8 ルートされ、Cyber Verification Program を通じてアクセス範囲を拡大しています。生命科学のような専門分野も、Life Sciences Verification Program により高度な生物学安全プロトコルを利用できます。価格設定は Opus 5 のレートから引き下げられ、100 万トークンあたり $4/$20 と変更されました。これにより、アジェンティックコーディングタスクにおけるハイエンド性能が、以前のコストのわずか几分额で利用可能となりました。さらに、すべてのプランの購読ユーザーには、5 時間の使用制限増およびレートリミットのリセット特典が提供されます。最後に、ディストイテーション攻撃を緩和するため、2026 年 8 月 31 日以降に新規作成された API アカウントでは「保存された思考」機能が有効化され、トップティアモデルと同等の堅牢なサイバーセキュリティ対策が確保されています。結局のところ、このリリースはエリート AI 能力を民主化し、コスト削減の大幅増、セキュリティの強化、および事業拡大準備のある企業にとっての運用柔軟性の向上をもたらします。

2026/09/23 2:46

「我々はFBIをハッキングした」:ハッカーたちは、彼らがFBIのすべての職員に関するデータを入手していると主張している。

## Japanese Translation: ShinyHunters というハッキンググループは、複数の FBI 関連サービスの侵入に成功し、全ての現在在职員および申請者に関する包括的なデータを盗んだと主張している。同グループの代表者は 404 Media にこの事案を確認した上で、「盗まれた情報には、氏名、自宅住所、電話番号、エージェント配偶者に関するデータなどといった個人情報も含まれている」と述べている。今回の漏洩は深刻なものであり、ShinyHunters は国家安全保障や対諜報活動への危害を目的としてデータを悪用することが知られているため、もしこのデータが悪意ある行為者に入手されると、FBI の職員が物理的な安全に直ちに脅かされ、国外の諜報機関が Am りカンの運用手法を理解するために今回の侵入を悪用する可能性もある。また、同グループのネットワーク内に存在する犯罪者は、過去に盗まれた記録を利用して法執行官を物理的に特定・追跡し、威嚇しており、エージェントとその配偶者に対して深刻な脅威となっている。専門家らは、FBI の職員や内部関係者に対し、直ちに Signal(ID: joseph.404)または電子メール(joseph@404media.co)を通じて 404 Media に連絡するよう要請している。今回の侵入の具体的な範囲に関する詳細な技術情報は、404 Media プラットフォームの有料会員(あるいは同プラットフォームの無料会員)のみが閲覧できるまま制限されている。

2026/09/22 22:52

OpenAI の GPT–6「Astra」が、2005 年以来解決されなかったエニグマの暗号文を解読した

## Japanese Translation: 2026 年 9 月 15 日、GPT–6 Astra は、1941 年 7 月 10 日に送信されたドイツ軍エニigma暗号の文 MVUEH を成功裡に復号化し、2005 年以来続く謎を解決した。カーター・レファーは、AI にクリプトセルラーリサーチウェブページの未解読メッセージを分析させるよう指示を与えたところ、AI は MVUEH(Nr. 172)を選択して対象とした。AI は独自に開発された Python および C++ ソフトウェアを使用してエニigmaの設定をシミュレートし、以前に解決済みの文 Nr. 173 (SIPVX) との関係性を特定するとともに、平文のパターン「ROSENOW ROSENOW」を crib(推測文)として利用した。最も重要なのは、AI が暗号文における微妙な転記エラーを検出した点であり、その中には第 72 の文字で発生した異常なローターの回転など、以前の人間による試みを阻害しかねる要因が含まれていた。従来の同様のメッセージに対する失敗が鍵の未考慮や差異などに起因していたのに対し、Astra はこの独特なローター構成および不具合を 2 日以内に克服し、人間研究者が数ヶ月かかる結果を得た。復号化の後、研究者たちは連邦アーカイフ(特に巻 RS 3–3/20a および RS 3–3/63b)から関連するアーカイブログを発見し、残りの無線電文の全巻について分析を完全に自動化した。フロデ・ヴァイエルユッドのような専門家らは、以前は数ヶ月かかっていたタスクが数日で完了したことは事実であるが、AI は専門家の暗号解析官にとって強力なパートナーでありながら、絶え間ない人間の介入を必要としないとして指摘した。9 月 19 日のアップデートでは、この成果を「非常に驚くべきこと」と形容し、ヴァイエルユッドは同様の画期的成果に感銘を受けていることを表明した。