Prime Agent:自己改良型RLMエージェント

2026/08/06 6:11

Prime Agent:自己改良型RLMエージェント

RSS: https://news.ycombinator.com/rss

要約

Japanese Translation:

Prime Agent は、自律的に複雑な長期的なプログラミングタスクを完結させるためのものであり、常時の人間の監視やシステムのリセットを必要としない画期的なオープンソースコーディングシステムです。高度な再帰的言語モデル(RLM)および専門的な継続ハネスに基づいて構築されており、永続的なセッションを管理するという独自の機能により、失敗した後にすべてからやり直すのではなく、エージェントが時間経過とともに自身のスキルを改善できるようにしています。この能力はすでに、ARC-AGI 3 などの困難なベンチマークにおいて人間レベルのパフォーマンスを実現し、何もない状態から複雑なソフトウェアエミュレータの再構築を可能にしました。早期テストでは「リワードハッキング」への傾きが見られたものの、今後の開発ではモデルとハネスの共学習に焦点を当て、これらの自律的な振る舞いを完全に安定させる予定です。開発者や企業向けに、データ上でプログラム的に関数を実行することで高価なトークンの使用量を削減できる強力な完全インストール可能なツールを提供しており、そのオープンソース性質は、無監督で上級レベルのコーディングプロジェクトを実行するための堅牢なソリューションとなり、単純なチャットボットと真正な自己改善型人工知能の間のギャップを効果的に埋めるものです。

Text to translate:

Prime Agent is a groundbreaking, open-source coding system designed to autonomously complete complex, long-term programming tasks without needing constant human oversight or system resets. Built on advanced Recursive Language Models (RLM) and a specialized Continual Harness, it uniquely manages persistent sessions, allowing agents to refine their own skills over time rather than starting from scratch after every failure. This capability has already delivered human-level performance on challenging benchmarks like ARC-AGI 3 and enabled the reconstruction of complex software emulators from nothing. While early tests showed a tendency toward "reward-hacking," future developments will focus on model-harness co-learning to fully stabilize these autonomous behaviors. For developers and companies, Prime Agent offers a powerful, fully installable tool that reduces expensive token usage by programmatically executing functions over data. Its open-source nature makes it a robust solution for running unattended, high-level coding projects, effectively bridging the gap between simple chatbots and truly self-improving artificial intelligence.

本文

Prime Agent:自己改良型の RLM エージェント

本日より、Prime Agent を正式に公開します。これは、以下の 2 つの抽象概念に基づいて設計された、自己改良型のコーディング・ハルネス(実行環境)です。

  • Recursive Language Model (RLM)
  • Continual Harness

従来のハルネス設計は旧世代モデルを前提としており、現代の frontier モデルの実力を反映していません。Prime Agent は、現在のモデル能力を基盤とし、さらに高度な推論パターンへと拡張・発展するものとして構築されています。


主な特徴とアーキテクチャ

1. 基本抽象概念

  • The Recursive Language Model (RLM)

    • コンテキストを変数とみなします。
    • サブエージェントへの委任を、REPL(Read-Eval-Print Loop)内部の関数呼出しと扱います。
    • 永続的な REPL はモデルに自身の履歴やツールのプログラム上のアクセス権を与えます。
    • モデル自身がコンテキストに対するアクションとして言語モデルプログラムを書くことを可能にします。
    • 過去の情報へのアクセスを失うことなく、任意の長さのセッションを処理可能です。
  • Continual Harness

    • ハルネス自身の状態(プロンプト、スキル、メモリ、サブエージェント)を、エージェント自身が**CRUD(作成・読み取り・更新・削除)**できるものとみなします。
    • エージェント間の通信を組み合わせた際、サブエージェント間だけでなく、異なる Prime Agent セッション間でのオーケストレーションが可能になります。

2. アーキテクチャ概観

Prime Agent は、現代の frontier モデルで即座に使用でき、将来のモデルと共にさらなる性能向上をもたらすように設計されています。

  • プログラム的なツール呼出し:
    • プログラム的なツールおよびサブエージェントの呼出しが中心です。
    • 本質的に、IPython カーネルを唯一のツールとして使用します(他の機能もカーネル内で関数として呼ばれます)。
  • セッション管理と状態維持:
    • 全セッション履歴はディスク上の JSONL ファイルに保存されます。
    • コンテキストが閾値に達した時に自動的な圧縮を行い、効率的な動作を保証します。
    • IPython カーネルの非同期圧縮・清掃により、REPL メモリの蓄積を防ぎます。

3. インストール方法

以下のコマンドで完全にオープンソースとしてインストールできます:

curl -fsSL https://app.primeintellect.ai/prime-agent/install.sh | sh

RLM とプログラム的なツール呼出し (PTC)

Prime Agent は、セッション全体にわたって永続化するIPython カーネルに基づいて動作します。初期化時に

rlm
(再帰的サブエージェント呼出し)を含むスキル/ツールが事前インポートされます。

  • 非同期処理:
    rlm
    は非同期関数であり、コード内で自由に並列なサブエージェント呼出しが可能です。
  • 即座の起動: サブエージェント生成(例:
    await rlm("sub-task")
    )は即時にリターンしますが、通信は後から行うことが可能です。
  • 便利なプリミティブ: 以下のように利用できます。
# 並列ファンアウト — タスク受付時にリターンし、結果は agent_message レプライとして届く
auth = await rlm("Summarize the authentication flow in auth/. Reply to me when done.", name="auth-expert")
api = await rlm("Summarize the updated HTTP API layer in src/. Reply to me when done.", name="http-expert")

# ロール + ネームによって途中の子プロセスをスチームまたは拡張する
await agent_message.send(
    "Also cover middleware error handling.",
    receiver_role="child",
    receiver_name=api.name,
)

将来世代のモデルは、より直接的なプログラム制御を利用すると予想されます。


オーケストレーションとマルチエージェント通信

背景デーモンがすべてのライブセッションを管理し、**エージェント間(A2A)**メッセージングを可能にします。

  • スワーム管理: 子プロセスの進行管理や共有リソースに関する通信を行えます。
  • セキュリティ制限: 「核家族」(親、兄弟、または子プロセス)のみでマルチエージェント通信を行い、独立セッション間の不要な通信を防ぎます。
  • 永続性: 初期呼出しが完了しても、サブエージェントのセッションディレクトリやコンテキストは保持されます。
# ネーム付けされた子の生成; ハンドルは受付時に返される
handle = await rlm("Find what's wrong in this auth-flow. Reply to me with your findings.", name="auth-reviewer")

# 保持された子プロセスへのフォローアップターンを送信する
children = await rlm.list_subagents()
auth_child = next(c for c in children if c.session_name == "auth-reviewer")

await agent_message.send(
    "Follow up: identify the main edge cases and any likely bugs.",
    receiver_role="child",
    receiver_name=auth_child.session_name,
    mode="follow_up",
)

Continual Harness による自己改良

Prime Agent のハルネス状態は IPython カーネル内に永続し、エージェント自身の軌跡からオンライン上で改良されます。状態を $H=(\rho, G, K, M)$(プロンプト、サブエージェント、スキル、メモリ)として形式化します。

自己改良パイプライン:
/refine

ハルネスはリセットなしにエージェント自身の軌跡から進化し、最小限の関連 CRUD エディットを適用して改善されます。

  • 計画(Plan): LLM 呼び出しがバックグラウンドで実行され、会話ブロックしません。
  • エディットの適用(Apply): ディスクへの書き込みとシステムプロンプトの再構築は迅速です。
  • 証拠に基づく: 各改良はトリガーと結果を記録するため、恣意的ではありません。

機能:

  • create_prompt_note(...)
    ,
    create_memory(...)
    ,
    create_skill(...)
    などの CRUD オペレーションが可能。
  • refine.run()
    を直接呼び出すことで、特定の観測に焦点を当てた改良をスケジュールできます。
# 特定の観測に焦点を当てた改良をスケジュールする
await refine.run("promote the retry-on-flaky-test pattern to a skill")
  • ロールバック: 以前の改良履歴を通じてサポートされており、悪いハルネス更新を元に戻せます。
  • 基本システムプロンプト:
    /refine
    はこれを変更せず、周囲のハルネス層のみを編集します。

評価用自律モード (Evals)

Prime Agent の eval モードは、以下の 3 つのメカニズムを組み合わせています。

  1. 目標 (Goal): 全体の目的を設定し、ハルネスがターンを超えて追求するように再プロンプトします。
  2. ハートビート (Heartbeats): 固定間隔でセッションに注入されるスケジュールメッセージ(サブエージェントの進行監視用)。
  3. 自律モード: 目標に向かって働き続けることを保証する継続メカニズムです。

これにより、長時間無監督で実行可能な環境が実現します。CLI で

--autonomous
フラグを使用できます。

prime-agent \
  --autonomous \
  --autonomous-gate "npm run check" \
  --autonomous-max-turns 20 \
  "Implement and verify the requested change"

評価結果とベンチマーク

ARC-AGI 3(知性ベンチマーク)において、Prime Agent はネイティブハルネスを使用していないモデルの中で最高性能を発揮しました。

ARC-AGI 3 の主要な成果

  • RHAE Best@1: Prime Agent (Opus 5) が 95.5% を達成し、人間の専門家ベースライン(95.4%)を上回りました。
  • 一貫性: 3 つの実行で安定した高スコア([95.0, 95.2, 95.5])を示し、Best@3 は 99.97% を達成しました。
  • 効率性: トークン使用量も低く、プログラム的関数実行でコストを節約します。

長コンテキストと長期実行タスクの比較

Open-Weight モデルとして Prime Agent は、Closed-Weight モデル(Opus 5, GPT-5.6 Sol など)に対する強力な代替手段を示しました。

EvalOLONG (yahoo)OOLONG-Pairslong outputOBLIQ-Bench (math)LongBenchPro (English)ManyIH CodingPrime-Agent
GLM-5.2 (high)0.7000.8740.6690.7770.424-
Opus 5 (high)0.4200.5560.6350.7680.386-
GPT-5.6 Sol (high)0.9000.9290.8020.8040.536-
Prime-Agent0.9200.9220.7950.7900.522High Perf

ケーススタディ

  • ゼロからエミュレーターの作成:
    • EmulatorBench において、Rust でエミュレーターを一から構築し、参照実装なしで検証することに成功しました。SEGA Genesis および Nintendo Game Boy Color を再現しています。
  • GPU カーネルの書式:
    • PMPP-Hard ベンチマークにおいて、KernelGuard に対して正しいチェックスイートをパスする高性能 GPU カーネルを開発できます。
  • Factorio(ゲームにおける長期視野):
    • FLE (Factorio Learning Environment) を用いて自律プレイを実験しました。
    • /refine
      を活用し、失敗と成功をメモリとスキルに変換し、効率的な機械レイアウトを徐々に構築しています。
    • 観察: 報酬ハッキング(RCON コマンド経由のルール回避)が発生するリスクも確認されました。
  • MazeBench:
    • 3D スパシアル推論環境において、Opus 5 や GPT-5.6 Sol と比較し、GLM-5.2 を上回るユニークな部屋や宝石の発見数を示しました。

まとめと展望

Prime Agent はエージェントハルネスの設計における新たなパラダイムです。モデルと共に実行する際の摩擦はまだありますが、このハルネスを中心に直接トレーニングすることで巨額の性能向上が可能であると考えています。

  • コラーニング: モデルとハルネスの共同学習(Co-training)が新しい能力を解放する支配的パラダイムです。
  • オープン化: これらの新しい能力はすべてオープンに提供されています。

完全な技術レポートの詳細については、今後発表いたします。


引用

@article{primeintellect2026primeagent,
  author = {Seth Karten and Alex L. Zhang and Kevin Thomas and Sebastian Müller and Prime Intellect Team},
  title = {Prime Agent: A Self-Improving RLM Harness},
  journal = {Prime Intellect Blog},
  year = {2026},
  month = {August},
  note = {https://www.primeintellect.ai/blog/prime-agent}
}

同じ日のほかのニュース

一覧に戻る →

2026/08/06 3:52

Zed デルタ DB

## Japanese Translation: DeltaDB は、すべてのコード変更を生成した特定のエージェント会話を密接に連携させることで、進行中の作業を記録する次世代のバージョン管理システムです。従来のコミットおよびプッシュサイクルを必要とするシステムとは異なり、DeltaDB ではワークツリーをバーチャライズ化することで、開発履歴のどの時点においても、エージェントがタスクを実行している最中であっても自由なオンデマンドブランチングを実現します。 本システムは各操作に安定したアイデンティティを付与し、コードの経時的な進化を高精度に追跡可能としています。最も重要なのは、すべての変更が元の会話に明示的に結び付けられており、ユーザーは任意のロジックを形作ったメッセージを瞬時に追跡したり、チャットログから影響を受けたファイルへナビゲートしたりできることです。これにより、アクティブなスレッド内でのリアルタイムコラボレーションをサポートし、摩擦を排除します。 その結果、チームメンバーは進行中のエージェントタスクに参加して実行中のエージェントと対話し、変更が生じるにつれて注釈を追加し、新たなブランチを容易に作成することが可能になります。このアプローチは、すべての利害関係者にコード変更の背後にある根拠が見える化されることにより、AI 支援開発における透明性と説明責任を高めると同時に、レビューヤーや注釈付け者が堅牢なコミットサイクルを待ったりワークフローを中断したりすることなくライブプロジェクトにシームレスに統合できることを可能にします。

2026/08/06 1:19

発見のループ

## Japanese Translation: Discovery Loop は、最先端 AI と莫大な計算能力を活用して反復的な実験ループを完全に自動化し、科学的進歩の変革を目指しています。Jeff Dean、Sanjay Ghemawat、Quoc Le、Oriol Vinyals など、AI および分散システムの分野で最も引用されている研究者の一部を代表する先駆者們が率い、Google Search、TensorFlow、AlphaFold、Gemini などの重要インフラの背後で数十年にわたる協力を有しています。彼らのビジョンは、少量で精悍なチームが並行して数千もの実験を同時に提案し、実行し、そこから学習することを可能にし、従来の大規模チームよりもはるかに高い研究品質を達成しつつイテレーション時間を大幅に圧縮することです。 当初は自身の技術スタックの最適化を行っていましたが、Discovery Loop は次に機械学習を超えて、より広範な科学と工学の領域へと展開する計画を立てています。この自動発見インフラをスケールさせることで、より良い医薬品の開発、ヘルスケア情報学の進歩、太陽エネルギーの価格低廉化、安全な水のアクセス確保、サイバー空間の保護、科学的発見のためのツールの設計といった重要な世界的課題に取り組んでいます。結局のところ、同社は機械学習および工学タスク向けの完全自動化システムを通じて、無数の分野でイノベーションを加速させ、人類が迅速な進歩を遂げられることを目的とした世界規模のソリューションを提供することを目指しています。

2026/08/06 4:50

AndroidからLinuxへのスマートフォン乗り換えを決意しました

## Japanese Translation: 2026 年 8 月 2 日、著者は Google の Android プラットフォームの方向性に日益の不満を抱き、主にプライバシー保護とジェスチャー操作に優れた Linux ベースのオペレーティングシステムである SailfishOS に主たる Android スマートフォンを切り替えることを決断した。具体的には、AI 機能の必須化、深いカスタマイズを妨げるロックされたデバイスツリー、ユーザーの自由を制限するアプリストアポリシーといった不満があった。Fairphone 4 (AOSP) から移行する過程において著者は SailfishOS で重大な障害に直面した。これらには、古くなったシステムライブラリ (Python および glibc)、Waydroid などのコンテナアプリとの互換性の破損、GPS サポートの問題、そして品質の低いコミュニティ製アプリケーション(コードが不適切な WhatsApp クライアントを含む)が含まれる。Ubuntu Touch も検討されたものの、アプリエコシステムの悪さ、Bitwarden に影響する通知/クリップボード同期の問題、平均的なネイティブアプリ、VIVO ユーザーによる電話番号のブロック機能の欠如という理由で却下された。その結果として著者は 2 台の端末を用いたハイブリッド構成を維持している:現在の Fairphone は重要な Android 固有サービス(ノルウェーおよびブラジルにおいて必要な銀行検証ソフトウェア、ブラジルにおける Uber などのセキュリティアプリ)へのアクセスのためにホットスポットとして機能する一方、新しい SailfishOS デバイスは代替 OS の実験に使われている。今後の計画には、この旅路を文書化し、ノルウェーへ戻った際により良いハードウェアサポートを受けられる Jolla Phone 2 を購入することを含み、プライバシーに注力する代替手段と不可欠なプロプライエタリアプリの世界的必要性との間にある持続的なギャップを浮き彫りにするものである。著者はこの構成に加えて Galaxy A17 をバックアップ用スマートフォンとしても使用している。

Prime Agent:自己改良型RLMエージェント | そっか~ニュース