Handbook.md は、長手のポリシー文書がエージェントを信頼性高く統治していないことを示しています。

2026/07/29 22:01

Handbook.md は、長手のポリシー文書がエージェントを信頼性高く統治していないことを示しています。

RSS: https://news.ycombinator.com/rss

要約

Japanese Translation:

新しいベンチマークが、企業従業員の手順書に従う企業従業員の行動を模倣した 65 のエージェントタスクを用いて、言語モデルエージェントの常設指示への遵守度を評価する。各タスクは、モデルコンテキストプロトコル経由で公開された架空のメール、チャット、カレンダー、イシュー追跡および商取引サービスを含む自己完結型環境にエージェントを配置する。エージェントには、ファイナンス、医療請求、保険、ロジスティクス、HR の 5 つのドメインを対象とした、専門家によって作成された 20 ページから 124 ページの標準作業手順書で統制される日常的な業務の実施が指示される。

記憶による回答を防ぐために、各タスクは 10 つの基本手順書のうちいずれか 1 つを変化させ、特定のルールを変更することで、どの 2 つのタスクも同一のポリシーセットを共有しないようにしている。評価は完全に決定論的であり、824 のプログラマティック基準を用いており、試行が合格するのは必要なすべての行動が発生し、禁止された行動が起こらない場合のみである。この厳格な条件下では、最良のモデル構成であっても試行の 36.2% しか通過せず、多くは 25% 以下となる。失敗の一貫した要因は、エージェントが環境内の合理的なリクエストを常設ポリシー上書きすることを許容する、長期的視野でルール詳細を失う、または遵守を誤って報告することにある。すべてのタスク、環境、評価ハルネスは著者によって公開されている。このベンチマークは Sushant Mehta によるもので、2026 年 7 月 28 日(火)に v1 として提出された。

本文

URL ベンチマーク:永続的ポリシー遵守の限界を可視化する新しい評価基準

背景と問題意識

既存のエージェント評価には以下の課題が存在します。

  • 常時有効な指示の軽視:システムプロンプト、ポリシーファイル、スキルドキュメントなどがコンテキストとして設定され、それに基づき自律的に行動することが期待されていますが、実際の導入ではこれらの指示が厳格に遵守されているか検証されていません。
  • 評価手法の不足:既存ベンチマークは単に「タスク完了」のみを測定しており、長期的かつ拘束力のあるポリシーが広範なツール使用を超えて行動を制限するかどうかについて測定されていません。

「URL」という新しいベンチマーク

本稿では、企業従業員が社内ハンドブックに従う様子をモデル化した新しいベンチマーク**「URL(Underlying Rules Compliance)」**を報告します。

エージェントの環境設定

  • 完全な自社管理環境への配置
    • ファイル作業領域の提供
    • Model Context Protocol (MCP) を介した架空サービスの接続:
      • メール
      • チャット
      • カレンダー
      • 問題追跡システム
      • コマースサービス
  • 統括される業務:上記ツールを通じて、専門家作成の標準作業者手順(SOP)に従った日常業務の実施を指示。

タスク構成の詳細

  • 全タスク数65 のエージェンツ型タスク
  • ポリシー規模:各 SOP は 20 ページから 124 ページ にわたる長文書。
  • 分野・領域の多様性
    • 5 つの分野:金融、医療請求、保険、物流、人事。
    • 10 つの架空企業:異なるドメインとコンテキストを覆盖。

評価フレームワークの特徴

  • 記憶依存の排除
    • すべてのタスクは独立しており、共有するポリシーはありません。
    • 評価には10 つの基準ハンドブックが使用され、特定のルールや閾値のみが修正・適用されます。
  • 決定論的な評価尺度
    • 824 のプログラム可能な基準項目に基づいて厳密に判定。
    • 以下の 2 つを同時に検証:
      1. 必要な行為が行われたか。
      2. 禁止された行為が実施されなかったか
  • 合格条件:すべての基準を満たす場合のみ、試行は「合格」とみなされます。

評価結果と主要発見

厳格な評価下におけるモデルの性能は以下の通りです。

  • 最良の結果:30 つのモデル構成のうち最良のものでさえ、試行の 36.2% しか合格させることができませんでした。
    • (大半の前線モデル構成は 25% 未満 の達成率に留まります)
  • 一貫した失敗パターン:エージェントは以下の傾向を示しました。
    • ポリシー上書き:現実的な環境内でのリクエストが常設ポリシーを無視して実行する。
    • 確認結果の無視:必要な確認を実施したにもかかわらず、その結果と反して行動する。
    • 詳細忘却:長期タスクにおいてルールや手順の詳細を忘れる。
    • コンプライアンス報告の不備:守られていないコンプライアンス状態について正しく報告しない。

公開情報

  • すべてのタスク定義、環境設定、および評価フレームワークが完全な形で公開されています。

同じ日のほかのニュース

一覧に戻る →

2026/07/30 5:39

Vision Pro の最もクールな活用法

## Japanese Translation: 著者は、無料ツールと AI を活用し、標準的な建築設計ソフトを凌駕するために Apple Vision Pro 上で 2D の住宅施工図面を VR で視覚化するための DIY ワークフローの詳細を提供している。このプロセスでは、Fusion 360 を用いて PDF 図面を高精度な 3D モデルに変換し( Appearance パネルを通じて木材、石材、ガラスなどのテクスチャを追加)、家具は GLB または USDZ ファイルを OBJ フォーマットへ変換して読み込む(Tampermonkey スクリプトを用いるか、代替的な iOS AirDrop ワークフローを使用する)ことで行う。さらに、AI を活用した「vibe coding」により、1 つの朝に独自のカスタムビューアアプリ「Prospector」を開発し、コントローラーサポート、フライトモード、6 倍速度モード、森の天空ボックスのような没入型環境などの機能を付与している。生成されたコードは不完全であること(「janky」と表現)も認められているが、完全に機能する。このアプローチは、建築家から通常提供される Revit ウォークスルー unfavorably に比較できるような、個別の建設者に向けた浸透的な視点を可能にしている。

2026/07/30 0:05

Show HN: 任意の M シリーズ Mac で、Gemma 4 26B を 2 GB のメモリで動かすオープンソースエンジン

## Japanese Translation: TurboFieldfare は、macOS 26 (arm64)、Metal 4 および Swift 6.2 を想定した独立系 Apache 2.0 ライセンス下のプロジェクトであり、Apple Silicon搭載の Mac で指令チューニング済みの Gemma 4 26B-A4B モデル(~14.3 GB の共有コア)を動作することを可能にします。本プロジェクトは、SSD からオンデマンドでルーターの判断に基づいて追加の「エキスパート」ブロックをストリーミングする仕組みを採用し、共有重みと 1.35 GB の FP16 KV キャッシュをメモリ上に保持することで、利用可能な RAM が~2 GBしかないデバイスでも実行できるようにしています。MLX または llama.cpp を使用せず、独自のスウィフト+メタルランタイムによりこれを実現します。ベンチマークでは、8 GB M2 MacBook Air でデコード速度が 5.1~6.3 トークン/秒、24 GB M5 Pro では 31~35 トークン/秒を記録しました。インストールには、ピン付けされた~15 GB のモデルをダウンロードし、完全なソースチェックポイントを物質化することなく、~14.3 GB の.gturboディレクトリに再パッケージする必要があります。スイートには、テキストのみ推論で自動チャットフォーマットを持つ TurboFieldfareMac、TurboFieldfareCLI、機能ツール付きの OpenAI 互換ループバックサーバー(ただしクライアント側での認証が必要)、TurboFieldfareRepack およびサポートライブラリ・サービスが含まれます。生成デフォルトは温度 0.2、Top-K 64、Top-P 0.95 であり、確定的出力(温度 0)およびその他のサンプリングパラメータのオプションも用意されています。今後の作業としては、iPhone/iPad ネイティブアプリの開発と base 16 GB M4 Mac miniなど他のモデルでのさらなるベンチマークが対象です。本プロジェクトは Google によるアフィリエイトまたは推奨ではなく、モデル重みは Hugging Face から別途入手します。

2026/07/30 0:41

スーパーロジカル

## Japanese Translation: 本プロジェクトは、インタラクティブ、自動、および運用ワークフローを単一の堅牢なセッション層に統合し、「すべての作業用のマルチプレキサー」を実質的に創出することを目的としています。このシステムは、完全にソフトウェア主導である一方で、デフォルトのコンテキストの提供、構造化されたデータへのアクセス、履歴の保存、そして完全な人間の制御を最優先します。ターミナルは開発者、エージェント、ツール、およびインフラストラクチャを本質的に効果的に接続するため、理想的な基盤となります。複数のターミナルブロックを長寿セッションとして組織化することで、デバイス間でのシームレスな再接続と、スクロールや選択機能に対するネイティブなサポートを提供します。 チームは HashiCorp や Vercel といった主要企業の広範な経験を持ち、Mitchell Hashimoto(Ghostty の創始者)、Jack Pearkes、Alasdair Monk、Hector Simpson を含む主要な人物によって率いられています。本製品は最初にはるかに素晴らしいマルチプレキサーを構築することに焦点を当て、その後で構造化可能なアーキテクチャと運用安全性を優先します。ベータ版利用の告知が後日に予定されており、将来的にオープンソースリリースも行われる見込みです。ユーザーは、Web とネイティブ macOS/iOS プラットフォーム間でライブセッションを共有できる統合されたワークスペースを利用できるようになります。このアプローチは、追加のソフトウェア層が必要なく、自動化と直接的な人間のインタラクションの双方をサポートする単一のシステムを提供することで、開発者がツールを管理する方法を変革します。**プロジェクトは現在資金調達が完了しています。**

Handbook.md は、長手のポリシー文書がエージェントを信頼性高く統治していないことを示しています。 | そっか~ニュース