ジーブス。論理的思考がジープライクな意思決定モデルを強化する

2026/09/29 20:13

ジーブス。論理的思考がジープライクな意思決定モデルを強化する

RSS: https://news.ycombinator.com/rss

要約▶

Japanese Translation:

Jeeves は、Qwen3.5 をベースとして構築された特化型の 9B パラメータモデルであり、LoRA アダプター、ポインターヘッド、およびブロック -4 拡散ドラフターを追加することで、応答生成前での意思決定の精度を向上させています。訓練時に保持アウト(hold-out)されたドメイン外のテストデータにおいて、Jeeves は全体的な精度 0.889 を達成し、Kev-9B(0.822)および Jev(0.857)を上回っており、JevBench の公開ティアでは Jev の 0.866 に比べ 0.935 というスコアを獲得しました。本モデルは Jev の typesafe-sdk と互換性の高いドロップイン式の Python SDK を備え、Yes/No、選択式、および評価質問に対応しています。推論遅延は思考なしで約 0.3 秒、H100 GPU 上で思考を含む場合の中位値は 3.3 秒です。思考チェーンをトリミングすることでさらに高速化が可能です。ブロック -4 拡散ドラフターは単純なグリディーデコーディングと比較して 1.6 倍の速度向上を提供し、コストと速度の最良のバランスを実現しています。訓練では SFT(2 エポック)の後に合成データおよび公開のポリシーデータに対して CISPO スケジュールを採用しており、トークナイザー内で State、Question、Option、Decide という別々のレアなトークンが必要であり、これらを置き換えるか、思考後に質問を省略すると性能が低下します。Jeeves は保持アウトのルール構造(1.000)および対比的政策(1.000)において Kev-9B を大幅に上回っています。ただし、ユーザーは FP8 カーネルの使用のために Hopper アーキテクチャの GPU 上で展開する必要があり、完全な思考チェーンを使用すると高い尾部遅延(p90 で 17 秒)を管理する必要があり、MMLU-Pro における trailing knowledge スコアでは Jev に比べて低い値を受け入れる必要があります。再現には PostHog/jeeves リポジトリから重みファイルをダウンロードし、prep/、trainer.py、および export.py の特定のスクリプトに従う必要があります。

本文

Jeeves: CISPO で微調整された拡散ドラフター搭載推論型分類器

Kev に着想をいただきました。CISPO(Chain of Thought with Decision Point Optimization)を用いてトレーニングされた、「思考する前に意思決定を行う」9B パラメータのモデルです。

概要と特徴

  • 構成: Qwen3.5-9B (LoRA + ポインターヘッド) を採用し、ブロック 4 の拡散ドラフターを搭載しています。
  • トレーニングデータ: 完全なトレーニングコード、開発用・テスト用データを公開しています。
  • パフォーマンス: テストデータおよび JevBench(公開ティア)において、既存の Kev-9B を凌駕する性能を発揮しました。
    • Jev: 0.822 → Jeeves: 0.889 (テスト全体)
    • Jev: 0.866 → Jeeves: 0.935 (JevBench)
  • マルチタスク対応: ユーザーの要望を1 つのリクエストで同時処理可能。Yes/No(noul)、択一選択(choice)、評価スコア(score)など多様な形式をサポートします(Jev 互換 API)。
  • 推論速度 (H100 GPU):
    • 思考プロセスなし: 平均約 0.3 秒
    • 思考プロセスあり: メディアン 3.3 秒(連鎖制限によりさらに高速化可能)
  • 動作環境: CUDA (FP8 カーネルは Hopper アーキテクチャ対応)

課題と解決策

  • 既存の課題: Jev 風モデルは確定的な意思決定を提供しますが、精度が低く、多くのパイプラインで推論モデルをフォールバックとして採用する必要がありました。
  • Jeeves のアプローチ: CISPO を用いて、「思考する前に意思決定を行う」ようにトレーニングしました。
    • ドメイン外タスクにおいて優れた性能を示します。
    • JevBench ハードセットにおいても Jev を上回ります。

ベンチマーク結果

思考プロセスを適用し、greedy デコード (2,560 トークン制限) での精度です。Kev-9B と Jev の数値は Kev が公表したものです。

ベンチマークKev-9BJevJeeves
テスト全体(ドメイン外および保持済み)0.8220.8570.889
QNLI0.9250.9250.913
SciQ0.9630.9880.991
PAWS0.7630.7880.875
感情分類 (Emotion)0.6000.5880.647
保持済みルール構造0.8960.8851.000
対照的ポリシー (Contrastive policies)0.9000.9631.000
MMLU-Pro (10 クラス)0.5150.8400.739
未知の事柄確率 p ≥ 0.9 で答えた割合 (小さいほど良い)0.0000.0900.055
JevBench hard(111 件公開)0.451*0.7300.865

* Kev-9B の JevBench 公式結果は公表されていません。Kev-8B (Qwen3) の数値を使用しています。

思考プロセスをスキップした場合のチェックポイント(テスト分割 2,962 アイテム): 0.804。思考プロセス適用時: 0.840。

クイックスタート

要件: Python 3.12 および CUDA GPU

1. 公式重みファイルのダウンロードと起動

# 重みのダウンロード
hf download PostHog/jeeves --local-dir jeeves-weights

# サーバー起動 (ポート:8009)
python -m inference.serve \
  --model jeeves-weights \
  --drafter jeeves-weights/drafter_k4.safetensors \
  --port 8009

2. 独自トレーニングモデルの結合と起動

独自にトレーニングしたチェックポイントをスタンドアローンモデルとして結合する場合:

# チェックポイントの結合
python export.py runs/cispo/final --out runs/fused

# サーバー起動
python -m inference.serve \
  --model runs/fused \
  --drafter runs/drafter_k4/drafter.safetensors \
  --port 8009

3. リクエストの送信 (Jev 形式)

curl -s localhost:8009/v1/systemone \
  -H 'content-type: application/json' \
  -d '{
    "state": "Shoes arrived two weeks late and in the wrong size. Also I see two charges on my card.",
    "questions": {
      "department":  {"type": "choice", "instructions": "Which team should handle this?",
                      "criteria": {"returns": "Exchanges, refunds...", 
                                   "shipping": "Delivery status...", 
                                   "billing": "Charges, invoices..."}},
      "escalate":    {"type": "noul", "instructions": "Does this need urgent human attention?"},
      "frustration": {"type": "score", "instructions": "How frustrated is the customer?",
                      "criteria": ["Calm", "Frustrated", "Very angry"]}
    },
    "options": {"max_think": 512}}'

H100 (FP8) 単一マシンでの応答例(3 つの質問を並列で思考中):

{
    "model": "jeeves-latest",
    "answers": {
        "department": {
            "type": "choice",
            "choice": "billing",
            "confidence": 0.19,
            "probabilities": { "returns": 0.4, "shipping": 0.14, "billing": 0.46 }
        },
        "escalate": { "type": "noul", "noul": 0.72 },
        "frustration": {
            "type": "score",
            "score": 1.5,
            "legend": { "0": "Calm", "1": "Frustrated", "2": "Very angry" },
            "probabilities": { "0": 0.04, "1": 0.43, "2": 0.54 },
            "confidence": 0.75
        }
    },
    "usage": { "input_tokens": 129, "output_tokens": 160, "reasoning_tokens": 1536 },
    "latency_ms": 8141.6
}

Python SDK (
sdk/
)

Jev の

typesafe-sdk
とドロップイン置換可能です。

from jeeves_sdk import Choice, Noul, Score, TypeSafeClient

with TypeSafeClient() as client:
    result = client.system_one(
        state="I was charged twice. Please help.",
        questions={
            "billing": Noul(instructions="Is this about billing?"),
            "tone": Choice(instructions="What is the tone?", criteria={"calm": None, "angry": None}),
            "urgency": Score(instructions="How urgent is this?", criteria=["can wait", "this week", "today"]),
        },
        max_think=768,
        return_reasoning=True,
    )
    
    # 結果の出力
    print(result.nouls["billing"].noul)           # billing: noul
    print(result.choices["tone"].choice)          # tone: choice
    print(result.scores["urgency"].score)         # urgency: score
    print(result.reasoning["tone"].text)          # 思考プロセス
  • デフォルト接続先:
    http://127.0.0.1:8009
    (環境変数
    JEEVES_BASE_URL
    で変更可能)
  • 認証: API キー不要
  • タイムアウト: 最大 120 秒

オプション設定

options
は任意引数です。送らない場合はサーバーのデフォルト値が適用されます。

オプションデフォルト効果
think
true
プロンプトからの回答(約 0.3 秒)
max_think
2560
思考連鎖をこのトークン数で切り捨て、その後回答
noughtink_threshold
null
ノーシンク自信度がこれ以上であれば思考せず回答
return_reasoning
false
回答に各質問の思考テキストを追加

設定ごとの性能比較(325 の開発用質問)

設定精度平均思考トークン数メディアンレイテンシ / p90 レイテンシ
フル思考モード0.8251,1383.3 秒 / 17.1 秒
max_think 768, nothink_threshold 0.90.8063442.0 秒 / 5.6 秒
思考なし (No Thinking)0.7750約 0.3 秒

動作原理

質問、状態、および回答は Qwen チャットテンプレート内以下の構造でロードされます:

<state> …状態の内容…
<q> 指示文 <opt> オプション 1 </opt> <opt> オプション 2 </opt> …

同じ日のほかのニュース

一覧に戻る →

2026/09/30 4:30

米国郵政当局が偽造郵便ラベル販売サイトを閉鎖しました。

## 日本語訳: 9 月 24 日、2026 年、米国郵政検査サービス(USPS)およびパートナーとなる連邦機関は、パキスタンのカーネワール出身の33歳ファヘーム・アフラムに対する起訴状に基づき、LabelsBank.com ドメインを没収し、同サイトを閉鎖するための裁判所命令を発令した。アフラムは、合法的な USPS 配送サービス料金を回避させるため、5,100 万件を超える偽造 USPS 郵便ラベルを5,000 人以上の顧客に販売していたとされる不正ウェブサイト運営容疑で告訴された。同スキームでは、パッケージの重量、サイズ、宛先にかかわらず、ラベルあたり通常2ドルという固定価格で課金され、USPS の確認された損失は1億2,600 万ドルを超えている。調査当局は、同サイトが正当なパッケージ仕様を無視し、顧客が公式費用を回避できるよう、低価格(ラベルあたり最低2ドル)で偽造ラベルを販売していたことを突き止めた。 アフラムは、米国に対する詐欺共謀罪1件、偽造郵便切手ラベルの製造・販売罪5件、電信詐欺罪4件の容疑に直面している。マイアミ支部の郵政検査官らは、アフラムの起訴に伴い同ドメインを没収した。フロリダ南区米国検察官のジェイソン・A・レディング・キニョネス氏によると、この事件は「正当な費用を回避するため、減額された価格で偽造切手をオンラインで販売する」とされるスキームである。マイアミ支部郵政検査官のブラジスミール・ロホ氏は、「私たちの影響力は国境を超えている」と強調し、「どこから活動しても、郵政サービスを欺こうとする者どもが法廷に立たされることを示している」と述べた。今回の没収により、さらにの財務的損失を防ぎ、消費者が無自覚的に偽造商品を購入するのを防止した。当局は、同ウェブサイトは閉鎖され、アフラムに対する連邦での起訴が行われたことを確認した。すべての刑事事件において、これらの容疑はあくまで告発であり、被告人が有罪と証明されるか、またはそれまでは無罪推定を受けるのが原則である。この取り締まりは、類似のオンラインラベルリングに対する抑止となり、そのような活動は深刻な連邦上の結果をもたらす可能性があると再確認するものでもある。

2026/09/30 0:44

PS5 リラップス_EXPloit_

## Japanese Translation: 本ドキュメントは、PlayStation 5 のファームウェアバージョン 7.00 から 13.60 までのexploit に係る技術ガイドを提供し、Primary DNS を 45.56.67.85 と設定し、ペイロード配信のためにポート 9021 でリスニングすることを要する。その手法は Python の `serve.py` をローカルで実行するか、提供された HTTPS URL を訪れることで実現される。exploit は WebKit の脆弱性を活用しており、ブラウザ段階では JSC の情報漏洩と構造クローンオブジェクトプールの不整合を用いて typedarray を破損させ、カーネル段階ではアドレス漏洩と aio_multi_wait UAF レースを組み合わせることで完全な読み書きアクセスを実現する。両段階の安定性問題のため、成功には複数回の試行が必要な可能性がある。本プロジェクトは多数の貢献者をクレジットしており、目的は教育的研究および許可されたテストに限定されると明確にし、システムクラッシュ、データ損失、オンラインサービスの恒久的な禁止、デバイス所有権またはテスト認可がない機器に対する法的制限といったリスクについても警告している。

2026/09/29 21:43

デリーが電気損失を 50 パーセントから 5 パーセントに削減した方法

## Japanese Translation: デリーは電力グリッドの歴史的な変革を遂げ、頻繁な停電に悩まされ高次な信頼性を欠いていたシステムから、約 2300 万人の住民に高い安定性を供給する堅牢なインフラへと進化しました。この転換の具体例として、2026 年 8 月の独立記念日にフマイーンの陵が完全に明かりを灯したことが挙げられます。これは、二年前ほど前には市全域を麻痺させた深刻な停電と鮮明な対比を成します。当時の家計は毎日の停電により学校への送迎バスに乗り遅れたり、出勤が遅れるなどの影響を受けました。 グリッドの悪化は 1980 年代から 1990 年代にかけて進行し、大規模な財政不足を引き起こしてインフラ投資を停滞させるに至りました。2002 年初頭には老朽化した設備と窃盗による損失が 50% を超えていました。これを逆転させるためにデリーは州営の公用事業を解体し(BSES とタタ・パワーの創設)、一連の改革を実施しました:約 5 km の架空送電線を実地ケーブルに置き換える、SCADA デジタル監視システムを導入する、トランスフォーマーを更新し、コンデンサーバンクを設置する、送電線の窃盗対策として絶縁化する、デジタルメータリングを導入して請求詐欺を終息させるなどです。これらの取り組みは 2002 年の技術的・商業的損失が 50% を超えていたのを、現在の 5–6% にまで削減すると同時に、グリッドの信頼性指数を約 70% から 99.9% 以上に引き上げました。これはフランスやベルギーと同等の水準です。 現在、デリーのピーク需要は史上最高纪录である 8,748 メガワットに達しており、公用事業は石炭、天然ガス、水力発電といった多様な地域発電源を活用しながら、中央または州からの購入も実施しています。継続的な戦略には屋上太陽光の採用、詐欺検出のための人工知能の活用、コミュニティ参加プログラム(スラム地区で電気を収集する女性「アバス」による請求書配布など)、そして 24 時間・7 日体制のカイスクおよびモバイルアプリといった利便性の高い支払いオプションが含まれています。究極的には、これらのアップグレードにより家計および企業への日常的中断は消滅し、電気自動車などのモダンテクノロジーに必要な安定した電力供給を可能にしました。

ジーブス。論理的思考がジープライクな意思決定モデルを強化する | そっか~ニュース