GLM-5.3-Flash を Jev 類似の意思決定モデルに変換する

2026/09/27 0:49

GLM-5.3-Flash を Jev 類似の意思決定モデルに変換する

RSS: https://news.ycombinator.com/rss

要約▶

Japanese Translation:

まとめ

アクセシビリティが高く、既存の Large Language Model(LLM)を「Privatemode」上で実行することで、高価な特許権付システムと同様の精度と速度を実現できるという決定的な進歩が達成されました。このアプローチは、テキストのみを処理するモデルが備えていない独自の機能として、直接イメージベースの意思決定(例えば、スキャンされた請求書)を可能にします。この成果は、感情分析から法的文書に至る多様なタスクを網羅し、英語とドイツ語で構成される 29 の公開データセットを用いて検証されました。技術的な実装においては、特定の語彙インデックスをマスクして単一の処理ステップから直接対数尤度を読み取ることで、複雑な再トレーニングなしで効率的を実現しています。モデルに回答前に「推論」させることを許可すると精度は向上しますが(単純なタスクでは 89.9% に達)、トークン消費量が増加するためコストは劇的に上昇し、100 万回の意思決定あたり約 350ユーロとなります。しかし、これらの制約にもかかわらず、高オプション数のタスクにおいてリクエストを分割しても、競合他社と比較して優れた結果が得られます。ユーザーおよび業界にとって、この変化は遅延の低減(ドイツから 180ms 対 264ms)、カスタムモデルへの依存度の低下、そして専門的なハードウェアや莫大な価格を必要としない機密計算を活用した安全でスケーラブルな意思決定を提供します。

キーポイントリスト

  • 主な成果: 「Privatemode」上の既存の LLM(GLM-5.3-Flash)は、1 回の順方向パス内で各オプションについて確率出力を行うタイピングされた意思決定を実行し、TypeSafe の Jev と同等の精度と速度を達成します。
  • ベンチマーク範囲: 評価には、インテントルーティング、感情分析、モデレーション、法的文書、およびスキャンドキュメント(2〜151 オプション)をカバーする 29 の公開データセット(英語/ドイツ語)が使用されました。
  • 精度の比較: 28 のテキストデータセットにおいて GLM-5.3-Flash と Jev は同等のパフォーマンスを示しました(Jev 有利の中央値ギャップ 0.7%、p = 0.64)。一方、Laya のスコアは著しく低く、中央値ギャップ 13〜15%(p < 0.001)でした。
  • マルチモーダル機能: GLM-5.3-Flash はテキスト専用モデル(Jev や Laya)では不可能なイメージベースのタイピングされた意思決定を可能にします。RVL-CDIP(1,600 ドキュメント)では 70.2% の精度を達成し、競合他社はこのデータセットを処理できませんでした。
  • レイテンシ: ドイツから発信した場合、GLM-5.3-Flash は Jev(264ms)に対し 180ms で回答しました。アメリカからは Jev(164ms)の方が速く、Privatemode(299ms)よりも速かったです。
  • コスト効率: 「Privatemode」上での GLM-5.3-Flash のコストは意思決定 100 万回あたり約 62ユーロですが、Jev はリスト価格では 100 万回あたり約 16ユーロです。イメージ処理はトークン量(イメージあたり約 1,350 トークン)により 100 万回あたり約 270ユーロの追加コストがかかります。
  • 技術的な実装: この手法は、vLLM の
    /chat/completions
    エンドポイントで
    continue_final_message: false
    および
    add_generation_prompt: false
    を使用し、
    choice_index:
    で回答をプリフィルしてから直接対数尤度を読み取ることに依存しています。
  • トークン管理:
    vLLM allowed_token_ids
    はオプションインデックスへの語彙をマスクするガードレールとして機能し、
    logprob_token_ids
    はそれらの ID に対する正確な対数尤度を取得します。トークン数はモデルのトークナイザーによって異なります(例:GLM-5.3-Flash は複数桁の数値に対して単一のトークンを使用)。
  • 高オプション数への対応: CLINC150(151 オプション)では、vLLM の 128
    logprob_token_ids
    リミットを処理するために GLM-5.3-Flash は 2 つのリクエストで確率を読み取りました。その結果、Jev の 78.4% に対し 87.5% の精度を達成しました。
  • 推論とのトレードオフ: 回答前にモデルに推論させることを許可すると精度は向上しますが(例:2 オプションの場合 89.9%)、コストは約 350ユーロ/100 万回意思決定、出力トークンは数百まで増加します。
  • ラベル品質の影響:
    banking77
    などのデータセット(約 17% が曖昧なラベルペア)では、モデルのパフォーマンスに関わらず理論上の最大精度は約 85% に制限されます。
  • 再現性: メソドロジー、フリーズされたデータセット仕様、および生データを含まれる提供されたベンチマークリポジトリ(
    edgelesssys/privatemode-decisions-benchmark
    )を通じて結果を再現可能です。
  • セキュリティ文脈: 「Privatemode」上の意思決定は機密計算を活用しており、クライアントはデータを送信する前に展開アテスタメントを確認することでメモリ内の暗号化を確保します。

本文

LLM による単一フォワードパスでのタイプライト型意思決定

日付: 2026 年 9 月 24 日
著者: マルコ・ローゼンミュラー博士、AIT テクニカルリーダー
プラットフォーム: Privatemode
モデル: GLM-5.3-Flash

概要 (TL;DR)

本記事では、市販の LLM を用いて、単一のフォワードパスにおいて「タイプライト型」の意思決定を行う手法を提示します。これにより、LLM を Jev に匹敵するタイプの意思決定モデルへ転換可能です。

  • パフォーマンス: Privatemode 上で GLM-5.3-Flash を使用し、TypeSafe の Jev と同等の決定精度・正確性及びスピードを実現しました。
  • 付加価値機能: 標準的なテキスト専用モデル(Jev など)には不可能な、画像を用いたタイプライト型意思決定(例:スキャンされた請求書)を可能にします。

なぜタイプライト型意思決定なのか?

ソフトウェアが LLM に求めるタスクの多くは、実質的に**「意思決定」**です。「どのチームが担当すべきか?」や「契約条項は責任セクションに含まれるか?」といった問いに対する回答であり、通常は特定形式(JSON)に従い、事前に定義されたセットの中から選択する必要があります。

適切な指示であれば LLM はこれを満たせますが、従来のアプローチには以下のような課題があります:

  • 各意思決定において、LLM がEntire JSON オブジェクト全体を作成する必要があります。
  • リージニングモデルは、テキスト生成前に数百個のトークンを処理する思考(推論)を繰り返す可能性があります。
  • モデルによる**自信度(確率)**は、明示的に問いかけなければ得られません。

これらが実務上の重要要素であり、高ボリューム・ハイスループットシナリオにおける LLM 採用の障壁となってきました。

専門化された意思決定モデル vs 私たちのアプローチ

Jev や Laya などの専門化された意思決定モデル(「システムワン」)は、上記課題を解決するために設計されました。これらは状態と選択肢セットを受け取り、選択された選択肢と共に各オプションに対する自信度値(確率)を返します。

私たちの核心的な洞察:

  • LLM は JSON オブジェクト全体を予測する必要がないためです。構造(Shape)はすでに既知だからです。
  • 与えられた入力に対する LLM の**「タイプライト型の判断」だけ**を求めることに焦点を当てています。
  • 微調整(Fine-tuning)を行うことなく、モデル出荷直後(そのまま)で、LLM を一発の走査でタイプライト型判断を行わせるプロンプト設計が可能です。

仕組み:LLM を意思決定モデルへと変える

LLM はテキストを直接書き出さないため、入力されたプロンプトに対して辞書全体のトークンに対する確率分布を出力します。通常は最も高い確率を持つトークンが選択され生成されますが、JSON の一部フィールドのみを設定したい場合はコストがかかります。

私たちのアプローチは以下の 3 つの基本ステップで構成されています:

  1. 選択肢に番号を振る
    • 状態、質問、および出力用選択肢は、各選択肢にインデックス番号(例:
      0
      ,
      1
      ,
      2
      )が付いた JSON 形式としてプロンプト内に投入されます。
    • 指示により、モデルが
      choice_index:
      に続いてインデックス値を回答するように求めます。
  2. 回答を事前埋め込む
    • プロンプトの末尾に
      choice_index:
      を置きます。
    • これにより、モデルが生み出す最初のトークンは、事前に定義された選択肢へのインデックスになります。
  3. 出力の評価
    • モデルが発したテキストトークンを読むのではなく、その特定の位置においてモデルがすべての選択肢インデックスに割り当てた確率値を読み取ります。
    • これらを正規化することで各回答の確率が得られ、最も高い確率を持つものを選択します。

サンプルインタラクションフロー

  • プロンプト入力: 状態(例:「2 回請求された…」)、質問(例:「どのチームか?」)、選択肢(インデックス付きの JSON リスト)。
  • 事前埋め込まれた回答:
    choice_index:
  • モデル出力ロジック: モデルは直ちにインデックストークンを出力します。サーバー応答から直接、許容されるトークン ID(選択肢のインデックス)のログ確率にアクセスします。
  • 結果: オプションに関する確率分布(例:請求 62.1%、苦情 37.7%)。

技術的実装詳細(vLLM & GLM-5.3-Flash)

  • エンドポイント設定:
    /chat/completions
    エンドポイントを
    continue_final_message
    と
    add_generation_prompt: false
    を使用して構成します。これにより、モデルが新しいターンを開始せず、事前埋め込まれたアシスタントのターンを継続し、テキストと共に**マルチモーダル入力(画像)**を扱えるようになります。
  • マスキングと再正規化: vLLM の
    allowed_token_ids
    は出力辞書を選択肢インデックスに厳格に制限し、他のトークンを
    -inf
    に落とします。リクエストした特定のインデックスの正確な確率を得るために
    logprob_token_ids
    を読み取り、フォーマットトークンによる歪みを回避します。
  • トークン ID の処理: 数字が単一のトークンになるとは限らないため、ライブラリはサーバーからインデックスに対応する適切なトークン ID を動的に取得し、モデル固有の tokenizer に依存しないように設計されています。

ベンチマーク結果

当社のアプローチは、公開データセットから構成したカスタムベンチマークを使用して評価しました。

  • 網羅分野: 意図ルーティング、感情分析、トピック分類、モデレーション、蕴含関係、QA、法文書、スキャンされたドキュメント(英語とドイツ語)。

比較システム

  • GLM-5.3-Flash (Privatemode 上でホスト) - 当社の方法
  • TypeSafe の Jev (標準的な意思決定モデル)
  • Convai の Laya (軽量テキストエンコーダ)

すべてのシステムは、同じ状態、選択肢名/順序、および指示を受け取りました。実行を 2 回繰り返して非再現性を考慮し、差が 3.5% 未満の場合はノイズとして扱いました。

精度

  • テキストデータセット: GLM-5.3-Flash と Jev は同等のパフォーマンスを発揮しました。
    • 10 のデータセットでそれぞれがより高精度でした。
    • 残りの 8 つでは、両者の差は 1 パーセントポイント未満でした。
    • メジアンギャップ:Jev が有利な 0.7 パーセントポイント(統計的に有意ではない)。
  • Laya: 著しく低いスコア(メジアンギャップ 13–15 パーセントポイント)。
  • 選択肢数の効果: システム自体の選択よりも、選択肢の数が精度に与える影響は大きいです。選択肢の数が増加するにつれて、すべてのシステムでパフォーマンスは一般的に低下します。

遅延とコスト

遅延測定では、キュー負荷からモデル時間を分離して個別のリクエストでの実行を行いました。

  • 遅延:
    • ドイツから: Privatemode (180 ms) vs. Jev (264 ms)。
      → Privatemode が勝っています。
    • 米国から: Jev (164 ms) vs. Privatemode (299 ms)。
      → 近接性やインフラの違いにより Jev が勝っています。
  • コスト:
    • GLM-5.3-Flash: ~€62 / 100 万回の意思決定。
    • Jev: ~€16 / 100 万回の意思決定。
    • リーゾンニングモード: GLM-5.3-Flash に思考を許可すると精度はわずかに向上しますが、コストは劇的に跳ね上がります (~€350/百万) し、遅延も増加します。

注: マルチモーダル入力(画像)はドキュメントあたり約 1,350 トークンの入力トークンを追加するため、画像ベースの意思決定のコストが増加します。


マルチモーダルな意思決定

状態はテキストである必要はありません。 GLM-5.3-Flash はビジョン機能を備えているため、質問にはスキャンされた請求書や損傷したパッケージの写真などの画像が含まれることができます。答えは依然として単一のトークンであり、各オプションに対して確率が割り当てられます。

  • Jev/Laya の制限: テキスト専用モデルであり、画像入力を直接処理できません。
  • 当社の結果: RVL-CDIP データセットにおいて、GLM-5.3-Flash は 70.2% の精度を達成し、3 つのシステムの中で唯一回答可能でした。

能力と限界

  • 選択肢制限: 多くの選択肢を持つ場合、システムはトークン予算の制限に直面します。
    • Laya はオプション名のために 192 トークンの予算を共有しており、約 77 の意図に限定されます。
    • 当社のライブラリはログ確率トークンが 128 で制限される場合でも、知的にリクエストを分割することで最大 151+ を扱えます。
  • 記憶力 vs 意味論: オプションの名前を変更する(例えば同義語)ことはシステムによって異なる影響を与え、一部のパフォーマンスは純粋な意味理解ではなく、記憶されたプロンプトパターンに依存していることを示唆しています。

ご自身で構築

当社のライブラリは Python で記述されており、あらゆる vLLM 対応エンドポイントと動作します。vLLM の OpenAI API への拡張機能(

allowed_token_ids
,
logprob_token_ids
)に依存しています。

  • リポジトリ:
    edgelesssys/privatemode-decisions
  • ベンチマークデータ:
    edgelesssys/privatemode-decisions-benchmark

    (メソロジー、データセット仕様、ハネス、集約機能を含みます。当記事のすべての数はここから再計算可能です。)
  • セキュリティ: Privatemode 上では、これらの意思決定は機密コンピューティングによって保護されています。処理中もデータの暗号化状態が維持され、クライアントは何を送信する前にデプロイメントのアテスタテーションレポートを検証します。

新しいデータセット、システム改善、または誤りの修正に対するプルリクエストを歓迎しています。

同じ日のほかのニュース

一覧に戻る →

2026/09/25 22:48

ジョージ主義は機能するのか。五年後

## Japanese Translation: ヘンリー・ジョージの地価税(LVT)に関する立法の動量は、世界的に加速しており、これは擁護活動と、土地に対する財産税と建物に対するそれらを分離した分割率課税を可能にする新たな州法によって牽引されています。本年 4 月、バージニア州とケンタッキー州は、自治体が LVT に参加することを許すことを目的とした啓能法を可決し、2026 年の立法シーズンにおける主要な勝利者となりました。ワシントン州は、中心地であるランド・エコノミクス・センターを通じて新たな法案の検討を進めており、同センターは現在、ジョージ著『進歩と貧困』に関する 2021 年の書評で ACX コンテストを制したラルス・ドゥセツによって率いられています。その書評はゲーリズムに関する継続的な報道を引き起こしました。ニューヨーク州のゴシュル知事は、交通プロジェクトのために地価キャプチャーを使用することを都市に権限を与える期間を延長し、IBX の地下鉄拡張を含む可能性があります。国際的には、バーデン・ヴュルテンベルク州政府は裁判所の挑戦を乗り越えた後、2025 年 1 月に LVT を導入しました。イギリスの首相アンディ・バーナムと韓国大統領李在明も LVT を支援していますが、彼らの現在の野望は低水準の既存課税率に直面しています。ドゥセツは、多くの反対意見が誤解に基づくものだと指摘しており、例えば地価集中に関する誤解を挙げます。また、彼は効果的な実施には正確な評価が必要であり、データクリーニングが高度なアルゴリズムよりも重要で、適切に行えばコストアプローチも妥当であると述べています。陳腐化した評価はピッツバーグに見られるように反発を引き起こすことができ、一方韓国では組織化されたシステムによって 5 ヶ月以内に個々の区画全体に対する完全な年間評価を達成しました。CivicMapper などのツールは、低価値の使用に割当てられた高価値の土地(例:地上駐車)を視覚化するのに役立ちます。AI は上昇する地価価格が注目を集めることで支持を加速させる可能性がありますが、採用度は管轄区によって異なります。経済学者たちは LVT を理想的な税制政策として概ね受け入れているものの、実現可能性については議論が続いています。成功した実施は、現在のいくつかの地域の効果的な税率が modest なままであり地域産業の複雑さが実用的な障壁となる場合でも、大規模なインフラプロジェクトの資金調達が可能になりつつ土地使用の不効率を是正する可能性があります。 ## Text to translate: Legislative momentum for Henry George's land value tax (LVT) is accelerating globally, driven by advocacy and new state laws enabling split-rate taxation—separating property taxes on land from those on buildings. In April this year, Virginia and Kentucky passed enablement laws allowing municipalities to opt into LVT, making them major winners in the 2026 legislative season. Washington State is collaborating on new bills through the Center for Land Economics, which Lars Doucet now leads after winning an ACX contest with a 2021 book review of George's *Progress and Poverty* that sparked ongoing coverage on Georgism. New York Governor Hochul extended authority for cities to use land value capture for transit projects, potentially including the IBX subway expansion. Internationally, Baden-Württemberg implemented LVT in January 2025 after surviving a court challenge; UK PM Andy Burnham and South Korea's President Lee Jae Myung advocate for LVT, though their current ambitions face low existing rates. Doucet argues many objections stem from misunderstandings—such as misconceptions about land value concentration—and notes that effective implementation requires accurate assessments: data cleaning outweighs advanced algorithms, and the cost approach is sound when done correctly. Stale valuations can trigger revolt, as seen in Pittsburgh, whereas Korea's organized system achieved full annual valuation across individual parcels in five months. Tools like CivicMapper help visualize high-value land dedicated to low-value uses (e.g., surface parking). AI may accelerate support as rising land prices capture attention, but adoption will vary by jurisdiction. Economists broadly accept LVT as the ideal tax policy, though feasibility remains debated; successful implementation could fund large infrastructure projects while correcting land use inefficiencies, even if current effective rates in some places remain modest and local industry complexity presents practical barriers.

2026/09/27 3:22

DeepSeek エラスティックコンピューティング(DSec)

## Japanese Translation: 要約は理解しやすく、しかし「重要ポイントリスト」で示された詳細な技術情報が不足しています。以下は、その不足している具体的な情報を統合しつつ、流れを保った改良版です: **改良された要約:** DeepSeek Elastic Compute(DSec)は、大規模な大言語モデル(LLM)のトレーニングと評価のための堅牢で生産環境に準拠したサンドボックスプラットフォームです。その核心的な革新点は、巨大クラスター全体にわたるリソース配分および状態保存を統括する統一システムとして機能することにあります。DSec は、メモリ共有、回収、高度な CPU スケジューリング機構などを統合し、複数のサンドバックエンド(FnCall、コンテナ、マイクロ VM、フル VM)を公開する単一の開発インターフェースを通じてこの効率性を達成します。アーキテクチャはデータ読み込みとトレーニングプロセスを分離しており、Fire-Flyer ファイルシステム(3FS)を利用してバージョン付けされた層から環境を構築します。強化学習フレームワークと共に重要な意味で共同設計されており、DSec は報酬ハッキングなどのエージェントの不適切な行動を防ぎ、ロールアウト状態を維持するために、ステートフルなロールアウト実行と非予約 GPU トレーニングを分離しています。このアプローチは、過剰な環境設定時間やイメージ配布のオーバーヘッドといった業界上の課題に対処します。実際の運用では、約 160 ノードに及ぶ単一のプロダクションスケールユニットは、毎日 300 万回以上のサンドボックス作成を維持し、約 38 万の同時利用可能なサンドボックスを提供することができます(作成速度は毎秒 5,000 回を超えます)。これにより、テクノロジー企業が負荷下でもレイテンシに敏感なパフォーマンスを損なうことなく、急速な実験とスケーラブルな AI 開発を実施できるようになります。

2026/09/25 19:55

PipePipe:SponsorBlock を実装した NewPipe のハードフォーク

## Japanese Translation: PipePipe は、2022 年初頭に NewPipe から派生した独立した Android メディアプレイヤーであり、開発哲学の相違により別プロジェクトとして確立され、アップストリームのコードベースに対する更新共有や変更プッシュを行わない状態で運営されています。同アプリは YouTube と Bilibili の高度なストリーミング機能を備え、プライバシー保護、SponsorsBlock を利用した広告なし視聴、クッキーベースのログインによる制限コンテンツへのアクセスを重視しています。アプリは高品質な AV1 および VP9 コーデック対応、Danmaku チャットオーバーレイ、バックグラウンド音楽再生、スワイプによる探索ナビゲーション、Shorts と有料動画のブロックに対応します。追加機能として、非ローカライズされたオリジナルタイトルの表示、高度な検索フィルタリング、キーワード/チャンネル管理、完全なプレイリストダウンロード、アラームタイマー(スリープタイマー)、再生速度制御が含まれます。寄付を介した Ko-Fi および Liberapay を通じてコミュニティによって開発が行われた PipePipe は、公式アプリに関連するデータ追跡なしでユーザーにメディア消費の深い制御を提供します。

GLM-5.3-Flash を Jev 類似の意思決定モデルに変換する | そっか~ニュース