
2026/09/27 0:49
GLM-5.3-Flash を Jev 類似の意思決定モデルに変換する
RSS: https://news.ycombinator.com/rss
要約▶
Japanese Translation:
まとめ
アクセシビリティが高く、既存の Large Language Model(LLM)を「Privatemode」上で実行することで、高価な特許権付システムと同様の精度と速度を実現できるという決定的な進歩が達成されました。このアプローチは、テキストのみを処理するモデルが備えていない独自の機能として、直接イメージベースの意思決定(例えば、スキャンされた請求書)を可能にします。この成果は、感情分析から法的文書に至る多様なタスクを網羅し、英語とドイツ語で構成される 29 の公開データセットを用いて検証されました。技術的な実装においては、特定の語彙インデックスをマスクして単一の処理ステップから直接対数尤度を読み取ることで、複雑な再トレーニングなしで効率的を実現しています。モデルに回答前に「推論」させることを許可すると精度は向上しますが(単純なタスクでは 89.9% に達)、トークン消費量が増加するためコストは劇的に上昇し、100 万回の意思決定あたり約 350ユーロとなります。しかし、これらの制約にもかかわらず、高オプション数のタスクにおいてリクエストを分割しても、競合他社と比較して優れた結果が得られます。ユーザーおよび業界にとって、この変化は遅延の低減(ドイツから 180ms 対 264ms)、カスタムモデルへの依存度の低下、そして専門的なハードウェアや莫大な価格を必要としない機密計算を活用した安全でスケーラブルな意思決定を提供します。
キーポイントリスト
- 主な成果: 「Privatemode」上の既存の LLM(GLM-5.3-Flash)は、1 回の順方向パス内で各オプションについて確率出力を行うタイピングされた意思決定を実行し、TypeSafe の Jev と同等の精度と速度を達成します。
- ベンチマーク範囲: 評価には、インテントルーティング、感情分析、モデレーション、法的文書、およびスキャンドキュメント(2〜151 オプション)をカバーする 29 の公開データセット(英語/ドイツ語)が使用されました。
- 精度の比較: 28 のテキストデータセットにおいて GLM-5.3-Flash と Jev は同等のパフォーマンスを示しました(Jev 有利の中央値ギャップ 0.7%、p = 0.64)。一方、Laya のスコアは著しく低く、中央値ギャップ 13〜15%(p < 0.001)でした。
- マルチモーダル機能: GLM-5.3-Flash はテキスト専用モデル(Jev や Laya)では不可能なイメージベースのタイピングされた意思決定を可能にします。RVL-CDIP(1,600 ドキュメント)では 70.2% の精度を達成し、競合他社はこのデータセットを処理できませんでした。
- レイテンシ: ドイツから発信した場合、GLM-5.3-Flash は Jev(264ms)に対し 180ms で回答しました。アメリカからは Jev(164ms)の方が速く、Privatemode(299ms)よりも速かったです。
- コスト効率: 「Privatemode」上での GLM-5.3-Flash のコストは意思決定 100 万回あたり約 62ユーロですが、Jev はリスト価格では 100 万回あたり約 16ユーロです。イメージ処理はトークン量(イメージあたり約 1,350 トークン)により 100 万回あたり約 270ユーロの追加コストがかかります。
- 技術的な実装: この手法は、vLLM の
エンドポイントで/chat/completions
およびcontinue_final_message: false
を使用し、add_generation_prompt: false
で回答をプリフィルしてから直接対数尤度を読み取ることに依存しています。choice_index: - トークン管理:
はオプションインデックスへの語彙をマスクするガードレールとして機能し、vLLM allowed_token_ids
はそれらの ID に対する正確な対数尤度を取得します。トークン数はモデルのトークナイザーによって異なります(例:GLM-5.3-Flash は複数桁の数値に対して単一のトークンを使用)。logprob_token_ids - 高オプション数への対応: CLINC150(151 オプション)では、vLLM の 128
リミットを処理するために GLM-5.3-Flash は 2 つのリクエストで確率を読み取りました。その結果、Jev の 78.4% に対し 87.5% の精度を達成しました。logprob_token_ids - 推論とのトレードオフ: 回答前にモデルに推論させることを許可すると精度は向上しますが(例:2 オプションの場合 89.9%)、コストは約 350ユーロ/100 万回意思決定、出力トークンは数百まで増加します。
- ラベル品質の影響:
などのデータセット(約 17% が曖昧なラベルペア)では、モデルのパフォーマンスに関わらず理論上の最大精度は約 85% に制限されます。banking77 - 再現性: メソドロジー、フリーズされたデータセット仕様、および生データを含まれる提供されたベンチマークリポジトリ(
)を通じて結果を再現可能です。edgelesssys/privatemode-decisions-benchmark - セキュリティ文脈: 「Privatemode」上の意思決定は機密計算を活用しており、クライアントはデータを送信する前に展開アテスタメントを確認することでメモリ内の暗号化を確保します。
本文
LLM による単一フォワードパスでのタイプライト型意思決定
日付: 2026 年 9 月 24 日
著者: マルコ・ローゼンミュラー博士、AIT テクニカルリーダー
プラットフォーム: Privatemode
モデル: GLM-5.3-Flash
概要 (TL;DR)
本記事では、市販の LLM を用いて、単一のフォワードパスにおいて「タイプライト型」の意思決定を行う手法を提示します。これにより、LLM を Jev に匹敵するタイプの意思決定モデルへ転換可能です。
- パフォーマンス: Privatemode 上で GLM-5.3-Flash を使用し、TypeSafe の Jev と同等の決定精度・正確性及びスピードを実現しました。
- 付加価値機能: 標準的なテキスト専用モデル(Jev など)には不可能な、画像を用いたタイプライト型意思決定(例:スキャンされた請求書)を可能にします。
なぜタイプライト型意思決定なのか?
ソフトウェアが LLM に求めるタスクの多くは、実質的に**「意思決定」**です。「どのチームが担当すべきか?」や「契約条項は責任セクションに含まれるか?」といった問いに対する回答であり、通常は特定形式(JSON)に従い、事前に定義されたセットの中から選択する必要があります。
適切な指示であれば LLM はこれを満たせますが、従来のアプローチには以下のような課題があります:
- 各意思決定において、LLM がEntire JSON オブジェクト全体を作成する必要があります。
- リージニングモデルは、テキスト生成前に数百個のトークンを処理する思考(推論)を繰り返す可能性があります。
- モデルによる**自信度(確率)**は、明示的に問いかけなければ得られません。
これらが実務上の重要要素であり、高ボリューム・ハイスループットシナリオにおける LLM 採用の障壁となってきました。
専門化された意思決定モデル vs 私たちのアプローチ
Jev や Laya などの専門化された意思決定モデル(「システムワン」)は、上記課題を解決するために設計されました。これらは状態と選択肢セットを受け取り、選択された選択肢と共に各オプションに対する自信度値(確率)を返します。
私たちの核心的な洞察:
- LLM は JSON オブジェクト全体を予測する必要がないためです。構造(Shape)はすでに既知だからです。
- 与えられた入力に対する LLM の**「タイプライト型の判断」だけ**を求めることに焦点を当てています。
- 微調整(Fine-tuning)を行うことなく、モデル出荷直後(そのまま)で、LLM を一発の走査でタイプライト型判断を行わせるプロンプト設計が可能です。
仕組み:LLM を意思決定モデルへと変える
LLM はテキストを直接書き出さないため、入力されたプロンプトに対して辞書全体のトークンに対する確率分布を出力します。通常は最も高い確率を持つトークンが選択され生成されますが、JSON の一部フィールドのみを設定したい場合はコストがかかります。
私たちのアプローチは以下の 3 つの基本ステップで構成されています:
- 選択肢に番号を振る
- 状態、質問、および出力用選択肢は、各選択肢にインデックス番号(例:
,0
,1
)が付いた JSON 形式としてプロンプト内に投入されます。2 - 指示により、モデルが
に続いてインデックス値を回答するように求めます。choice_index:
- 状態、質問、および出力用選択肢は、各選択肢にインデックス番号(例:
- 回答を事前埋め込む
- プロンプトの末尾に
を置きます。choice_index: - これにより、モデルが生み出す最初のトークンは、事前に定義された選択肢へのインデックスになります。
- プロンプトの末尾に
- 出力の評価
- モデルが発したテキストトークンを読むのではなく、その特定の位置においてモデルがすべての選択肢インデックスに割り当てた確率値を読み取ります。
- これらを正規化することで各回答の確率が得られ、最も高い確率を持つものを選択します。
サンプルインタラクションフロー
- プロンプト入力: 状態(例:「2 回請求された…」)、質問(例:「どのチームか?」)、選択肢(インデックス付きの JSON リスト)。
- 事前埋め込まれた回答:
choice_index: - モデル出力ロジック: モデルは直ちにインデックストークンを出力します。サーバー応答から直接、許容されるトークン ID(選択肢のインデックス)のログ確率にアクセスします。
- 結果: オプションに関する確率分布(例:請求 62.1%、苦情 37.7%)。
技術的実装詳細(vLLM & GLM-5.3-Flash)
- エンドポイント設定:
エンドポイントを/chat/completions
とcontinue_final_message
を使用して構成します。これにより、モデルが新しいターンを開始せず、事前埋め込まれたアシスタントのターンを継続し、テキストと共に**マルチモーダル入力(画像)**を扱えるようになります。add_generation_prompt: false - マスキングと再正規化: vLLM の
は出力辞書を選択肢インデックスに厳格に制限し、他のトークンをallowed_token_ids
に落とします。リクエストした特定のインデックスの正確な確率を得るために-inf
を読み取り、フォーマットトークンによる歪みを回避します。logprob_token_ids - トークン ID の処理: 数字が単一のトークンになるとは限らないため、ライブラリはサーバーからインデックスに対応する適切なトークン ID を動的に取得し、モデル固有の tokenizer に依存しないように設計されています。
ベンチマーク結果
当社のアプローチは、公開データセットから構成したカスタムベンチマークを使用して評価しました。
- 網羅分野: 意図ルーティング、感情分析、トピック分類、モデレーション、蕴含関係、QA、法文書、スキャンされたドキュメント(英語とドイツ語)。
比較システム
- GLM-5.3-Flash (Privatemode 上でホスト) - 当社の方法
- TypeSafe の Jev (標準的な意思決定モデル)
- Convai の Laya (軽量テキストエンコーダ)
すべてのシステムは、同じ状態、選択肢名/順序、および指示を受け取りました。実行を 2 回繰り返して非再現性を考慮し、差が 3.5% 未満の場合はノイズとして扱いました。
精度
- テキストデータセット: GLM-5.3-Flash と Jev は同等のパフォーマンスを発揮しました。
- 10 のデータセットでそれぞれがより高精度でした。
- 残りの 8 つでは、両者の差は 1 パーセントポイント未満でした。
- メジアンギャップ:Jev が有利な 0.7 パーセントポイント(統計的に有意ではない)。
- Laya: 著しく低いスコア(メジアンギャップ 13–15 パーセントポイント)。
- 選択肢数の効果: システム自体の選択よりも、選択肢の数が精度に与える影響は大きいです。選択肢の数が増加するにつれて、すべてのシステムでパフォーマンスは一般的に低下します。
遅延とコスト
遅延測定では、キュー負荷からモデル時間を分離して個別のリクエストでの実行を行いました。
- 遅延:
- ドイツから: Privatemode (180 ms) vs. Jev (264 ms)。
→ Privatemode が勝っています。 - 米国から: Jev (164 ms) vs. Privatemode (299 ms)。
→ 近接性やインフラの違いにより Jev が勝っています。
- ドイツから: Privatemode (180 ms) vs. Jev (264 ms)。
- コスト:
- GLM-5.3-Flash: ~€62 / 100 万回の意思決定。
- Jev: ~€16 / 100 万回の意思決定。
- リーゾンニングモード: GLM-5.3-Flash に思考を許可すると精度はわずかに向上しますが、コストは劇的に跳ね上がります (~€350/百万) し、遅延も増加します。
注: マルチモーダル入力(画像)はドキュメントあたり約 1,350 トークンの入力トークンを追加するため、画像ベースの意思決定のコストが増加します。
マルチモーダルな意思決定
状態はテキストである必要はありません。 GLM-5.3-Flash はビジョン機能を備えているため、質問にはスキャンされた請求書や損傷したパッケージの写真などの画像が含まれることができます。答えは依然として単一のトークンであり、各オプションに対して確率が割り当てられます。
- Jev/Laya の制限: テキスト専用モデルであり、画像入力を直接処理できません。
- 当社の結果: RVL-CDIP データセットにおいて、GLM-5.3-Flash は 70.2% の精度を達成し、3 つのシステムの中で唯一回答可能でした。
能力と限界
- 選択肢制限: 多くの選択肢を持つ場合、システムはトークン予算の制限に直面します。
- Laya はオプション名のために 192 トークンの予算を共有しており、約 77 の意図に限定されます。
- 当社のライブラリはログ確率トークンが 128 で制限される場合でも、知的にリクエストを分割することで最大 151+ を扱えます。
- 記憶力 vs 意味論: オプションの名前を変更する(例えば同義語)ことはシステムによって異なる影響を与え、一部のパフォーマンスは純粋な意味理解ではなく、記憶されたプロンプトパターンに依存していることを示唆しています。
ご自身で構築
当社のライブラリは Python で記述されており、あらゆる vLLM 対応エンドポイントと動作します。vLLM の OpenAI API への拡張機能(
allowed_token_ids, logprob_token_ids)に依存しています。
- リポジトリ:
edgelesssys/privatemode-decisions - ベンチマークデータ:
edgelesssys/privatemode-decisions-benchmark
(メソロジー、データセット仕様、ハネス、集約機能を含みます。当記事のすべての数はここから再計算可能です。) - セキュリティ: Privatemode 上では、これらの意思決定は機密コンピューティングによって保護されています。処理中もデータの暗号化状態が維持され、クライアントは何を送信する前にデプロイメントのアテスタテーションレポートを検証します。
新しいデータセット、システム改善、または誤りの修正に対するプルリクエストを歓迎しています。