1 年前に RL を用いた非自己回帰型決定モデルを構築した

2026/09/19 19:46

1 年前に RL を用いた非自己回帰型決定モデルを構築した

RSS: https://news.ycombinator.com/rss

要約

Japanese Translation:

本テキストは、エンタープライズワークフローを悩ませてきた高遅延と幻覚(ハルシネーション)のリスクを排除することを目的として設計された画期的な完全にオープンソースの AI モデル「Laya」を紹介する。標準的な生成型大規模言語モデルがしばしば 500〜2,000 ミリ秒の遅延を経験するのに対し、Laya は単一の GPU で顕著な 32.8 ms の遅延を実現し(バッチ処理された質問の場合には 7.2 ms)、これを達成するためには形式自由なテキスト生成を完全に回避し、代わりに辞書からオプションを選択する「choice」命令、順序付けされた評価基準レベルを割り当てる「score」命令、および真理値論理によって有用でない出力を示す「noul」という 3 つの特定の決定プリミティブのみを通じて構造化データのみを出力することを行っている。この建築学的なシフトは、ルーティングやスパム検出などの重要なタスクに対して瞬時に数学的に校正された確率を確保し、100 言語以上をカバーしている。TypeSafe の「Jev」といったプロプライエタリ競合製品に優越するように開発された Laya は、企業がローカルで展開することを可能にし、API 手数料と運用コストを大幅に削減する。将来的な改良により、現在のトークン予算の制限を超えたより大きなオプションセットを処理することが予想され、英語専用モデルに見られる一般的な失敗がないグローバルかつマルチスキーマの意思決定のための堅牢なソリューションとなるだろう。

本文

Laya:双方向 システム 1 デシジョンモデル

現在の AI 業界では、自律回帰的(autoregressive)ではない新たなモデルの議論が沸騰しています。テキスト生成を行わず、構造化されたスキーマに対して瞬時に確率予測を行うアーキテクチャです。

開発の背景と成果

私はこの開発を 1 年前(2025 年 3 月)に着手しました。汗と無眠の日々を経て、以下の成果物を公開しています:

  • arXiv 論文:
    arXiv:2503.23303
  • モデル重み (Hugging Face):
    sales-conversion-model-reinf-learning
  • オープンデータセット:
    saas-sales-conversations
  • PyPI パッケージ: 公開済み

その後、2025 年 9 月に第 2 の論文(RL によるスキーマベース意思決定の形式化)を

arXiv:2510.01237
に投稿しました。私のシステムは単なる埋め込みモデルや LLM ではなく、常に**強化学習(RL)**によって「脳」を強化しています。


TypeSafe AI「Jev」との比較と Laya の革新

資金調達が十分だった TypeSafe AI がリリースした「Jev」は、非自律回帰的な意思決定を画期的な新知見として提示しました。しかし、彼らは技術論文なし、オープンウェイトなし、オープンな学習データセットなしでの発表でした。

  • Jev の特徴: 並列サンプリング(RLCD)を活用し、入力トークンあたり約
    0.042 ドル
    で動作します。応答時間は約
    150 ms
    です。
  • Laya の革新: TypeSafe AI の制限をすべて取り払い、完全にオープンソース化しました。

パフォーマンス比較(Laya vs Jev)

単一の GPU 上で構築した Laya シリーズは、以下のような劇的な高速化を実現しました:

  • 動作速度: 単一 GPU で 32.8 ms(バッチ処理では質問あたり
    7.2 ms
    )。
    • Jev(150ms)に比べて 6 倍〜8 倍高速
  • 言語サポート: 100 言語以上のフルサポート。
  • コスト: API サブスクリプション不要。$0.00
  • ライセンス: 100% オープンソース(Apache 2.0)。

1. 核心的な気づき:システム 1 とシステム 2

現代の AI パイプラインには、生成型 LLM を単純な反射的決定に使用しているという巨大なボトルネックがあります。カスタマーサポートやセキュリティ判断などのタスクに対し、超大型の LLM を使うのはオーバーキルです。

従来の LLM アプローチの問題点

  • 遅延: トークンストリーミング待ちで 500ms〜2,000ms の遅延が発生。
  • コスト: 推論コストを実費支払い。
  • 後処理: フリーフォームテキストから正規表現や JSON パーサーを手動で作成が必要。
  • ハルシネーション:
    confidence: 0.95
    と出力しても、数学的な校正(calibration)はなく、単に自信のあるトークンを予測しているに過ぎません。

システム 1 モデルの必要性

私たちは人間の脳のシステム 1のようなモデルが必要でした:

  • 瞬間的な反射的決定
  • 正直で校正された確率を提供。
  • コモディティハードウェア上で 30〜35 ms の超高速処理を実現。

2. 三大意思決定プリミティブ

Laya は、生テキストや JSON ドキュメントなどあらゆる状態に対し、単一のフォワードパス内でタイプ化された質問を評価します。出力は純粋な確率と数字のみであり、ハルシネーションやスキーマ違反は物理的に不可能です。

プリミティブ機能説明
Choice(選択)クリテリアルの辞書から 1 つのオプションを選択。キー、確率分布、校正された信頼スコアを返す。
Score(評価)状態を順序尺度(0, 1, 2...)上の位置に置きます。期待レベルとランク間分布を返す。
NouL(ノル・エル)ブール質問に対し、$P(\text{true}) = 1 - P(\text{false})$の関係から、0.0〜1.0 の校正確率を返す。

3. チェックポイントと統合されたハブアーキテクチャ

すべてのタスクで一つのモデルが最適とは限りません。Hugging Face の単一リポジトリ

convaiinnovations/laya
に集約され、特定のサブフォルダのみをダウンロードする仕組みを提供しています(全結合重み 2.5 GB を一度にダウンロードさせる必要がないため)。

ダウンロード例

# 英語モデルのダウンロード(〜808 MB)
agent_en = laya.load("convaiinnovations/laya")

# マルチリンガルサブフォルダのみをダウンロード(約 647 MB)
agent_ml = laya.load("convaiinnovations/laya", subfolder="multilingual")

4. なぜルーティングが不可欠なのか:マルチスクリプトの現実

MASSIVE ベンチマークから得られた教訓:英語モデルはラテン文字以外のスクリプトで失敗します。BERT-Large のバイコジュールも非ラテン文字を処理しきれません。

言語平均信頼性正確性状態
クメール語0.9520.000100 問中 1 個も正解せず
アルメニア語0.8850.050コイン投げのランダム性
ヘブライ語0.9640.060極めて低い

ミリ秒以下の純粋な Python ルーティング

Laya は入力テキストのユニコードスクリプトを検査し、適切なモデルへ自動的にルーティングします。

  • 検出オーバーヘッド: 標準英語
    0.09 ms
    (33ms フォワードパスに対し無視できる)。
  • Cold Start の排除:
    Router(preload=True)
    を使用することで、VRAM/RAM にモデルを常駐させ、言語切り替え時の遅延(7〜10 秒)を消滅させます。

ルーティング例

from laya import Router

# メモリへのチェックポイントの事前読み込みによる、瞬時のサブ 35ms ルーティング
router = Router(preload=True)

# ヒンディテキスト -> mmBERT-base (100+ 言語対応) に自動的にルーティング
res_hi = router.predict(
    {"body": "मुझसे दो बार शुल्क लिया गया, कृपया पैसे वापस करें।"}, 
    questions
)

5. ヘッド・トゥ・ヘッド比較:Laya(ルーティングあり)vs TypeSafe Jev

公開データセットと標準ベンチマークにおいて、Laya は以下の点で優れています。

メトリックTypeSafe Jev 1.13.0Laya(ルーティング付き)利点 / デルタ
typed-decisions (2,000 件)0.7270.766+3.9%(ティーチャーストップ ceiling を上回る)
AG News (4 ラベル)0.9100.9504.0% 高い正確性
DAIR Emotion (6 ラベル)0.480 (Brier 0.846)0.59511.5% 向上(確率 0 のケース減少)
Calibration Error (ECE)0.2460.0813 倍の優れた確率校正
Latency P50 (1 件の質問)236 – 276 ms32.8 ms実行が 7.8 倍高速化
Latency P50 (バッチ 10 件)~1,500 ms(シリアル)72.3 ms (7.2 ms/q)バッチ呼び出しで 20 倍高速化
usable Languages公表なし45/51 言語グローバルなカバレッジ
Cost per 1M tokens$0.042(課金 API)$0.00 (自己ホスト)100% フリー Apache 2.0
モデル重みとコード閉鎖的な APIオープンソース safetensorsオンプレミス対応可能

リアルワールドアプリケーションでの性能

9 つのエンタープライズワークフローで生産環境での品質を実証:

  • メールスパムフィルタリング (Enron): 正確性 0.993, F1 スコア 0.993, ECE 0.013。
  • フィッシング検出: 正確性 0.980, F1 スコア 0.979, ECE 0.012。
  • LLM ガードレール (ToxicChat): 選択的カバレッジ 50% の場合、正確性が 0.931 に到達。

6. 正直な制限事項:Laya の天井がある領域

エンジニアリングの誠実さを信じて、以下の限界を明記します。

  • Choice 質問の性能劣化: オプション数が増えると精度が下がります(例:Banking77 は Jev の 0.870 に対し、Laya は 0.425)。
    • 原因: 共有される 192-256 トークンの
      head_max_len
      バジェットで割り当てられるトークン数が不足するため。
    • 推奨事項: クロイススキーマは 20 オプション以内に抑えるか、粗粒度から微粒度へ階層的な 2 ステップアプローチを使用してください。
  • Zero-shot の限界: ベースモデルは typed-decisions で約 0.35(ほぼランダム)のスコアです。
    • 解決策:
      0.766
      というスコアはベンチマーク上でファインチューニングにより達成されています。全知全能のゼロショットオラクルではなく、専門化のための基礎モデルとして扱ってください。
  • Temperature Calibration: ベース重みは生ログプロビットで出荷されます。
    • 解決策: 質問タイプごとにスカラー温度をフィッティングすることで、ECE を 0.466 から 0.081 に削減できます。

7 クイックスタート:30 秒で Laya を実行する

pip install laya>=0.3.3

以下は、自動言語ルーティング付きのマルチスキーマ意思決定を実行する完全な例です:

import laya
from laya import Router

# プリロード付きでルータを初期化(スワップ遅延を回避)
router = Router(preload=True)

# 複雑な状態を定義
ticket = {
    "ticket_id": "TCK-8821",
    "customer": "enterprise_user",
    "subject": "System downtime and billing dispute",
    "body": "Our production API has been failing since 6 AM. We lost critical transactions. We demand an immediate SLA refund."
}

# 複数の異なるプリミティブの質問を定義
questions = {
    "queue": {
        "type": "choice",
        "instructions": "Which engineering queue owns this ticket?",
        "criteria": {
            "infrastructure": "server outages, network downtime, database failures",
            "billing": "refunds, SLA credits, invoice disputes",
            "security": "breaches, vulnerability reports",
            "support": "general customer inquiries"
        }
    },
    "urgency": {
        "type": "score",
        "instructions": "How urgent is this ticket?",
        "criteria": ["low priority", "medium", "high priority", "critical blocker"]
    },
    "churn_risk": {
        "type": "noul",
        "instructions": "Does the customer threaten to cancel or express severe churn intent?"
    }
}

# 単一のフォワードパス:全ての質問を同時に評価
res = router.predict(ticket, questions)

print("Routing Decision :", res["routing"]["model"])
# -> english

print("Assigned Queue   :", res["answers"]["queue"]["choice"])
# -> infrastructure (confidence: 0.96)

print("Urgency Score    :", res["answers"]["urgency"]["score"])
# -> 2.87 / 3.0

print("Churn Risk       :", f"{res['answers']['churn_risk']['noul']:.1%}")
# -> 91.4%

8 リソースとコミュニティ


結論

2025 年 3 月からの 1 年間の研究を通じて明らかになりました。すべての AI 問題にチャットボットは不要です。

  • 高ボリュームな分類・ルーティング・ガードレールには、RLCD でトレーニングされた サブ 35 ms の双方向意思決定モデルが最適です。
  • プロプライエタリ代替手段よりも 7.8 倍高速
  • ハルシネーションゼログローバルな言語ルーティング
  • 実用コードで分岐できる正直な確信スコア
  • コミュニティ全体のための 100% オープンソース(Apache 2.0)

同じ日のほかのニュース

一覧に戻る →

2026/09/19 18:20

生成 AI で作られたポスターがひどいものに終わる必要はありません。

## Japanese Translation: チャットGPT は、AI アートにしばしば関連づけられる反復的・一般的な外見を避け、独自で高品質なポスターデザインを容易に生成できます。初期の要求では標準的なテンプレートが生成される場合もありますが、具体的な指示を与えることで、文脈に応じたテキストオーバーレイ付きのバウハウス幾何学や日本のミニマリズムなど、多様な芸術スタイルを解き放つことができます。以前の批評において「すべての AI 画像は同一である」と主張されていた点とは対照的に、洗練されたプロンプティングは、鑑賞者が直ちに機械生成であると特定しにくい独自性のある視覚コンテンツの作成が可能であることを証明しています。さらに、Claude や Gemini などの他の高度なモデルも、編集可能なテキスト層を含む PDF や HTML ファイルといった実用的に使用可能な形式を出力し、デザイナーが必要なグラフィックアセットを素早く取得する際に実践的な利便性を提供します。これらの成功した結果を他者が再現できるようにするために、著者は様々なポスタースタイルを網羅した 100 の即座に使用できるプロンプトのカタログを編纂しました。このリソースにより、各新しいプロジェクトに対して複雑な手動指示を必要とせずに、多様な視覚コンテンツを迅速に生成できるようになります。結局のところ、効果的なプロンプティングは、AI を退屈なデフォルトの源から、実世界のデザイン基準を満たすプロフェッショナルでユニークなグラフィックを作成する強力なツールへと変革します。

2026/09/20 5:00

インターネット検閲を測定し、最大級のオープンデータセットに貢献しましょう。

## 日本語訳: オニー・プローブは、インターネット検閲に関する世界の最大のオープンデータセットの中核を成すものであり、主に異なる国でどの特定のウェブサイトやアプリがブロックされているかを検証することを目的として設計されています。该软件の核心には、WhatsApp、Facebook Messenger、Telegram などの主要プラットフォームが利用者のネットワーク上でアクセス可能であることを確認するテストが含まれています。さらに重要なのは、M-Lab と共同で作成された標準化された測定方法である NDT テストを活用して、一般インターネットの速度と安定性を評価することです。このツールは Linux および macOS で動作し、個人の利用者がデジタル自由の解決策(例えば回避アプリ)が実際にはローカルの制限に対して機能しているかどうかを検証する能力を付与します。個人の検証を超えて、オニー・プローブ は研究者や組織に、世界の検閲トレンドを追跡するための不可欠なデータを提供します。M-Lab と協力することで、オープンソースコミュニティ全体で一貫性のある信頼できるパフォーマンス指標が確保されています。

2026/09/18 2:30

Skia を用いた描画のコンパイラ方式最適化

## Japanese Translation: 以下の改善版は、表現を若干明確にし、「トランスレーション検証」に関する主要なポイントと同様に、検証を「翻訳の妥当性確認」と明確に結びつける一方で、すべての内容を保持しています: ## 要約: 本テキストでは、Skia 2D グラフィックスライブラリの形式的セマンティックフレームワークであるμSkia(ミウスキア)を紹介する。Lean で機械化された μSkia は、Google Chrome など既存のアプリケーションにおけるパフォーマンス非効率性の要因である、レイスタライゼーションライブラリ(Skia、CoreGraphics、Direct2D 等)の不透明な実行モデルを解決することを目的としている。μSkia は、キャンバス状態、層スタック、ブレンド、カラーフィルターなどの中核機能を捕捉し、拡張性を確保するためにセマンティクスを 3 つの層に整理する。これらの形式的セマンティクスを用いて著者たちは、Chrome によって生成される最適化されていない Skia コードの 4 つのパターンを発見・検証し、置換案には側面条件を含ませた。その後、これらパターンに基づき高パフォーマンスな Skia オプタイマが構築され、レイスタライゼーションの加速に寄与した。上位 100 のウェブサイトから抽出された 99 つの Skia プログラムにおいて、オプタイマは最新の GPU バックエンドである Skia より 18.7% も高速化を達成し、最適化時間は最大 32 μs であった。この改善は、様々なウェブサイト、Skia バックエンド、および GPU においても持続する。真のエンドツーエンドの検証は、オプタイマのトレースをμSkia のセマンティクスに読み込んで Lean 上でトランスレーションを検証することで達成され、人間が記述したロジックから機械実行可能な指示への変換の安全性を保証する。