
2026/09/16 4:25
「System One モデルと Jev」の紹介
RSS: https://news.ycombinator.com/rss
要約▶
Japanese Translation:
TypeSafe AI は、即座で誤りのない自動意思決定のために設計された画期的な「System One」モデルである Jev を発表しました。従来の言語モデルが単なるテキスト文字列を生成するのに対し、Jev は型安全構造化値を出力し、データの一貫性を確保しながらハルシネーションを排除します。このアーキテクチャ変更は並列サンプラにより支えられており、すべての応答を同時に処理して結果を 70ms から 500ms の範囲で提供可能にしています。これにより既存のツールと比較して最大 200 倍高速化されながら、著しく低いコスト(入力トークンあたり約 0.042 ドルで出力コストはほぼゼロ)を実現しています。システムは、標準的なアライメント手法に依存せず、検証可能な報酬を最優先する「Calibrated Decisions」用の強化学習を用いた専門的なトレーニングを受けました。
カハニーマンの快思考といった認知科学の概念に触発された Jev は、現在のフロンティアモデルと対比して顕著な効率性でベンチマークされています。Jev は、高速ゲームインタラクションや迅速なビッグデータ処理といったリアルタイムアプリケーションを可能にしており、既存のツールに対して最大 200 倍高速化されながらコストは大幅に削減されています。その結果、リアルタイムインテリジェンスに依存する業界では、一貫した信頼スコアと近乎ゼロのレイテンシを提供するシステムへの転換が期待でき、これにより現在の大規模言語モデル展開におけるボトルネックを効果的に解決します。
本文
ディエゴ・アレイマと TypeSafeModels:チャット分野の「超人化」と自動化の未来
ディエゴ・アレイマ(TypeSafe Models 創設者)が OpenAI での研究経験から得た洞察、および新型モデル System One Model の発表に関する重要な声明を整理しました。
🔑 核となるコンセプト:チャット vs. ソフトウェア
- 過去の課題
- チャット分野ではすでに「超人化(高度な能力)」が達成されている。
- しかし、実用的な「自動化」はまだ進んでいない。
- OpenAI 時代には、「チャットベースのモデルこそが AGI(人工汎用知能)への鍵」と信じていたが、大きな欠落が存在することが明らかになった。
- 新しいアプローチ:System One Model
- 2 年間のステルス開発を経て発表された第一世代のシステム。
- 目的:ソフトウェアが直接利用可能な高速な構造化された意思決定を実現する。
- 特徴:従来の「チャット応答」ではなく、自動化に特化した技術スタックを採用。
🚀 System One Model の技術的特徴
既存の大規模言語モデル(LLM)とは異なる根本的なアプローチです。
- トレーニング手法:RLCD
- 従来の RLHF(人間の好みに合わせる)や RLVR に代わり、「Calibrated Decisions(キャリブレイテッド・デシジョンズ)」のための強化学習を採用。
- 目標は「検証可能な報酬」と「認識論的に正直な確率」に基づく意思決定。
- 出力形式:型安全な構造化値
- 文字列(テキスト)の生成を廃止し、事前に定義された型に準拠する構造化データのみ出力。
- ハルシネーション(捏造)は一切発生しない。
- すべての回答には、キャリブレイテッドな確率と自信スコアが付属。
- 処理効率:並列サンプリング
- 従来の「逐次処理(トークン 1 つずつ生成)」から、すべての出力を 1 クエリですべて並列に生成。
- ハードウェアへの意識が高く、極めて効率的。
- コストパフォーマンス
- 入力: 約 0.042 ドル/百万トークン(LLM の 1/50〜)。
- 出力: 無料(従量課制の安さゆえに計器化不值得)。
⚡ 新旧 LLM の比較:Jev vs. Traditional LLM
| 特徴 | 既存の LLM | System One + Jev |
|---|---|---|
| 最適化手法 | RLHF / RLVR | RLCD (キャリブレイテッド・デシジョンズ) |
| 目的 | 人間の好みに合わせる(チャット風) | 検証可能な報酬・構造化された意思決定 |
| 入力/出力 | 非構造化テキストの生成重視 | 型安全な構造化値の生成重視 |
| ハルシネーション | 発生する可能性あり (軌道から外れるリスク) | ゼロ (数学的に不可能・型エラーなし) |
| サンプリング | 逐次処理 (遅い) | 並列処理 (高速) |
| コスト (入力) | $0.20 ~ $10 / M tokens | $0.042 / M tokens |
| コスト (出力) | 入力の約 5 倍かかる | 無料 |
| 速度 | 3 秒〜329 秒 | 70ms〜500ms (40〜200 倍高速) |
| 自信度 | 一貫性に欠ける・過度に自信過剰 | 常に正確な確率と不確実性を伝達 |
💅 Jev の定義
「Jev を『最先端知能の関数呼び出し』と考えれば良いでしょう。」 非構造化された状態を入力とし、型付きの確率的な意思決定を出力します。
📊 技術的成果と検証(証拠)
TypeSafe は懐疑主義を重視するため、すべての主張は検証可能です。
1. 並行比較デモの実績
- Jev の強み:トークン単位の自律回帰的生成ではなく、確率を並列的に出力することで大幅な速度向上を実現。
- 文字列生成の断念:「文字列 generation を断念する」ことが、コスト削減とハルシネーション排除の鍵となった。
- デモ結果:GPT-5.6 Terra などとの比較で、ほぼ 2 オーダーにわたってパレートのフロンティアを独占。
2. ワークフロー評価(Workflow Evals)
- 評価方法:外部の最高水準モデル(Astra, Fable)を使用して「真の正解」を決定し、他のモデルと比較する公平な手法を採用。ハルネスエンジニアリングによる過学習を防ぐ。
- 結果:Jev はほぼ 2 オーダーにわたってパレートのフロンティアを独占し、生成されたプロンプトで論理処理を行う方式よりも圧倒的に優位。
- 応用例:
- 検証可能な課題: 数学的証明、カーネル最適化など。「正しさを安く自動的にチェックできる」場合に強力。
- AI 駆動ワークフロー: 構造化出力を従来の手書きロジックの代わりとしてシームレスに統合(分類・ルーティング・スコアリングなど)。
- Map-Reduce: ペタバイト規模のデータを特徴量や洞察に変換。
- リアルタイムアプリ: 100ms レベルの応答で UX が重要なアプリケーションでも AI を活用可能。
⚠️ ニュアンスと注意点
- 公表された「193.6 倍高速」「444.6 倍安価」という数値は、**実世界の利得の上端(高値)**である可能性があります。
- 比較対象には OpenAI (Astra) や Anthropic (Fable) のモデルが含まれるため、LLM ベンチマークへの偏向があるかもしれませんが、Jev は LLM ラッパーを使用し、構造化された意思決定のみを制約された状態で出力しています。
🎮 面白いデモと利用ケース
Doom (ドーム・ボット)
- 概要: コードと AI で何が実現可能かをリアルタイムで示すゲームボット。
- コスト改善: 開発者は当初「10 クエリ/秒が約 7 ドル/時間」と不安だったが、Jev はこのコストを大幅に下回るレベルへ改善。
- 特徴: 画像ではなく「構造化された状態(データ構造としてのテキスト)」を処理。AI が指示に従う姿を愛している。
Wikiracing (ウィキレーシング)
- 概要: 1 つの Wiki ページからスタートし、リンクのみを使って別のページへ到達するゲーム。
- 難易度: 数百〜数千のリンクから選択が必要で、高カテゴリーにおけるハルシネーション耐性を検証できる。
- Jev の強み: 最大 255 カテゴリをサポート。推論モードより非推論モードの方が高速かつ正確に動作する傾向がある。
🚧 次のステップ:Early Access (早期アクセス)
- 公開状況: 今日から早期アクセスを開始。待機リストの解放を優先。
- 呼びかけ: 自動化したい意思決定、Jev が機能する領域、不足している部分などをフィードバックしていただく。
💬 FAQ & 名前由来
「System One Model」という名前の由来
ダニエル・カーネマン氏の『思考、高速と低速』から着想を得た。
- System 1: 直感的で迅速だが、往々にしてエラーを伴う思考。
- System 2: 慎重で計画的な推論。
- TypeSafe の視点: 「System One Models」は、代替手段よりも信頼性の高いものとして構築されている。
Jev という名の由来
ウィリアム・スタンリー・ジェヴォンズ氏にちなむ。
- 経済学的アプローチ: 蒸気機関の効率化が需要を喚起したように、「知能のコスト低下」が利用可能ケース(市場)を拡大する。1 オーダー(桁)ごとにコストが下がることで、ビジネスモデルが変化する。
よくある質問 (FAQ)
- なぜ新しいトレーニングアルゴリズムが必要だったのでしょうか?
- Jev はどのような利用ケースに適していますか?
- Jev は単に小さな LLM なのでしょうか?
- Jev は公開されているベンチマークにおいてどのようにパフォーマンスを発揮しますか?
- 我々のトレーニングデータはどこから来ているのでしょうか?
- これらの結果はかなり非現実的なようですが、なぜ可能なのですか?