Clef:オープンソースの意思決定モデルと新しい強化学習ファインチューニングプラットフォーム

2026/10/02 1:18

Clef:オープンソースの意思決定モデルと新しい強化学習ファインチューニングプラットフォーム

RSS: https://news.ycombinator.com/rss

要約▶

Japanese Translation:

Cloudflare は、Apache 2.0 ライセンスの下で Workers AI 上にホストされる 2 つの新しい決定モデル、Clef および Clef-flash を発売します。これらのモデルは、標準的な大規模言語モデル(LLM)がしばしば予測不可能なテキストを生成するのと鮮明な対比をなすように、低コストで一貫性があり、厳格に型付けされた構造化された出力を提供します。Qwen アーキテクチャに基づいて構築されており(Clef は Qwen3.8-27B、Clef-flash は Qwen3.5-9B)、画像分類のためにビジョンエンコーダーで強化され、非自己回帰的処理を利用して推論速度を高速化しています—Cloudflare の一般 LLM gpt-oss-120b と比較して、脅威インテリジェンスタスクにおいて 2 倍のレイテンシ削減を示しました。現在 Jev Decision Index ベンチマークで最高スコアを得ており(BFCL ケース exact ベンチマークで 98.47 のほぼ完璧なスコア)、Clef は他のモデルである Jev および Kev 9B を凌ぐような大きな性能向上を提供しています。両モデルとも 64k コンテキストウィンドウを備えており(Jev と比較して 32k)、データが保存されることも、トレーニングに使用されることもないというエンタープライズ対応の保証をサポートします。AI Gateway および Workers AI といった Cloudflare の既存インフラストラクチャを活用し、これらのツールはすでにドメイン分類およびサポートトラージングのための内部運用を動力付けています。このリリースは、Cloudflare の「エージェントクラウド」ミッションを実現するために高速分類器向けニッチ市場への戦略的参入を意味し、新しい強化学習製品および Forward-Deployed Engineer サービスを通じた微調整のためのさらなる機能を提供します。

本文

Cloudflare: 意思決定モデル「Clef」と強化学習製品を発表

直近数週間、Typesafe AI の Jev システムなど意思決定モデルに関する議論が続いていましたが、Cloudflare は**「Clef」と「Clef-flash」**の 2 つの新しい意思決定モデルを Workers AI で提供します。これにより、自律的なエージェントワークフローの革新が可能となります。

意思決定モデルとは?

意思決定モデルは、確率に基づいて分類を行い、AI エージェントがどのように行動すべきかを判断させるために役立ちます。

  • 入力から出力へ: カスタマーサポートへのメッセージなどを入力し、「緊急性」や「担当チーム」「深刻度」などを判定します。
  • 型指定された回答 (Typed Response): コードによるチケットルーティング、エスカレーショントリガー、人間への対応延期などに即座に利用できるよう、確率を伴う厳密な出力を返します。
  • 自動化の促進: エージェントはコンテキストを程序的に収集し、意思決定を行い、タスクを実行するか、必要最小限のみ人間へ引き継ぐことができます。

Cloudflare の実用例:脅威インテリジェンス

Threat Intelligence チームでテストしており、ウェブサイトドメインの分類に貢献しています。

  • 高速な分類: Clef はウェブサイトのフェッチ・レンダリング・分類を2.2 秒で完了します。
    • 「ファッションサイト (95%)」「E コマースサイト (85%)」「フィッシングサイト (1%)」などを即座に判定。
  • 圧倒的な効率性:
    • Clef: 2.2 秒 vs 汎用 LLM (gpt-oss-120b): 4.7 秒。
    • クラスタでは2 つ、Clef では多数のカテゴリを判定可能。
    • レイテンシと結果において約2 倍の節約を実現し、悪質・合法的ドメインの識別速度向上に寄与します。

モデル名の由来

音楽理論における「クレフ(五線譜の記号)」のように、コンテキスト領域およびアクション(ノート)を定義する役割から命名しました。また、"CF"はCloudflareを示唆しています。


Clef 他の意思決定モデルとの違い

市場には多くの意思決定モデルが存在しますが、Clef は以下の独自特性を備えています。

  1. 画像エンコーダー搭載: 画像を入力とし、視覚コンテンツの分類が可能(従来のテキスト分類のみだった Jev との違い)。
  2. 広大なコンテキストウィンドウ: 64k トークンに対応(Jev は 32k)。より多くの入力情報を圧縮して処理可能です。
  3. 高精度と競争力: 各種品質ベンチマークにおいて、市場の他のモデルを上回るスコアを達成しています。

ベンチマーク比較結果

Clef と Clef-flash は、Jev や他社モデル(Diffusion, Gemma Jev など)と比較して卓越した性能を示しています。

ベンチマークClefClef-flashJevDiffusion
ToolRet · nDCG@1069.1966.4365.2861.21
API-Bank · accuracy91.9393.1188.1983.66
Home appliances · case exact82.9597.7352.2742.05
BANKING77 · macro-F194.2090.9379.7474.28
CLINC150+OOS · macro-F197.4366.7789.2783.49
  • Clef-flash の特徴: 大幅に高速化されており、特に「請求書処理」や「セキュリティインシデント」などにおいて高い精度とスピードを実現しています。
  • レイテンシ改善: 43 の評価ベンチマークにおいて、Clef はすべてのモデルでレイテンシを改善。Laya(非常に高速だが品質とのトレードオフあり)を除く全てのモデルで優位性を示しました。
メトリクスClefClef-flashJev
Median latency · ms209.338.8524.18
p95 latency · ms238.6122.4536.02

インフラストラクチャの強み

Clef はWorkers AI上でホストされており、以下のメリットがあります。

  • エッジ GPU の活用: ネットワークレイテンシの低減と高速化を実現。
  • ホットパス配置: エージェントが意思決定を行う重要な経路に Clef を配置し、LLM と組み合わせることで即座にアクションを実行可能。

API 使用例 (cURL)

Clef は Jev と同様、厳密な型指定された出力を生成し、完全に API 互換性があります。

curl https://api.cloudflare.com/client/v4/accounts/$CLOUDFLARE_ACCOUNT_ID/ai/run/@cf/cloudflare/clef \
  -X POST \
  -H "Authorization: Bearer $CLOUDFLARE_AUTH_TOKEN" \
  -d '{
    "model": "clef",
    "state": "Checkout has been failing for every customer for the last hour.",
    "questions": {
      "urgent": { "type": "noul", "instructions": "Is this support request urgent?" },
      "team": {
        "type": "choice",
        "instructions": "Which team should handle this request?",
        "criteria": {
          "billing": "Payments, invoices, and refunds",
          "technical": "Outages, errors, and configuration",
          "sales": "Plans and upgrades"
        }
      },
      "severity": {
        "type": "score",
        "instructions": "How severe is the customer impact?",
        "criteria": ["No impact", "Minor", "Major", "Critical"]
      }
    }
  }'

モデル選定ガイド

  • Clef: より高い精度を必要とする用途向け。
  • Clef-flash: レイテンシ(反応速度)が最重要な意思決定タスク向け。

両モデルとも企業導入準備ができており、データは保存・トレーニングに使用されません(ファインチューニングサービス利用時のみ例外)。詳細は 開発者ドキュメント または Hugging Face で確認いただけます。


Clef の訓練方法について

Clef は、独自のアプローチにより大規模言語モデルの能力を拡張しました。

  • ベースモデルの変更:
    • 従来の Jev(DiffusionGemma ベース)から、Qwenへ移行。
    • Qwen を意思決定タスクに適したように再訓練(フルフィニート)。
  • 高速化の仕組み:
    • 推論時、「プリフィルのみ」パスで Qwen を利用。
    • 有効なスキーマ選択を並列でスコアリング。
    • 中間テキスト生成を行わず、バックボーン表現から直接出力を導出することで、自己回帰型 LLM よりも著しく高速。
  • 高度なアーキテクチャ:
    • 選択肢固有の証拠ルーティングと連合クロスフィールドアテンション。
    • ラーニングヘッド(Rank 256 のローランクアダプター)を最適化。
    • 強化学習によるキャリブレートッドな意思決定 (RLCD) を採用し、隣接順序選択への部分的信用と分布シフト防止の参照ペナルティを適用。

これにより、精度向上、テキスト生成ではなく確率のみ出力、そして高速化という 3 つの革新達成しました。


ファインチューニングによる能力拡張

Cloudflare 内の多様なユースケース(トラスト&セーフティ評価、サポートリクエストのトリアージ、ボット判定など)に合わせて、Clef をファインチューニングするサービスを提供します。

  • 特定化された高精度: 汎用的なモデルよりも特定のドメインに最適化され、より高い精度を実現。
  • FDE チームとの連携: 最初是客户エンジニアリング(FDE)チームとハンズオンを行い、その後セルフサービスのプラットフォームへ進化させる計画。
  • 内部データ活用: Cloudflare が保有する 15 年以上のネットワークデータを基に、汎用モデルを超えた特定ユースケースへの対応が可能。

新しい RL サービスについて

Clef をお客様のワークロードに合わせてファインチューニングするための、強化学習(RL)製品をリリースします。

エコシステムの構成要素

以下の Cloudflare プラットフォームのプリミティブを活用した統合ソリューションです。

  • Cloudflare AI Gateway: 全 AI トラフィックを通し、ユースケース用のリクエストデータセットを自動生成。
  • Cloudflare Workers AI: ベースとなる Clef モデルに対するロールアウト(試行)を実行。
  • Cloudflare Containers: エージェントアクションのスコアリングと再プレイのための RL サンドボックス。
  • [NEW] Trainer: ファインチューニングされた Clef モデルの加重を更新。
  • Bring Your Own Model (BYO): 外部モデルをファインチューニングして Workers AI に再デプロイ可能。

これは、AI Gateway や Containers、Replicate 買収後の BYO モデル機能など、長年にわたる技術的蓄積の結果です。


まとめ:今日ぜひお試しください

  • 初期リリース: Cloudflare 訓練済み ML モデル「Clef」を Workers AI チームから公開。
  • 未来の展望: さらに改良を重ねながら、**「エージェントクラウド」**ミッションに沿って発展していきます。
  • 参加方法:
    • ホストモデルの利用: Workers AI で試す。
    • ローカル実行/実験: Hugging Face でオープンソース版(Apache 2.0 ライセンス)をダウンロード。
    • ファインチューニング: 特定のユースケースへの対応が必要な場合、サポートをご希望の場合はお問い合わせください。

Cloudflare の ML チームはモデル最適化・研究において影響力を増しており、より多くの開発者を歓迎しています。

同じ日のほかのニュース

一覧に戻る →

2026/10/02 4:33

Pi 1.0

## 日本語翻訳: Pi 1.0 のリリースは、機能の急速な拡張よりも安定性を優先する点において、そのエージェントハネスにおける顕著な進化を表しています。すべての最新技術を即時に採用する代わりに、このバージョンでは既存のシステム制約に対して堅牢性が証明された後にのみ変更を統合することに焦点を当てています。この「強化された」アプローチにより、ソフトウェアは不必要な複雑性を持たずに簡潔かつ拡張可能であるように保たれます。新機能には、Model Context Protocol (MCP) へのネイティブ対応、Jev や画像モデルといった大型言語モデル以外との互換性、遅延ツールロード、会話中のシステムメッセージが含まれます。ユーザーエクスペリエンスの向上のために、インターフェースも新しいテーマとデフォルトのフルスクリーンモードで強化されました。何十万もの週次ユーザーからのフィードバックに基づき開発が進められた本プロジェクトは、MIT ライセンスの下でオープンソースとして存続しています。今後の展望として、実験的な「Pi Durable」パッケージでは、ミニマリズムを維持しながら長期的な AI タスクの管理機能を備えています。これにより、ユーザーは異なるプラットフォーム上で、より長期間にわたって基盤となる AI を自在に操作・制御することが可能になります。Pi 1.0 のインストールは `curl` または PowerShell コマンドによるものが利用でき、Pi Durable については `npm install @earendil-works/pi-durable @earendil-works/pi-ai @earendil-works/chord` を実行する必要があります。両方とも pi.dev でドキュメントが提供され、github.com/earendil-works/pi にコードが公開されています。Codemode の機能には、Claude Opus、GPT、Jev などの特定モデルを使用してコミットのサマリーを記述するスクリプトや、自作拡張の記述などが含まれます。

2026/10/02 6:07

Web 開発教育の死

## Japanese Translation: 生成 AI は、エコシステムを破壊することで Web 開発者、教育者、出版社の経済的健全性を根底から覆している。Baldur Bjarnason や Axel Rauschamayer のような著者および出版社は収入が急落し、事業の閉鎖に追い込まれている。特に Rauschamayer は 2026 年に書籍からの収益がゼロとなり、AI クローラーが彼の作品を盗みながら広告収益を生み出さなかったため、コンテンツをオフラインに移すことを余儀なくされた。同様に、Web 開発者の教育者である Josh W. Comeau や Kyle Cook も、LLM がタスクを自動化し仕事を吸収したことで Comeau の収益は半分になり、Cook は深層技術チュートリアルから AI モデルに関する浅く簡単に制作される動画への視聴者のシフトにより半分もの視聴数を失ったと報告している。 この危機は財務面のみならず、Salma Alam-Naylor のような専門家の中で深刻なバーンアウトと不安を引き起こしており、彼女のスキルや共感力が業界で貶められたため、一般に露出の少ない低給の役割を受け入れた。この変化は高品質な教育を脅かしており、開発者は学習のためにエラーが発生しやすいチャットボートに頼る傾向が強まっている一方、Rachel Andrew は GenAI が主題領域の専門家と編集者の間の重要な関係性を損ない、生産性の負担を読者に押し付けるだけであり、根本原因を解決したり実際の効率を高めたりしていないと主張している。究極的には、現在のトレンドは真実の人間の協働よりも短期的利益を優先している。

2026/10/02 5:23

車とは走れるスマートフォンに過ぎません。誰が耳を澄ませているのか

## 日本語翻訳: 2024年10月から2025年8月までに行われた大規模な調査において、独自に購入すると120万ドル以上かかると見込まれるテスト車隊へのアクセスを得るため、Consumer Reports と連携した研究が行われました。その結果、現代のアメリカ製の車のほとんどが、メーカー側のプライバシーに関する約束に反し、秘密裏に感心なユーザーデータを第三者の追跡企業と共有していることが判明しました。ノースイースタン大学の研究者らは、市場後期の米国向け車両 21 台および対応するモバイルアプリ 30 を、3 つの条件下(アイドル時の基準状態、アクティブ使用(可能なすべての動作)、走行時(5〜45 マイル/時間での加速度と激しいブレーキ操作を含む))でテストしました。また、車載トラフィックの迂回を確認するため、11 台の EV をファラデーテント(約 93 dB の減衰)内に走行させることで、セルラー通信を遮断した状態でのテストも実施しています。IMC '26 でピアレビューを受けた本調査では、Wi-Fi を通じて 21 台中少なくとも 19 台が自動的により多くの第三者ドメイン(広告・追跡ドメインを含む)に連絡していたことが判明しました。また、30 件のアプリのうちの 7 件は、車両識別番号(VIN)、メールアドレス、電話番号、正確な GPS 位置情報といった個人を特定できる情報を第三者に送信していました。携帯電話とアプリをペアリングすると、広告・追跡企業への平均的な露出度がおよそ 2 倍に増加し、場合によっては 20 以上の新しいトラッカーが追加されました。アプリのテストでは、iOS デバイスを特定の状態で使用し、ルート証明書と mitmproxy を用いて暗号を解読し、完全な権限との対話を確保していました。セルラー通信遮断条件下でのテストにより、Wi-Fi による追跡がセルラーネットワークとは独立して行われていることが確認されました。メーカー側は主に消費者を非難し、以下の 3 つの選択肢のみを提供しました:データ同意条件を受け入れる、接続機能(リモートスタートやアプリなど)を無効にする、または車両の使用を完全に止めることです。ホンダはその調査結果を受けて運用を調整しましたが、ほとんどの他のブランドは引き続き詳細な位置情報データを外部のトラッカーに送信し続けています。本調査の主要データセットには、GM、ステランティス、フォード、ホンダ、トヨタ、Lucid、メルセデス・ベンツ、ルノー・日産・ミシュバンコンソーシアム、リビアン、テスラ、ボルボなど 19 の異なるブランドが含まれています。研究は、メーカーの開示と実際のデータ共有の間に重大なギャップが存在し、業界が透明性を高め、公開されたプライバシーポリシーと実世界のデータ収集を一致させることで、ユーザーに気づかなれないエコシステムの追跡によって被害を与えることを防ぐよう強く呼びかけています。

Clef:オープンソースの意思決定モデルと新しい強化学習ファインチューニングプラットフォーム | そっか~ニュース