オープン・イェヴ

2026/09/18 18:42

オープン・イェヴ

RSS: https://news.ycombinator.com/rss

要約

Japanese Translation:

SemIf は、外部バックエンドサーバーを一切必要とせずに语义推論モデルを個人の GPU 上で直接実行する画期的なライブブラウザ実験を導入します。このアーキテクチャにより、ユーザーはデフォルトのデスクトップパフォーマンス最適化済みの MiniCPM5 2B パラメータバージョンから、モバイルデバイス向けに特別に設計された Qwen3 0.6B のような小型オプションまで、モデルサイズとバリエーションを簡単に切り替えることができます。4B モデルも利用可能ですが、それにははるかに多くのメモリが必要です。Hugging Face から重みを調達し、wllama(ピン留めされた GGUF ビルドを使用)を使用してローカルで管理することで、システムは機密入力がユーザーのページを離れないようにし、プライバシーを最優先としています。最初のロードでは、ネットワーク速度、ハードウェア能力、モデルサイズ(デフォルトでは約 1.56 GB)に応じて数分かかる場合があります。

このプロジェクトは技術的に二つの異なる運用方法を比較しています:直接ロジット読み取り(02A)、これはテキストデコードなしで生の確率スコアを抽出し、JSON 生成(02B)、これはモデルがオプション分布を読める JSON テキストとして書き出すものです。性能は、102行の公開サブセットにおける大文字小文字一致の TypeSafe(等価ケース同意)や、公表済みの値である Jev のような指標を使用して厳密にベンチマークされています。また、準備、ウォームアップ、入力、出力、および最初のトークンを含む壁時計指標は、結果を事前に用意したものを使用せずに performance.now() によってキャプチャされています。ただし、ユーザーは直接ロジットスコアが表示されたオプショントークンのみに関するsoftmaxを表し、完全に校正された確率ではなく未校正の信頼度値であることを留意する必要があります。結局のところ、この革新は、デスクトップ開発者からモバイルユーザーに至るまで、高精度と厳格なデバイスメモリ制約の間での実用的なトレードオフを提供します(wllama による量子化効果を含めて)。

本文

SemIf:ブラウザ上で体験する「意思決定モデル」の実験

SemIf は、オープンソースモデルから得たセマンティクスの**「if(もし)**概念を、ローカル環境で即座に検証できるウェブアプリケーションです。

  • バックエンド不要: すべての処理はブラウザ内で完結
  • 即時起動: モデルのダウンロードリスト待ちなし
  • 自己計測: GPU を使用して両手法の性能差をリアルタイムで測定可能

セットアップ:モデルのロードと準備

一度にモデルをメモリに読み込む手順です。

推奨モデル設定

ブラウザ上の制限やデバイスのスペックに合わせてモデルを選択してください。

  • デフォルト:
    MiniCPM5 2B
    (デスクトップ環境向け)
  • 推奨(スマートフォン・小型デバイス): **「Qwen3 0.6B」**に切り替え
    • モデルボックスから設定を変更してください

注意: より大きなモデルを選択すると、読み込みに時間がかかります。一部の低スペックデバイスでは起動しない可能性があります。

ロードプロセス

  1. ダウンロード/キャッシュ: 「ロード」ボタンクリック時に開始(Hugging Face 経由)。データはブラウザキャッシュに保存され、ページを離れても残ります。
  2. モデル読み込み: ダウンロードと初期化処理。
  3. ウォームアップ: 両手法(直接読み出し・生成)に対してコンパイルパスを実行し、性能を安定させます。

⚠️ 所要時間: 選択したモデルサイズやネットワーク環境、GPU の状況により、数分かかる場合があります。

計測指標について

表示される品質値は以下の基準に基づいています:

  • ネイティブチェックポイント: オリジナルおよび公開ベンチマークデータに基づく。
  • 自製列: 「均衡化精度」。
  • TypeSafe: 同じ 102 レコードからなるサブセットにおける大文字小文字不区分の同意率
  • Jev: 公表された値(参照)。

⚠️ 警告: ブラウザ内での量子化により、モデルの精度は変化します。


意思決定:2 つのパスで検証

同じ意思決定課題に対し、異なるアプローチで確率を確認します。

手法説明
Logits の直接読み取り「A…T」などの選択肢に対する確率を直接取得
トークンに基づく生成モデルに「{選択肢} + 確率」の形式で JSON 出力させる

パス A: 直接読み出し(デコードなし)

モデルが選択した際の生のスコア(Logits)を読み取り、提供された選択肢間でのみ正規化します。

  • ステータス: 実行待機
  • メトリクス表示:
    • トータル時間
    • インプット処理時間
    • アウトプット時間(1 回の読み出しのみ)

パス B: 生成(JSON 形式の確率分布)

モデルに対して、各選択肢の確率分布を JSON フォーマットで出力させる方法です。各トークンの到着経過も観察可能です。

  • ステータス: 実行待機
  • メトリクス表示:
    • 最初のトークン生成時間
    • トータル時間
    • インプット処理時間
    • アウトプット処理時間

GPU 上での実測壁時間比率

  • 実行順序: 両手法は並列ではなく順次実行されます(まず直接読み出し → その後生成)。
  • リソース争用なし: 同じモデルをロード済みであり、GPU リソースの競合が生じない設計です。

数値が示すこと・示さないこと

計測結果の解釈における重要なポイント:

  • 条件付き確率について

    • 直接スコアは、提示された選択肢のトークンに対してのみソフトマックスを適用したものです。
    • モデルが好むあらゆる回答を含んでいるわけではなく、校正された絶対的な信頼度を示すものではありません。
  • モデルティア分類

    • モバイル向けモデルは精度とサイズのトレードオフを行って設計されています。
    • MiniCPM
      はデスクトップ環境のデフォルトです。
    • 4B
      バージョンはメモリを多く必要とし、
      None
      オプションは Jev と同等であると保証されていません。
  • 実際のローカル計測時間

    • performance.now()
      を用い、以下の全工程で実測された値を表示しています:
      1. セットアップ
      2. ウォームアップ
      3. プロンプト準備
      4. 直接実行
      5. 最初の生成トークンの出力
      6. 生成完了
    • 事前に用意された結果は一切表示されません。
  • 量子化の影響

    • このデモは
      wllama
      を経由してピン付けされた
      GGUF
      ビルドを使用しています。
    • 量子化により、品質と速度の両方に影響を及ぼす可能性があります。

同じ日のほかのニュース

一覧に戻る →

2026/09/19 6:00

これまでに Claude.md が存在しない場合、Claude Code は現在 AGENTS.md を読み取るようになりました。

2026/09/19 3:51

さらに 100TB のメモリーを節約

## Japanese Translation: Cloudflare は、トラフィックの分散に常時ハッシュリング(consistent hashing)を処理する Pingora バックエンドルーターの一部である `pingora-ketama` コンポーネントの最適化により、メモリ使用量を成功裡に削減しました。変更前に、システムはサーバーごとに過剰なハッシュエントリを格納しており、コンプライアンスとキャッシュの必要性により数十個の別々のハッシュリングが生じる場合があり、一部のケースでは 6GB に達することもありました。統計解析により、サーバーあたりに単一のハッシュのみを使用すると深刻な不均衡(変動係数約 99%)が発生し、業界標準デフォルトはハッシュ数を約 160 としていることが示されました。数学的な導出により、32 ビット値に対して 10,000~100,000 ハッシュを超えると追加容量が限界に達し衝突リスクが増大することが確認されました。エンジニアは、サーバーごとの生成されるハッシュ数を 90% 削減しても分布誤差が大きくならないことが安全に確認できました。構造レベルでは、完全な構体(struct)全体を 8 バイトのインデックス(`u32`)と、4 バイトのハッシュを圧縮された生バイト配列形式に置き換えることで、エントリあたりのメモリ使用量を 25% 削減しました。新コードは、非公開の機能フラグを通じて段階的に導入され、旧バージョン(大リング)と新バージョン(小リング)が共存可能となっています。ロールアウトは小規模な検証ロケーションから始まり、グローバルなキャッシュ churn を回避し安全な移行を確保するよう層状に行われました。これらの変更により、サーバーあたりのハッシュ生成数を 90% 削減し、グローバルメモリ消費量を 100TB 以上削減することで、コスト効率、信頼性、ロールバックの安全性を向上させました。

2026/09/18 23:18

クラウドフレイク・クイックトンネル

## Japanese Translation: 本テキストは、アカウント、DNS 設定、または開放ポートを必要とせず、開発環境向けに安全なパブリック URL を瞬時に生成する強力なコマンドラインツールを紹介しています。Cloudflare のグローバルインフラストラクチャを活用することで、このソリューションは 335 都市以上に対応し、構築済みの TLS と DDoS 保護を備えた即時のアウトバウンド専用暗号化接続を提供します。このアプローチは、`npm run dev` などのツールのエンドポイントを一貫して共有しながら既存のコードベースを変更しないようにすることで、開発者のワークフローを簡素化します。 処理は約 3 秒で完了し、構造化された JSON(ホスト名、エッジロケーション、ヘルスステータスを含む)として URL をコンソールに直接印刷して簡単なパースを可能にします。重要なのは、これらのトンネルは一時的で、ホスティングプロセスが停止すると自動的に終了し、手動での片付けを必要としないことです。この設計により、シンプルな JSON ホスト名を用いて、Webhook(例:Stripe、GitHub)、コーディングエージェント、および人間によるブラウザからローカルサービスへとの統合を容易にします。最終的に、これは内部マシンを公開する際の課題を解決し、Anycast ルーティングを介して最近のエッジノードへと接続することで不要なオーバーヘッドなしに、プライベートの localhost アプリケーションとパブリックインターネットの間で効率的な橋渡しを提供します。