
2026/09/29 3:58
マイクロLLM ラブブラウザで7つの超小型LLMを試せ
RSS: https://news.ycombinator.com/rss
要約▶
日本語訳:
まとめ:
本システムでは、ブラウザセッション内での持続的なデコード速度と精度を測定することで AI モデルのパフォーマンスベンチマークを行い、すべてのデータがプライバシー保護された状態かつローカル環境で留まることを保証します。このアプローチは、外部の歴史的な基準値よりもリアルタイム評価を優先し、ユーザーのマシーン上で直接迅速な反復を可能にします。特に、テストフレームワークは、1.35 億パラメータ版のような小型モデルであっても特定のチェックで失敗するよう許容しており、限界を隠蔽せずに正確な機能報告を保証します。パフォーマンス推定値では、利用可能な場合、ユーザーの最新のトークン/秒(tps)値をデフォルトとして採用し、即時的な文脈を提供します。セキュリティと一貫性を確保するため、JavaScript 評価エンジンではページのカレントオリジン内で厳密に
eval() を使用し、外部コードの注入を防ぎつつ信頼性を維持します。モデルが評価されるにつれ、最新設定されたスイートに基づいてグラフが自動的に生成され、各ランのデコード済みテキスト出力に対する具体的なパフォーマンスを反映します。このローカリゼーションされた手法により、ベンチマークは直近の環境に厳密に紐づけられ、クラウドストレージやサーバーサイド履歴への依存を排除しつつ、現在の機能を透明視認可能にし、迅速かつプライバシー保護されたモデル比較を促進します。本文
LLM ベンチマーク評価ガイド
評価基準と方針
- 客観的評価優先: 生成テキストの質は評価対象外です。正規表現または正確なトークンの一致による判定のみを行います。
- エラー許容: モデルサイズが 135M であっても、失敗することは許容されます。その結果も測定値として記録されます。
- 推定モード: 「推定」オプションの場合、該当データが存在する場合は最後の tok/s(トークン/秒) 値を使用します。
取得される測定値
本ブラウザ上で実行された結果から以下の情報を取得し、数値はマシン上に保持されます。
- 速度指標
- トークン/秒 (tok/s)
- 持続可能なデコード速度
- スイート全体の壁時計時間
- 精度指標
- Objective テストへの合格率
データの表示とグラフ
- グラフには、各モデルに対応する最新のスイートが使用されます。
- 表示対象の情報:
- お名前またはハンドル
- デバイスおよびハードウェア情報
実装詳細:JavaScript ベンチマーク
- エディターの処理: JavaScript コードは、このオリジン内で
処理され実行されます。eval() - チェックの実行タイミング: 各チェックは、モデルによってデコードされたテキストに対して実行されます。
プロンプト設定
- 対象:より大きな大規模言語モデル (LLM)
- 形式:関数形式