マイクロLLM ラブブラウザで7つの超小型LLMを試せ

2026/09/29 3:58

マイクロLLM ラブブラウザで7つの超小型LLMを試せ

RSS: https://news.ycombinator.com/rss

要約▶

日本語訳:

まとめ:

本システムでは、ブラウザセッション内での持続的なデコード速度と精度を測定することで AI モデルのパフォーマンスベンチマークを行い、すべてのデータがプライバシー保護された状態かつローカル環境で留まることを保証します。このアプローチは、外部の歴史的な基準値よりもリアルタイム評価を優先し、ユーザーのマシーン上で直接迅速な反復を可能にします。特に、テストフレームワークは、1.35 億パラメータ版のような小型モデルであっても特定のチェックで失敗するよう許容しており、限界を隠蔽せずに正確な機能報告を保証します。パフォーマンス推定値では、利用可能な場合、ユーザーの最新のトークン/秒(tps)値をデフォルトとして採用し、即時的な文脈を提供します。セキュリティと一貫性を確保するため、JavaScript 評価エンジンではページのカレントオリジン内で厳密に

eval()
を使用し、外部コードの注入を防ぎつつ信頼性を維持します。モデルが評価されるにつれ、最新設定されたスイートに基づいてグラフが自動的に生成され、各ランのデコード済みテキスト出力に対する具体的なパフォーマンスを反映します。このローカリゼーションされた手法により、ベンチマークは直近の環境に厳密に紐づけられ、クラウドストレージやサーバーサイド履歴への依存を排除しつつ、現在の機能を透明視認可能にし、迅速かつプライバシー保護されたモデル比較を促進します。

本文

LLM ベンチマーク評価ガイド

評価基準と方針

  • 客観的評価優先: 生成テキストの質は評価対象外です。正規表現または正確なトークンの一致による判定のみを行います。
  • エラー許容: モデルサイズが 135M であっても、失敗することは許容されます。その結果も測定値として記録されます。
  • 推定モード: 「推定」オプションの場合、該当データが存在する場合は最後の tok/s(トークン/秒) 値を使用します。

取得される測定値

本ブラウザ上で実行された結果から以下の情報を取得し、数値はマシン上に保持されます。

  • 速度指標
    • トークン/秒 (tok/s)
    • 持続可能なデコード速度
    • スイート全体の壁時計時間
  • 精度指標
    • Objective テストへの合格率

データの表示とグラフ

  • グラフには、各モデルに対応する最新のスイートが使用されます。
  • 表示対象の情報:
    • お名前またはハンドル
    • デバイスおよびハードウェア情報

実装詳細:JavaScript ベンチマーク

  • エディターの処理: JavaScript コードは、このオリジン内で
    eval()
    処理され実行されます。
  • チェックの実行タイミング: 各チェックは、モデルによってデコードされたテキストに対して実行されます。

プロンプト設定

  • 対象:より大きな大規模言語モデル (LLM)
  • 形式:関数形式

同じ日のほかのニュース

一覧に戻る →

2026/09/29 5:23

ジェフ - ホームで学習した Jev 互換の 08B 意思決定モデル、約 30ms

## Japanese Translation: 「Jeff」スートは、**Qwen3.5**および**Gemma 4**アーキテクチャに基づく独立したファインチューニング済みモデルの集合であり、テキスト生成や外部パースなしで超高速なゼロショット分類を可能にします。これらの Apache 2.0 ライセンス付きモデル(NVIDIA GPU/PyTorch または Apple silicon MLX 経由の `uv` で入手可能)は、単一のフォワードパスで校正された確率を返し、ハイエンド消費者向けハードウェア上での意思決定時間は約**22–30ms**(より大きな独立したプロジェクトに比べて著しく高速)です。従来の手法とは異なり、TypeSafe Jev エコシステムとは互換性を持つが affiliated ではないリクエストフォーマットを用いて、ローカルコードに直接スロットリングします。ベンチマークでは、Jeff モデルが分類やグラウンディングタスクにおいて未トレーニングのベースモデルと同等かそれ以上に優ることが示されています(例:Jeff-Qwen3.5-2B のスコアは 83.1 で、Jev の 83.0 を上回っています)が、小さいパラメータ数においては推論能力には限界があります。重要な点は、成功は特定のプロンプトフォーマットに依存しており(標準的な Jev プロンプトでは機能せず、結果の文言を明記する必要がある)、選択肢の構造が一貫していることです。このスートは軽量パイプライン向けの展開で独自の利点を提供し、一部のバリエーションはファインチューニングを通じて特定のゲーム様態タスクにおいてより大きなモデルを上回るパフォーマンスを示しますが、開発者は 2B バリエントにおける潜在的なリスク回避傾向や、高いベンチマークスコアが必ずしもプレイアビリティの信頼性を保証するわけではないという注意点に対処する必要があります。

2026/09/26 19:16

12,000年前のゲベクレテペ墓から分骨の謎が解明された

## Japanese Translation: 考古学者は、トルコの Göbeklitepe における埋葬慣行を解明し、先陶器新石器時代 B 期(紀元前 8700–8000 年頃)に属する未発掘の地下 2 つの埋葬を検出しました。Burial 1 は、L09-65 トレンチ内の長方形建物の床下に発見され、少なくとも 3 名の遺骸が含まれていました:女性(35 歳以上)、男性(20–30 歳)、少女(11–14 歳)。Burial 2 は DR1 トレンチに位置し、左側を向いて屈曲した東向きで寝ている 20–30 歳の青年女性でした。どちらの埋葬も切断痕、熱損傷、またはオクロを使用していない点で特徴的であり、骨は齧歯類による咬み跡および圧力あるいは石灰質堆積物による骨折を示していました(これらは Burial 2 の大部分を破片化しました)。これらの通常の床下墓は後に土壌移動や斜面崩壊によって乱され、緩い骨の断片が斜面を下ってモニュメンタルな建物へと運ばれました。このプロセスは、1995 年以来回収された数百個の散在する断片(単独の頭蓋を含む)を説明し、遺骸の混雑が単一の異常な儀式の結果ではなく、主に自然な移動によるものであることを示しています。これにより多くの証拠の説明が可能となりますが、以前の意図的な頭蓋変形や頭蓋骨断片のより高い比率は、一部の個人が依然として特別扱いを受けたことを示しており、複数の慣習が共存していた可能性が高いです。これらの発見は Göbeklitepe の新石器時代埋葬伝統の解釈を再構築させ、研究者が各断片が独特な儀式に属するとは見なすことなく人口動態パターンを再構築することを可能にします。今後の研究では、直接年代測定と詳細な骨分析を通じてこれらの異なる慣行が発生した時期を特定することに焦点を当てます(PloS One, 2026 年発表)。

2026/09/29 5:18

World Labs が AMD に加入する

## Japanese Translation: AMD は World Labs を取得するための確定的合意を締結し、CEO の Lisa Su 博士の下で新しい画期的研究組織を立ち上げることになりました。Fei-Fei Li 博士は執行副社長兼首席科学者として加わります。Justin Johnson と Ben Mildenhall が率いる統合チームは、World Labs の AI エコシステム(ソフトウェア、ハードウェア、ファウンデーションモデル、アプリケーション)を、AMD GPU 上でのモデルトレーニングおよび推論の最適化に焦点を当てた既存の技術パートナーシップと統合します。2024 年に設立された World Labs は、取引が 2026 年末までに完了する前に(規制当局による承認と慣用的条件に準じて)、その資源を AMD と統合し、世界トップクラスの画期的研究組織を創出します。主たる目標は、ハードウェア、ソフトウェア、プラットフォーム、ならびに多様な業界向けに広く利用可能なオープンモデルを含むエンドツーエンドのオープン AI エコシステムの構築です。この戦略的施策により、AMD は包括的な AI ソリューションを提供する統一されたプロバイダーとしての地位を確立し、オープンソースインフラにも進出すると同時に、最適化および研究における共有専門知識を通じて高度な AI 機能の利用可能性をより広く高めます。

マイクロLLM ラブブラウザで7つの超小型LLMを試せ | そっか~ニュース