Show HN:スマホ、ウェアラブル、スマートホーム、ロボット向け 14MB のエージェント型 LLM「Needle2」

2026/08/11 2:22

Show HN:スマホ、ウェアラブル、スマートホーム、ロボット向け 14MB のエージェント型 LLM「Needle2」

RSS: https://news.ycombinator.com/rss

要約

Japanese Translation:

最大の進歩は、GPU を備えていない低コストのエッジデバイスに特化して設計された 4500 万パラメータのオープンソース AI モデル「Needle 2」のリリースです。Cactus Quants によるロスレスな 2 ビット量子化を施され、単一の 14MB バイナリとして圧縮されており、完全なセッションには 28MB の RAM しかな必要ありません。これにより、ESP32-S3 などのマイクロコントローラーや、200 ドル未満のスマートフォン(例:Samsung A シリーズ)へのデプロイが可能になります。技術的には、Needle 2 は Simple Attention Network を Walsh-Hadamard 変換およびハッシュ化された n-gram テーブルと組み合わせており、GPU や NPU ハードウェア、そして常時インターネット接続を必要とせずに Cortex-M から x86 にわたる多様な CPU アーキテクチャ上で決定論的に動作します。ベンチマーク結果では、大規模なモデル(例:FunctionGemma 270M、LFM2.5 230M)に対して劣位に留まりながら、5 倍から 70 倍も少ないパラメータ数で動作し、VR デバイス上で最大 1,500 トークン/秒、Raspberry Pi 5 上で 500 トークン/秒のデコード速度を実現しています。本モデルは学習された信頼スコアを用いてオフトピックなリクエストをクラウドにエスカレートさせつつ、日常的な制御アクションはプライベートかつオフラインで処理する「Edge-Cloud Collaboration」をサポートします。Apache 2.0 ライセンスの下、Hugging Face で重み情報が公開されており、Needle 2 はロボティクスやウェアラブルデバイスなどの産業が予算に優しいデバイス上で高度なツール呼び出し機能を活用することを可能にし、アクセスしやすくローカルな人工知能への転換において決定的な一歩を遂げることを意味します。

本文

Needle 2:オンデバイス AI の新基準となるオープンソースモデル

本日は、ツール呼び出し・デバイス利用・構造化抽出を備えたオープンソースモデル**「Needle 2」**を発表します。

モデルの概要と性能

  • 軽量設計:
    • 模型全体はわずか 14MB のバイナリファイルで構成され、実行時には最大 28MB の RAM を使用して完結します。
    • 「Simple Attention Network(単一注意ネットワーク)」 の研究成果に基づいて構築されています。
    • 「Cactus Quants」 によって独自エンジンに統合された CQ2 ビット圧縮技術を採用しています。
  • ベンチマーク性能:
    • FunctionGemma 270M、LFM2.5 230M、Apple FM などの小規模モデルと競合し、パラメータ数で 5〜70 倍 少ない条件下でも高い精度を発揮します。
  • 動作環境(速度・メモリ):
    • Raspberry Pi 5: 秒間 500 トークン。
    • VR デバイス (Meta Quest 3S / Apple Vision Pro): 400〜1,500 トークン/秒。
    • 廉価スマートフォン (Samsung A シリーズなど 200 ドル未満): 300〜700 トークン/秒。
    • マイコン (ESP32-S3 等): ピーク RAM 使用量が約 28MB で軽量なため動作可能です。

主要な仕様と技術的特徴

評価方法:順序厳密完全一致

  • Mobile-Actions
    データセット(Google 評価分割、961 ロウ)を使用。
  • 総パラメータ数に対する最も軽量なスマートデバイス向けモデルとの比較を実施。

エンジンの仕組み

  • 独自アーキテクチャ: 「Simple Attention Network」を採用し、モデルウェイトは Hugging Face にアップロードされています。
  • Apache 2.0 ライセンスで公開されており、GitHub リポジトリからすぐに動作環境を構築できます。

ロスレス 2 ビット量子化 (CQ2)

  • Needle 2 は事後量子化(ポスト・ホック・クアンタイズション)を行わず、プレトレーニング時からポストトレーニング時まで Cactus Quants(CQ2 ビット) で学習・トレーニングされます。
  • ウェイト、活性化関数、KV キャッシュすべてを CQ2 ビットで管理することで、バッテリー消費を最小限に抑えつつ 14MB に圧縮します。

エッジ・クラウド協調

  • 小規模モデルの限界に対し、「できない」と明言する設計です。
  • 応答には学習された信頼スコアが伴い、話題から逸れるリクエストには空の呼び出しを返します。
  • 設定された閾値を超えない場合は再質問またはクラウドへのエスカレーションへ移行し、デフォルト経路はプライベート・即時・無料のまま維持されます。

設計理念:200 ドル未満デバイスへのオンデバイス AI 普及

  • 真のエッジとは: Mac や PC ではなく、安価なハードウェア(IoT、新興国向けスマートフォン、予算型スマホ、マイコン、ウェアラブル)を指します。
    • 接続されている IoT デバイス:約 210 億台
    • PC:約 15 億台
  • ターゲット: エッジデバイスの約 4/5 は 200 ドル以下のコストです(GPU/NPU 不要、RAM は数百 MB)。
  • 関数呼び出しの再定義:
    • 照明点灯など既存デバイスの機能は「型付けされたパラメータを持つ関数」と見なせます。
    • 困難なのは文章を関数にマッピングすることであり、これには数十億パラメータではなく、4500 万パラメータでも十分です。

抽出と構造化された出力

  • スキーマ即インタフェース: ドキュメント処理にも適用可能な枠組みです。
    • スキーマと段落を入力 → 型付けされたフィールドを返す。
    • Enum
      フィールドは分類器として機能。
    • Array
      フィールドは単一の呼び出しでリストを収集。
  • 強制された契約:
    • 各ターンは「呼び出しエンベロープ」で応答し、空の呼び出しは拒絶を表します。
    • 宣言されたスキーマからコンパイルされたバイトレベルの文法により、すべてのトークンが制約を受けます。

効率性とエンジン速度(計算しないことで得られるもの)

  • メモリ効率:
    • ウェイトは RAM に展開されず、2 ビットコードはベクトルレジスタ内で展開されます。
    • residents メモリ
      は最小限に抑えられ、算術パスは全て
      int8
      一貫性を保ちます。
  • 計算コストの削減:
    • 1 トークンあたりの FLOPs: Needle(87 MFLOPs)は従来のトランスフォーマー(164 MFLOPs)より半分以下です。
    • 1 トークンあたりのバイト数: 構造トークンにおいて辞書空間の投影から最大 98% をスキップします。
  • 結果: バッテリー寿命の向上。高級スマートフォンにおいても、常時オンアシスタントとしての電力予算内に収まります(比較対象より 1 トークンあたり 7〜85 倍少ないエネルギー消費)。

評価とベンチマーク結果

評価基準:順序厳密完全一致

  • 関数名・呼び出し順序・引数値がすべて一致する場合のみ「通過」と判定されます。
  • 緩和なしの生産環境設定(shipped C++ エンジン)での測定です。

ベンチマーク結果サマリー

評価項目詳細と結果
Google Mobile Actions順序厳密完全一致;関数名、順序、引数がすべて一致する必要がある。
Android インテンツ風1 回呼び出し行
n=154
、2 回呼び出し行
n=24

多数の候選ツールリストを持ちつつ、スキーマの一般化をテスト。
汎用関数呼び出し (FunctionGemma 比較)6 倍大きいモデルと比較しても1 ポイント以内に収まり、全 3,641 ロウで 93.4% の良好な形成率を維持。
BFCL v4 シングルターン全体の収集者重み付け平均スコア。
太字の値が各カテゴリでの最良の結果を示します。

アシンメトリーについて(比較対象との公平性)

  • 精度: 対照実験は意図的に
    f16
    に留めます(2 ビット量子化の影響を排除するため)。これは Needle に有利な条件です。
  • 範囲: Needle はエージェント向けに特化し、他方はチャット/世界知識の汎用モデルです。これも Needle に有利な条件です。
  • 結論: 両者を公平にする方法がないため、上記のアシンメトリーを受け入れ、「オンデバイスの予算内で正しくツール呼び出しを実行するか」という問いに答えます。

Mac/PC での微調整 (Fine-tuning) と生産性

  • 独自ツールの学習:
    • 製品固有のツール語彙に対して、4500 万パラメータモデル自体を再トレーニング可能です。
    • Python パッケージを利用し、自社のコンピュータで数分〜数時間以内に微調整・テストできます。
  • オンデバイス実行環境:
    • Pebble(ウェアラブル機器業界のパイオニア)は「Index 01 アプリ」でローカル Needle を実行し、ネット接続なしで音声リクエストをアクションに変換します。
    • 画面のない
      Pebble Index Ring
      でも、ネットワーク有無にかかわらず常にアクションが発生します。

アーキテクチャの詳細:Simple Attention Network

  • 更新規則:
    • : RMS ノルマライズされたリジダルフロー(4 つ)。
    • H
      : 固定正規直交 Walsh-Hadamard 変換(重みを伴わず
      n log n
      の時間で適用)。
    • (kᵢ, vᵢ)
      : ハッシュされた n-gram テーブルから収集。
    • P
      : シンカーノ反復法で計算される確率的ノルマライズ。
  • 学習済みコンポーネント:
    • a
      ,
      b
      ,
      g
      およびすべての
      σ ゲート
      は入力に依存します。
    • 注意機構と MLP のリジダルフローはサンドイッチ正規化されゲート化されています。
  • 推論プロセス:
    • エングラムサイトは 2 つの層で発火し、デコードはバイトレベル文法で制約されます。
    • Hadamard MLP
      : 固定された Walsh 変換と学習済み対角行列を使用し、チャンネルミキシングコストを実質的にゼロに抑えます。

メモリスシステム設計

  • 有界セッションメモリ:
    • スライディングウィンドウ(256 トークン)により、KV キャッシュのサイズが制限されます。
    • システムプロンプトとツール宣言は恒久的なシンクとしてピン留めされ、情報の忘れを防ぎます。
  • 解耦された品質とデプロイ:
    • 1 つのトレーニング済みモデルを使いながら、ターゲットデバイスの許容精度に合わせて最適化されます(キャッシュ自体は QAT で学習)。

効率的なバイナリ設計

  • ユニバーサルバイナリ: 起動時に CPU を探査し、SDOT/NEON/AVX2/RISC-V/wasm SIMD などに応じて自己選択します。
  • スレッドプール: トークンの直列処理で待機せず巡回するため、デコード速度が向上します。

動作環境とライセンス

  • プラットフォーム: Raspberry Pi 5, Meta Quest 3S, Apple Vision Pro, Samsung A シリーズ、ESP32-S3 など。
  • アーキテクチャ対応: Cortex-M (M4/M7/M55) から x86、WebAssembly まで動作します(インストール不要)。
  • ライセンス: Apache 2.0。

同じ日のほかのニュース

一覧に戻る →

2026/08/10 19:10

Muse Glimmer:常時稼働型ローカルエージェントワークフローに最適化された 30 バラマイトモデル

## 日本語翻訳: 以下に、キーポイントリストに含まれていた欠落した事実的詳細を取り込みつつ、明確さと流れを維持し、ソース資料の包括的な表現を確保する改良されたサマリーを提示します。 ## 改良されたサマリー: Meta は、標準的な消費者向けハードウェアでの高性能で常時稼働可能なローカルエージェントワークフローに特化するように設計された、300 億パラメータを持つ AI モデル「Muse Glimmer」を正式にオープンソース化しました。このモデルは Apache 2.0 ライセンスの下でリリースされており、Meta の大型の Muse Spark チェリーターからの新型ディストリルションレシピと、コンパクトなアーキテクチャを通じて、ハードウェア制約と能力をバランスさせることで、インターネット接続なしで完全オフラインでの高度なタスク(関数呼び出し、ローカルコーディング、LLM-as-a-judge 評価など)の遂行を可能にします。モデルは 100 語以上の言語をサポートし、認識エンコーダーによるマルチモーダル入力を備えています。 MacBook M4-Max、M5-Max、RTX 5090(24 GB または 32 GB の VRAM)など、デバイス上での流れるようなリアルタイム相互作用を確保するために、モデルは重みを 20 GB 未満に圧縮する 4 ビット量子化を採用しています。推論はさらに加速され、DFlash ベースの「drafter」モデルを使用してスペキュレティブデコーディングが行われます。このドラフトモデルは並列でトークンブロックを提案し、それを検証します。Muse Glimmer は DeepSearch QA、MCP-Atlas、𝛕-Bench、SWE-Bench などのベンチマークで強靭なパフォーマンスを発揮し、Gemma4-31B や Qwen3.6-27B を上回っています。 開発リソースは Hugging Face で公開されており、llama.cpp、MLX、ExecuTorch、Ollama、LM Studio、Unsloth、Together AI などを含むフレームワーク向けの最適化された統合が順次導入される予定です。モデルのトレーニングは 3 つのフェーズ(事前学習:ログイットディストリルテーション、中盤学習:より長いコンテキストとエージェント主体のデータ、事後学習:オンポリシーディストリルテーションおよび強化学習を用いた SFT)で行われました。これらの取り組みは、複雑なコーディングおよび評価シナリオにおけるアクセシブルなローカル AI 実行のエコシステムを大幅に拡張します。

2026/08/11 5:20

イリノイ州が、Linux を年齢確認義務の対象とする法律を可決しました。

## Japanese Translation: イリノイ州は HB5511(公共法 104-0664)を制定し、主要なソーシャルメディアプラットフォームおよびオペレーティングシステムプロバイダーを対象とした厳格な法律を施行することで、オンライン上の未成年者の保護を図っています。同法案は段階的に適用され、2028 年 1 月より発効します。この立法により、18 歳未満の利用者に対してデフォルトの保護措置が適用されます。具体的には、アルゴリズムに基づくフィードの禁止、午後 10 時から翌日午前 7 時までの通知制限、大人の不特定多数からの連絡遮断が含まれます。2028 年までに、OS ベンダーおよびアプリストアは必須の年齢申告手順を実施し、利用者の年齢層(13 歳未満、13〜15 歳、16〜17 歳、または 18 歳以上)を表す暗号化された API シグナルを提供する必要があります。「未成年」という年齢層が受信されると、これらの安全デフォルトが自動的に適用されます。コロラド州やカリフォルニア州の法律とは異なり、HB5511 はオープンソースソフトウェアプロジェクトに対する**免責条項を設けていない**ため、GitHub に代表されるコミュニティ運営または非営利のコードリポジトリにも適用されます。執行はイリノイ州司法長官に独占されており、個人による私的訴訟は禁止されています。法案本文では、過失による違反については影響を受けた子供 1 人あたり民事罰が 2,500 ドル、故意な違反については 7,500 ドルと上限が定められていますが、プリッツカー知事のプレスリリース当初には最高 50,000 ドルというより高い罚款が言及されており、本文では完全に調整されていない不一致が生じています。

2026/08/11 3:12

GPU 上の Rust SIMD

## Japanese Translation: VectorWare は、既存の CPU コードを書き換えずに、Rust の SIMD 抽象化(例:`core::simd`)を用いて高パフォーマンスな GPU アプリケーションを実行することを開発者にもたらす技術であり、この分野における世界初です。この画期的な成果は、標準的なスレッディングの概念を NVIDIA GPU ワープロップに直接マッピングし、手書きの PTX と比較して零のオーバヘッドを実現します(例えば、通常の `fn main` に `#![feature(portable_simd)]` を付与したソースコードで)。これは、内部の Rust ベースの中間表現(IR)を活用することで可能になっています。システムは要素ごとの算術演算、レーンマスクを生成する比較、それらによる選択操作、およびレーンをまたぐ水平型削減をサポートします。さらに、ワープロンプログラミングのための決定論的なテストを確保し、CPU デバッグツールに匹敵する信頼性を提供する専用参照インタプリタも実装されています。現在では NVIDIA ハードウェア向けに最適化されていますが、アーキテクチャ非依存の IR は、AMD のウェーブフロントおよび Vulkan サブグループ向けにも設計されています。今後の開発では、GPU 向けのスレッド合成や非同期操作の実装、また行列形状の SIMD をテンザコアへの変換(ローリング)が焦点となります。この進展により、業界ユーザーは新たなベクトル型を導入したり膨大なコード書き換えを伴う高コストなアプローチをとらずとも、要素ごとの算術演算と削減を効率的に活用することができます。ただし、制約としては、ベクトル幅の不一致(例:CPU の柔軟な N 対 GPU の固定 32/64 レーン)、およびハードウェアパターンと一致しない跨レーン操作におけるパフォーマンスコストが含まれます。