
2026/08/11 2:22
Show HN:スマホ、ウェアラブル、スマートホーム、ロボット向け 14MB のエージェント型 LLM「Needle2」
RSS: https://news.ycombinator.com/rss
要約▶
Japanese Translation:
最大の進歩は、GPU を備えていない低コストのエッジデバイスに特化して設計された 4500 万パラメータのオープンソース AI モデル「Needle 2」のリリースです。Cactus Quants によるロスレスな 2 ビット量子化を施され、単一の 14MB バイナリとして圧縮されており、完全なセッションには 28MB の RAM しかな必要ありません。これにより、ESP32-S3 などのマイクロコントローラーや、200 ドル未満のスマートフォン(例:Samsung A シリーズ)へのデプロイが可能になります。技術的には、Needle 2 は Simple Attention Network を Walsh-Hadamard 変換およびハッシュ化された n-gram テーブルと組み合わせており、GPU や NPU ハードウェア、そして常時インターネット接続を必要とせずに Cortex-M から x86 にわたる多様な CPU アーキテクチャ上で決定論的に動作します。ベンチマーク結果では、大規模なモデル(例:FunctionGemma 270M、LFM2.5 230M)に対して劣位に留まりながら、5 倍から 70 倍も少ないパラメータ数で動作し、VR デバイス上で最大 1,500 トークン/秒、Raspberry Pi 5 上で 500 トークン/秒のデコード速度を実現しています。本モデルは学習された信頼スコアを用いてオフトピックなリクエストをクラウドにエスカレートさせつつ、日常的な制御アクションはプライベートかつオフラインで処理する「Edge-Cloud Collaboration」をサポートします。Apache 2.0 ライセンスの下、Hugging Face で重み情報が公開されており、Needle 2 はロボティクスやウェアラブルデバイスなどの産業が予算に優しいデバイス上で高度なツール呼び出し機能を活用することを可能にし、アクセスしやすくローカルな人工知能への転換において決定的な一歩を遂げることを意味します。
本文
Needle 2:オンデバイス AI の新基準となるオープンソースモデル
本日は、ツール呼び出し・デバイス利用・構造化抽出を備えたオープンソースモデル**「Needle 2」**を発表します。
モデルの概要と性能
- 軽量設計:
- 模型全体はわずか 14MB のバイナリファイルで構成され、実行時には最大 28MB の RAM を使用して完結します。
- 「Simple Attention Network(単一注意ネットワーク)」 の研究成果に基づいて構築されています。
- 「Cactus Quants」 によって独自エンジンに統合された CQ2 ビット圧縮技術を採用しています。
- ベンチマーク性能:
- FunctionGemma 270M、LFM2.5 230M、Apple FM などの小規模モデルと競合し、パラメータ数で 5〜70 倍 少ない条件下でも高い精度を発揮します。
- 動作環境(速度・メモリ):
- Raspberry Pi 5: 秒間 500 トークン。
- VR デバイス (Meta Quest 3S / Apple Vision Pro): 400〜1,500 トークン/秒。
- 廉価スマートフォン (Samsung A シリーズなど 200 ドル未満): 300〜700 トークン/秒。
- マイコン (ESP32-S3 等): ピーク RAM 使用量が約 28MB で軽量なため動作可能です。
主要な仕様と技術的特徴
評価方法:順序厳密完全一致
データセット(Google 評価分割、961 ロウ)を使用。Mobile-Actions- 総パラメータ数に対する最も軽量なスマートデバイス向けモデルとの比較を実施。
エンジンの仕組み
- 独自アーキテクチャ: 「Simple Attention Network」を採用し、モデルウェイトは Hugging Face にアップロードされています。
- Apache 2.0 ライセンスで公開されており、GitHub リポジトリからすぐに動作環境を構築できます。
ロスレス 2 ビット量子化 (CQ2)
- Needle 2 は事後量子化(ポスト・ホック・クアンタイズション)を行わず、プレトレーニング時からポストトレーニング時まで Cactus Quants(CQ2 ビット) で学習・トレーニングされます。
- ウェイト、活性化関数、KV キャッシュすべてを CQ2 ビットで管理することで、バッテリー消費を最小限に抑えつつ 14MB に圧縮します。
エッジ・クラウド協調
- 小規模モデルの限界に対し、「できない」と明言する設計です。
- 応答には学習された信頼スコアが伴い、話題から逸れるリクエストには空の呼び出しを返します。
- 設定された閾値を超えない場合は再質問またはクラウドへのエスカレーションへ移行し、デフォルト経路はプライベート・即時・無料のまま維持されます。
設計理念:200 ドル未満デバイスへのオンデバイス AI 普及
- 真のエッジとは: Mac や PC ではなく、安価なハードウェア(IoT、新興国向けスマートフォン、予算型スマホ、マイコン、ウェアラブル)を指します。
- 接続されている IoT デバイス:約 210 億台
- PC:約 15 億台
- ターゲット: エッジデバイスの約 4/5 は 200 ドル以下のコストです(GPU/NPU 不要、RAM は数百 MB)。
- 関数呼び出しの再定義:
- 照明点灯など既存デバイスの機能は「型付けされたパラメータを持つ関数」と見なせます。
- 困難なのは文章を関数にマッピングすることであり、これには数十億パラメータではなく、4500 万パラメータでも十分です。
抽出と構造化された出力
- スキーマ即インタフェース: ドキュメント処理にも適用可能な枠組みです。
- スキーマと段落を入力 → 型付けされたフィールドを返す。
フィールドは分類器として機能。Enum
フィールドは単一の呼び出しでリストを収集。Array
- 強制された契約:
- 各ターンは「呼び出しエンベロープ」で応答し、空の呼び出しは拒絶を表します。
- 宣言されたスキーマからコンパイルされたバイトレベルの文法により、すべてのトークンが制約を受けます。
効率性とエンジン速度(計算しないことで得られるもの)
- メモリ効率:
- ウェイトは RAM に展開されず、2 ビットコードはベクトルレジスタ内で展開されます。
は最小限に抑えられ、算術パスは全てresidents メモリ
一貫性を保ちます。int8
- 計算コストの削減:
- 1 トークンあたりの FLOPs: Needle(87 MFLOPs)は従来のトランスフォーマー(164 MFLOPs)より半分以下です。
- 1 トークンあたりのバイト数: 構造トークンにおいて辞書空間の投影から最大 98% をスキップします。
- 結果: バッテリー寿命の向上。高級スマートフォンにおいても、常時オンアシスタントとしての電力予算内に収まります(比較対象より 1 トークンあたり 7〜85 倍少ないエネルギー消費)。
評価とベンチマーク結果
評価基準:順序厳密完全一致
- 関数名・呼び出し順序・引数値がすべて一致する場合のみ「通過」と判定されます。
- 緩和なしの生産環境設定(shipped C++ エンジン)での測定です。
ベンチマーク結果サマリー
| 評価項目 | 詳細と結果 |
|---|---|
| Google Mobile Actions | 順序厳密完全一致;関数名、順序、引数がすべて一致する必要がある。 |
| Android インテンツ風 | 1 回呼び出し行 、2 回呼び出し行 。多数の候選ツールリストを持ちつつ、スキーマの一般化をテスト。 |
| 汎用関数呼び出し (FunctionGemma 比較) | 6 倍大きいモデルと比較しても1 ポイント以内に収まり、全 3,641 ロウで 93.4% の良好な形成率を維持。 |
| BFCL v4 シングルターン | 全体の収集者重み付け平均スコア。 太字の値が各カテゴリでの最良の結果を示します。 |
アシンメトリーについて(比較対象との公平性)
- 精度: 対照実験は意図的に
に留めます(2 ビット量子化の影響を排除するため)。これは Needle に有利な条件です。f16 - 範囲: Needle はエージェント向けに特化し、他方はチャット/世界知識の汎用モデルです。これも Needle に有利な条件です。
- 結論: 両者を公平にする方法がないため、上記のアシンメトリーを受け入れ、「オンデバイスの予算内で正しくツール呼び出しを実行するか」という問いに答えます。
Mac/PC での微調整 (Fine-tuning) と生産性
- 独自ツールの学習:
- 製品固有のツール語彙に対して、4500 万パラメータモデル自体を再トレーニング可能です。
- Python パッケージを利用し、自社のコンピュータで数分〜数時間以内に微調整・テストできます。
- オンデバイス実行環境:
- Pebble(ウェアラブル機器業界のパイオニア)は「Index 01 アプリ」でローカル Needle を実行し、ネット接続なしで音声リクエストをアクションに変換します。
- 画面のない
でも、ネットワーク有無にかかわらず常にアクションが発生します。Pebble Index Ring
アーキテクチャの詳細:Simple Attention Network
- 更新規則:
: RMS ノルマライズされたリジダルフロー(4 つ)。x̂
: 固定正規直交 Walsh-Hadamard 変換(重みを伴わずH
の時間で適用)。n log n
: ハッシュされた n-gram テーブルから収集。(kᵢ, vᵢ)
: シンカーノ反復法で計算される確率的ノルマライズ。P
- 学習済みコンポーネント:
,a
,b
およびすべてのg
は入力に依存します。σ ゲート- 注意機構と MLP のリジダルフローはサンドイッチ正規化されゲート化されています。
- 推論プロセス:
- エングラムサイトは 2 つの層で発火し、デコードはバイトレベル文法で制約されます。
: 固定された Walsh 変換と学習済み対角行列を使用し、チャンネルミキシングコストを実質的にゼロに抑えます。Hadamard MLP
メモリスシステム設計
- 有界セッションメモリ:
- スライディングウィンドウ(256 トークン)により、KV キャッシュのサイズが制限されます。
- システムプロンプトとツール宣言は恒久的なシンクとしてピン留めされ、情報の忘れを防ぎます。
- 解耦された品質とデプロイ:
- 1 つのトレーニング済みモデルを使いながら、ターゲットデバイスの許容精度に合わせて最適化されます(キャッシュ自体は QAT で学習)。
効率的なバイナリ設計
- ユニバーサルバイナリ: 起動時に CPU を探査し、SDOT/NEON/AVX2/RISC-V/wasm SIMD などに応じて自己選択します。
- スレッドプール: トークンの直列処理で待機せず巡回するため、デコード速度が向上します。
動作環境とライセンス
- プラットフォーム: Raspberry Pi 5, Meta Quest 3S, Apple Vision Pro, Samsung A シリーズ、ESP32-S3 など。
- アーキテクチャ対応: Cortex-M (M4/M7/M55) から x86、WebAssembly まで動作します(インストール不要)。
- ライセンス: Apache 2.0。