bonsai 2 27B:サイズが 9 倍小さくても損失のない圧縮を実現

2026/09/18 6:13

bonsai 2 27B:サイズが 9 倍小さくても損失のない圧縮を実現

RSS: https://news.ycombinator.com/rss

要約

日本語翻訳:

PrismML は、Qwen3.8 27B をベースとした現時点で最も高性能なモデルである Ternary Bonsai 2 27B をリリースしました。このモデルは、NVIDIA RTX 5090(最大 143 トークン/秒)や Apple M5 Max(46.8 トークン/秒)のようなコンシューマー向けハードウェアでの効率的なデプロイを目的として設計されています。モデルは{-1, 0, +1}の値を持つトライナリ重みと FP16 グループ別スケーリングを採用しており、フルプレシジョン版よりも 5.9GB のフットプリントで 9 倍以上小さく、かつ論理推論、数学、コーディング、指示に従うこと、ビジョン、エージェント型ツールの使用にわたる総合ベンチマークスコア(83.9 ポイント)において Qwen3.8 27B の 98.2% を達成しています。

262K トークンのコンテキストウィンドウとテキストおよび画像入力のネイティブサポートを備えた改良されたアーキテクチャに基づいた Ternary Bonsai 2 は、論理推論、コーディング、マルチモーダルワークフローにおいて強力なパフォーマンスを発揮しながら、通常誤差が累積しやすい領域でフルプレシジョンの能力を保持します。CUDA を通じて NVIDIA GPU や MLX を通じて Apple デバイス上で動作し、カスタムロービットカーネルを活用することで、小型モデルに比べエネルギー効率(RTX 4090 で 0.714 mWh/トークン)が優れており、運用コストを大幅に削減します。Apache 2.0 ライセンスの下でリリースされており、今日から完全な重みとホワイトペーパーが利用可能です。カリフォルニア工科大学の研究者らによって設立され、Khosla Ventures、Cerberus、Google の支援を受けた PrismML では、contact@prismml.com で連絡し、チーム協力によるモデルの適応化をサポートしています。

本文

Bonsai 2 27B(Ternary Bonsai 2):ローカルのための高性能低ビット化モデルを発表

概要

本日発表された**「Ternary Bonsai 2 27B」**は、前作の Bonsai 27B をさらに進化させた高性能モデルです。以下の主要な特徴を備えています。

  • 基盤モデル: Qwen3.8 27B を採用し、論理推論、コーディング、ビジョン、エージェンシー能力を大幅に強化。
  • ローカル最適化: Bonsai シリーズの核となる小型メモリフットプリント高いローカルスループット、および優れたエネルギー効率を維持。
  • 低ビット表現技術:
    • 全層で{-1, 0, +1}の三値化(Terinary)重みを採用。
    • FP16 グループごとのスケールリングを適用。
    • 実効ビット数: 1 重みあたり 1.76 ビット。
    • 総モデルサイズ: 5.9GB(非常にコンパクト)。
  • 多模態・コンテキスト対応:
    • コンテキストウィンドウ:最大 262,000 トークン
    • 入力形式: テキストと画像のマルチモーダル対応。
  • ライセンス: Apache 2.0 ライセンス。

性能維持率:ロスレスな圧縮の限界を突破

フル精度バージョンと比較した際の驚異的な性能保持率です。

メトリック数値意義
モデルサイズ9 倍以上小さいローカルデバイスのメモリ負荷を劇的に低減
総合ベンチマーク維持率98.2%単なる削減ではなく、実用レベルでの「解き」を実現

この性能保持率は、特に以下の領域において重要です。

  • コーディングエージェント: エラーの蓄積を防ぎ、多数ステップを要するタスクで安定動作。
  • ツール利用・マルチモーダルワークフロー: 外部リソースとの連携における劣化防止。
  • 長期タスク: 思考モードにおける一貫性の確保。

「知性密度」の飛躍的向上

図 II に示す通り、Ternary Bonsai 2 27B は「単位 GB あたりの能力(知性密度)」において他のモデルと比べ際立った外れ値を記録しています。従来の低ビット化アプローチがコーディングやビジョンなどで能力を犠牲にしがちでしたが、本モデルは高い能力」と「低いメモリ使用量」の両方のフロンティアを拡張しました。


第 1 回 Bonsai 27B から主な変化

前代(Bonsai 27B)が「ローカルでの実行可能性」を示したマイルストーンだったのに対し、本作は「現実世界のアプリ品質とランタイム性能」への進化を遂げています。

具体的な改善点

  • 基盤モデルの強化: Qwen3.8 27B というより強力なベースを使用。
  • 能力維持率向上: フル精度モデルに対する総合スコア保持率が**95% から 98.2%**へ向上。
  • 特定タスクでの性能改善:
    • 論理推論・数学
    • コーディング・指令従順性
    • ビジョン処理
    • 長期的なエージェンシータスク

ベンチマークスコア(合計)

  • Ternary Bonsai 2 27B: 83.9
  • フル精度 Qwen3.8 27B: 100%(基準)
    • 総合性能の 98.2% を維持しています。
    • 詳細はホワイトペーパーを参照のこと。

思考モードにおけるベンチマークスコア比較
Ternary Bonsai 2 27B は、フル精度モデル(Qwen3.8 27B)およびベースライン(Qwen3.6 27B)と比較しても遜色ないスコアを記録。特にコーディングやツール利用といった複雑なタスクにおいて劣化なしの性能を発揮しています。


デモ:ローカル環境でのコーディングエージェント

NVIDIA GeForce RTX 5090搭載環境での動作デモです。

Ternary Bonsai 2 27B を採用することで、ローカルモデルが以下のような実際の知識作業を直接引き受ける段階へ进入了います。

  • コーディングエージェントのループの実行
  • コンピュータ操作ワークフローの自律化
  • 機密ドキュメント分析とマルチモーダルデバッグ
  • ハイブリッド型オーケストレーション:
    • ローカルで処理可能なタスクをモデルが担当。
    • 必要に応じて、クラウドへ選択的にエスカレーションする仕組み。

スループットとエネルギー効率の劇的向上

異なる GPU 環境における推論性能と電力消費です。

スループット(トークン/秒)

  • NVIDIA GeForce RTX 5090: 143 トークン/秒
  • Apple M5 Max: 46.8 トークン/秒

エネルギー効率(mWh/トークン)

  • RTX 4090: 0.714 mWh/トークンを達成。
    • これは、フル精度の 8B パラメータモデルの約**40%**という驚異的なエネルギー効率です。

プラクティカルなメリット

  • コーディングアシスタント向け: 「編集−デバッグ」サイクルが大幅に高速化。
  • マルチモーダルエージェント向け: スクリーンショットやツール呼び出しへの対応速度が向上し、素早い反復が可能に。
  • ローカルワークフロー向け:
    • 同じデバイスでより多くの推論が可能(バッテリー寿命の延長)。
    • クラウド依存度の低下。
    • 常駐アシスタントとしての現実的な運用実現。

なぜ今回のリリースが重要か

前作と比較して、フル精度モデルとの性能維持率が 98% 以上へと引き上げられ、実質的に**「ロスレスな展開」**に近い水準に達しました。これは単なる技術的進歩を超え、AI システムの経済性とアーキテクチャを再定義する意味を持っています。

産業へのインパクト

  1. リソース効率化: より大きなモデルを既存のメモリ範囲で運用可能に。
  2. コスト削減: 同じハードウェアでより多くのユーザーをサービス可能にし、推論あたりのエネルギー消費を削減。
  3. ハイブリッドシステムの普及: 「どこをローカルで、どこをクラウドで実行すべきか」を動的に決定するシステムを実現。

今後、モデル開発の焦点は「どれだけ能力があるか」から、**「制約条件(メモリ・計算リソース・電力)の中でいかに多くの有用な知性を提供できるか」**へとシフトします。これにより、個人デバイスから大規模データセンターまで、全てのレイヤーでの展開領域が拡大することになります。


プラットフォーム対応とライセンス

  • 動作環境:
    • NVIDIA GPU: CUDA ベース(独自低ビット化カーネル利用)
    • Apple デバイス(Mac/iPhone/iPad): MLX ベース
  • 公開状況: モデルウェイトを今日より Apache 2.0 ライセンスの下で公開。
  • 詳細情報: 技術仕様、評価結果、ベンチマークリングの詳細はホワイトペーパーをご参照ください。

お問い合わせ・協力について

特定のドメインデータを用いたポストトレーニングや、ターゲットハードウェア向けの推論最適化などを通じて、Bonsai モデルをお客様のアプリケーションに合わせてカスタマイズするお手伝いをいたします。

もしメモリ、レイテンシ、電力制約の厳しい AI プロダクトを開発中であれば、Bonsai がどのように貢献できるかについて議論させていただきたく存じます。


ご加入へ(会社概要と募集)

PrismML は以下の背景を持つ企業です。

  • 設立: カリフォルニア大学ロサンゼルス校(UCLA)の研究者チームによって設立。
  • 支援企業: Khosla Ventures、Cerberus、Google(初期支援)、Samsung(継続的支援)。
  • ミッション: 推論能力を損なうことなくニューラルネットワークを圧縮するという、神経ネットワーキング分野における最も困難な課題に取り組んできました。

次世代の最先端 AI を共に構築したい方、採用ページをご覧ください。

同じ日のほかのニュース

一覧に戻る →

2026/09/18 5:36

Bend:CPU と GPU で証明により AI のミスをブロックする言語

## Japanese Translation: ## まとめ: Bend は、数学的証明をネイティブマシンコードに直接コンパイルすることで AI 生成のエラーを排除することを目的とした高性能プログラミング言語です。従来のランタイムチェックに依存する言語とは異なり、Bend は論理検証をコンパイル段階に統合し、速度を損なうことなく安全性を確保します。Python の構文の利便性と C レベルのパフォーマンス(1 コアでほぼ C と同じ速度、GPU では最大 100 倍高速)を統合し、CPU および GPU 双方での並列性を自動的に管理しつつ、スレッドやロックを必要とせず実行します。これは、アフィン依存型理論(BendTT)と専用の証明システムである `LAWS.bend` を組み合わせるユニークなアーキテクチャによって実現されています。これらのルールは人工知能エージェントが従う絶対的制約を定義し、一般的なバグが実行前に統合されることを数学的に防止します。Lean や Rocq に似る専門の型チェッカーである `PROOF.bend` が使用され、中規模なコードベースでは 1 秒未満でこれらの法の遵守を確認します。高度な証明アシスタントに着想をうけながら実行向けに最適化された Bend は、Linux および macOS 上でバックエンドタスク向けの安全かつ高速な AI 開発を可能にします。この技術を効果的に導入するためには、`curl -fsSL https://bend-lang.com/install.sh | sh` を使用してインストールし、`bend guide` コマンドを利用し、プロジェクトのドキュメント(例:`AGENTS.md`)に特定の検証指示を統合し、コードが宣言された法に準拠していることを確認するために `PROOF.bend` を実行する必要があります。主な機能には C 相当の速度、CUDA 並列性、Lean スタイルの証明、Python 構文が含まれます。プロジェクトが進化するにつれて、バグ報告を通じてその成長に貢献することをユーザーは推奨されます。

2026/09/18 1:25

ヒスター:閲覧したページや保存したファイルのためのプライベート検索エンジン

## Japanese Translation: Hister は、ユーザーのプライバシーをデフォルトで最優先する、訪問した Web ページおよびローカルファイルを対象とした、プライベートでローカルホストされた検索エンジンです。フルコンテンツをインデックス化し、必要不可欠なファビコンのみをダウンロードしますが、クラウドやテレメトリサービスにデータを送信することはありません。Hister は Linux、macOS、Windows、Docker、Nix 環境をシームレスにまたいで動作し、バイナリ(必要に応じて名義を変更)、Homebrew、Docker、または Nix を通じてインストールできます。プロジェクトは Go 1.26、npm、C コンパイラーの構築(`./manage.sh build`)を必要とし、AGPLv3 ライセンスの下で公開されています。Hister を使用するには、`./hister.exe listen`(Windows)または Linux/macOS における同等のコマンドを実行してローカルサーバーを開始し、ターミナルを開いたまま `http://127.0.0.1:4433` でインターフェースにアクセスします。Firefox または Chrome の拡張機能を通じてブラウザと統合して訪問したページを自動的に保存でき、Web インターフェース、TUI、コマンドライン、MCP を介した AI アシスタントを含む代替クライアントもサポートしています。高度な検索機能には、フィールドフィルタ、フレーズ、ワイルドカード、否定、エイリアス、結果の優先順位、および履歴またはディレクトリ用のインポートオプションが含まれ、設定された埋め込みエンドポイントによるオプショナルな意味検索も提供します。共有サーバー上での多ユーザー構成をサポートし、厳格なローカルデータ主権を遵守しています。開発者はビルド指示を `asciimoo/hister` リポジトリで確認でき、コミュニティサポートは Discord、IRCNet(`#hister`)、バグ報告用の GitHub issues、および `CONTRIBUTING.md` と `SECURITY.md` ドキュメントを通じて利用可能です。

2026/09/16 21:35

ワックスモーター

## Japanese Translation: 改良されたサマリー: ワックスモーターは、熱エネルギーを滑らかな機械的な力に変換する信頼性の高い受動型直動アクチュエータであり、精製炭化水素、植物抽出物、パラフィンなどの特定ワックスの 5–20% の体積膨張を利用して、加熱時にピストンを押し出す。磁性ソレノイドが電気を常時必要とするのに対し、これらのデバイスは電気 PTC サーミスタから環境熱や太陽エネルギーまでの熱源を使用し、ワックスが収縮して固化する際にスプリングまたは重量によるバイアス力(通常作動力の 20–30%)によってメカニズムを後退させる。この熱相変化は最大 4000 N の大きな油圧力を発生させ、航空宇宙システムの安全クリティカルな流体規制や HVAC スタットスのような用途に適した穏やかで段階的な動きを確保する。さらに抵抗負荷であるため、トライアックにより制御でき、スナバ回路を必要とせず、設計をより簡素化できる。堅牢性により、前面積載型洗濯機など過酷な環境でもドアロックを安全に作動させることが可能。現在温室やヒドロナニック加熱での利用に加え、低コスト、高信頼性、専門的な MEMS 製造への対応能力は、排気バルブ制御や洗剤ラッチ解放などの技術における役割拡大を示唆する。結局のところ、ワックスモーターは受動作動に優れた安全性と耐久性を組み合わせることで、電磁気的ソリューション以上の優れた代替手段を提供し、多様な産業において適用可能である。

bonsai 2 27B:サイズが 9 倍小さくても損失のない圧縮を実現 | そっか~ニュース