Show HN:Colibri を使って P2P スワーム上で Moe モデルを実行できる Lumabri

2026/08/14 9:47

Show HN:Colibri を使って P2P スワーム上で Moe モデルを実行できる Lumabri

RSS: https://news.ycombinator.com/rss

要約

Japanese Translation:

本文の核心は、Colibri という革命的な純粋な C 言語エンジンのご紹介であり、このエンジンにより、高価なインフラや信頼できる中央サーバーなしに標準ハードウェア上で大規模なミクスチャー・オブ・エキスパート (MoE) モデルを実行できるようになり、アクセスが民主化されています。このアーキテクチャでは、1 台のマシンがトレーサーを通じてモデルをホストし、他のすべてのマシンは

lumabri
ツールを使用してピアのスワームとしてクライアントとして参加し、推論中に触られた特定のバイトのみを最初に使用時にローカルミラーにダウンロードします。これにより、異なるハードウェア(CPU または GPU)間で出力がバイトごとの同一性が保たれ、エンジンバイナリを変更することなく実現されます。不信されたピアに対する整合性を確保するため、検証済みの各 MiB は SHA256 で署名されたコンテンツアドレス可能なストアに格納され、ピアからのデータが不一致の場合は自動的に拒否され、他のピアから再取得されます。システムはネットワーク障害を適切に処理します:最初の推論は初期転送のために遅くなる場合がありますが、中央ホストがオフラインになってもローカルキャッシュから次の質問に応答されるため、後続の問い合わせは瞬時に提供されます。ユーザーはチャットツール内の単純なターミナルコマンドを使ってモデルを管理し、匿名ピアネットワークを表示でき、必要であれば
make fixture
によって合成テストモデルを構築できます。結局、この分散型アプローチにより、企業は多様な艦隊全体にわたって一貫した AI 機能を展開することができると同時に、個々のユーザーも永続的な API 依存や高価なハードウェア要件なしに大規模なモデルを安全に利用できるようになります。

本文

Colibri エンジンによる分散型 Mixture-of-Experts モデル推論:Lumabri

純粋な C ランクで動作し、外部依存関係なし。一台のマシンがモデルを共有し、他のマシンはチャットを行うピアツーピア構造です。事前ダウンロード不要で、初回利用時に必要なデータのみがローカルにミラーされ、以降は全速度でサーブされます。

特徴とアーキテクチャ

コアコンセプト

  • 純粋な C ランク: 外部ライブラリ依存なし。
  • ゼロ事前ダウンロード: 推論時に必要なバイトのみを初回で取得し、ローカルに保持する。
  • ハードウェア中立性: CPU と GPU の両方で動作可能。GPU は単なる加速機能であり、出力の同一性を保証します。
  • Colibri エンジン: バイナリ自体は変更されず、推論時の挙動が保証されます。

ネットワーク構成

  • CPU/SSD 第一優先: デザインの中心は CPU と SSD です。
  • 分散計算: GPU をプールするネットワークとは異なり、Lumabri はすべてのデバイスから集約します。
  • 同一出力保証: バイト単位で厳密に同一のトークンが生成されます。

クイックスタート

サーバー側(モデル保有マシン)

任意の

colibri
モデルディレクトリ上ですべてのデータをホストします。

./lumabri serve --model /path/to/model

クライアント側(チャットマシン)

エンジンには

colibri
ビルドが必要です。

./lumabri chat --tracker <server-ip>:7300 --engines-dir /path/to/colibri/c
  • 初回利用: 作業セットのネットワーク転送のため少し遅延します。
  • ミラー動作:
    ~/.lumabri
    に保存されたミラーにより、サーバーがオフラインになっても動作を継続します。

テスト用モデル作成

本番モデルがない場合、以下のコマンドで小さな人工的なモデルを作成可能です。

make fixture

ターミナル UI での利用

引数なしで起動すると、swarm アドレスとオペレータ公開鍵の入力を求められます。

  • 2 回目以降: 「Enter」「Enter」で完了します。
  • オプション優先: フラグを指定すれば、スクリプトは他者の保存データを引き継ぎません。

便利なコマンド

チャット中の管理コマンド:

  • /swarm
    : ネットワークのライブビューを表示(ピアは番号のみ)。
  • /model
    : 登録モデルの一覧表示と即時切り替え。

仕組みの詳細

バイト共有と読み込み

serve
コマンドは以下の 2 つのプログラムを起動します:

  1. トラッカー: ファイルの保管先をインデックス化します。
  2. メンテナンスャー: モデルディレクトリのバイト範囲読み出し(byte-range reads)に対応します。

読み込みプロセス (

chat
コマンド):

  • liblumabri.so
    ライブラリを通じてモデルを読み込みます(LD_PRELOAD シム)。
  • エンジンの
    libc
    呼び出し(
    open
    ,
    pread
    など)をインターポーシブに処理します。
  • ファイルはスパーセローカルミラーとして出現し、
    fstat
    やページキャッシュがネイティブに機能します。
  • 不足ブロックはピアからフェッチされ、SHA256 ハッシュ付きで CAS(コンテンツアドレス化ストア)に格納されます。
  • 検証済み: 同じチャンクは一度だけダウンロードされ、異なるミラーで再構築可能です。

Colibri の継承ルール

  • ネットワークはデータ源を切り替えられますが、どのバイトかを変更できません
  • モデルファイルの書き込み(
    EROFS
    エラー)や、サーブ不可ブロックへのアクセス(無音なゼロではなく「大声な EIO」エラー)を防ぎます。
  • バイト同一性は、起動時・ウォーム起動時・ピア停止時も検証され続けます。

ピア上のエキスパート実行 (MoE)

チャット側は以下のみを保持し、残りの計算をピアにオフロードします:

  • 密度の高い重み(dense weights)

  • ルーター

  • KV キャッシュのみ

  • 4KB の活性化データだけを適切なピアに送付します。

  • エクスポートの重み自体はチャット側に到達しません。

  • 双方は同じコードパスを使用するため、生成されるトークンが完全に同一になります。

  • ピアは正確なビルド情報を広告し、ビルド不一致のピアは接続拒絶されます。

セキュリティとピア検証 ("ピアは信用していない")

  • 完全検証: すべてのメンテナンスャーはデータの各 MiB について SHA256 を計算・署名(Ed25519)します。
  • 嘘偽りの拒絶: 嘘をつくピアからのデータは拒絶され、他から再フェッチされます。
  • リモート検証 (
    LUMABRI_VERIFY=N
    )
    : N% のエキスポートコールを第 2 リプライカで再実行し、同一出力を検証します。不一致はエラーとなり動作停止します。
  • ヘッジ戦略 (
    LUMABRI_HEDGE_MS=N
    )
    : 最寄りのリプライカが N ミリ秒以内に回答しなかった場合、次のリプライカに複製を送信し、最初の有効な決定論的結果を使用します。

エンジンとバグ検出

Colibri は複数のエンジンに対応し、互換性を維持しながら拡張可能です。

エンジンモデル証明済みテスト
olmoeOLMoE
expert_node
(phase2_test.sh)
colibriGLM
expert_node_glm
(phase2_glm_test.sh)
inklingInkling
expert_node_inkling
(phase2_inkling_test.sh)
kimi_k3Kimi K3
expert_node_kimi
(phase2_kimi_test.sh)
deepseekDeepSeek V4
expert_node_deepseek
(phase2_deepseek_test.sh)
  • 証明された (Proven): 実験結果に基づくバグ検出。例:GLM は浮動小数点数のドリフト問題があり、ピア間通信でトークンがずれることが発見されました。
  • ビルド:
    make engines
    (エンジン),
    make chatters
    (チャット),
    make phase2-all
    (両方)。

サーバーの導入と管理

簡易セットアップ

make && make phase2-all ENGINE=/path/to/colibri/c
sudo make install                                    # または PREFIX=$HOME/.local

サーバー起動 (

lumabri serve
) で TCP ポート 7300~7302 が開放されます。

  • --advertise <public-ip>
    : 高速な直接パスのために推奨。
  • --key swarm.key
    : モデル署名用鍵。

役割とコマンド

各マシンで以下のいずれかの役割を選択します:

目的コマンド例
チャット (クライアント)
lumabri chat --tracker SERVER:7300 ...
モデル保持 (サーバー)
lumabri serve --model /srv/model
ディスク提供 (バイトドナー)
lumabri serve --model ./slice --join SERVER:7300 --donate GB
計算提供 (エキスポートドナー)
expert_node<engine> --model DIR --tracker SERVER:7300 ...
  • フェイルオーバー: ドナー停止時もトークンは続行され、内容を保証します。
  • 互換性: 役割を宣言するだけで、他者と存在を知っている必要はありません。

キー管理とローテーション

  • キーリング:
    --pubkey keyring
    または環境変数で最大 16 個の鍵を受け入れます。
  • ローテーション手順:
    1. 旧鍵+新鍵の両方を実装。
    2. クライアントとドナーが移行後、古い行を削除。
    3. 最新の鍵を最後に配置(トラッカーは優先順位の高いキーのみを検証するため)。
  • 署名: オブジェクトごとの署名ですが、ワイヤ形式の変更はありません。

暗号化通信とピアアイデンティティ

LUMABRI_ENCRYPT=1
を設定すると、X25519/Ed25519 ハンドシェイクと ChaCha20-Poly1305 による認証付き暗号化が有効になります。

  • フェイルクロージング: 鍵を管理・作成できない場合は通信を即座に失敗させます。
  • ピアアイデンティティ:
    ~/.lumabri/peer.key
    に保持し、変更された場合は接続拒絶します。
  • MITM 防止:
    • サーバー起動前にオペータ公開鍵を配布(ファイル形式)。
    • LUMABRI_PEER_PINS
      でピンファイルを指定。
    • LUMABRI_REQUIRE_PIN=1
      で厳格な検証モードへ。
  • モデル署名キー ≠ ピアピン: モデル認証とネットワークエンドポイント認証は別個です。

性能特性

  • 最寄りのリプライカ優先: コピーが近いほど高速です(2ms キープでも 30ms のものよりも速い)。
  • 速度向上例: 1.4 トークン/秒 → 10.5 トークン/秒 に向上します。

テストと検証

以下のスイートを実行してシステムを確認します:

  • コアスイート: バイト同一性、ドナー完全性、セキュリティ(パスエスケープなど)。
  • エンジン固有:
    make test-engines
    (DeepSeek V4 などは
    MODEL=<dir>
    を指定)。
  • 独自スクリプト:
    • assign_test.sh
      : 割り当てテスト。
    • concurrency_test.sh
      : 並列性テスト。
    • sign_test.sh
      : 署名テスト。
  • 新機能検証:
    make test-cas
    ,
    test-key-rotation
    ,
    test-hedge
    ,
    test-relay-exec

比較と要件

他のソリューションとの違い

特徴Petals / llama.cpp RPCLumabri
分割粒度トランスフォーマー層 (重く)エキスポート (軽量:4KB)
ハードウェアGPU 必須CPU 動作可能、GPU オプション
同一性近似値の可能性ありバイト単位厳密同一保証
検証困難スポットチェック可能
  • MoE への適合: スパースな構造に最適化されており、単独のエキスポートでもピアとして機能します。

システム要件

  • OS: Linux
  • ビルド環境: gcc, GNU make
  • テスト用: Python3, numpy
  • エンジンバイナリ: Colibri ビルドから提供

ステータスとライセンス

現在の実装状況

  • 動作するプロトタイプ: 実装可能です。
  • オープン Swarm: SHA256 検証、署名されたモデルルート、第二リプライカでのスポットチェックを実装済み。
  • プライベート Swarm:
    LUMABRI_TOKEN
    で招待トークンを追加し、活性化データの保護 (
    LUMABRI_ENCRYPT=1
    ) を実現可能です。
  • 実装済み機能: マルチロー投機的検証、固定遅延ヘッジ、CAS クロスチェック、キーローテーション、NAT リレー。

将来の計画(意図的に除外されている機能)

  • 自動 SLA チューニング
  • 分散/S3 CAS
  • KMS/HSM インテグレーション
  • 自動取り消し

ライセンス

Apache 2.0

同じ日のほかのニュース

一覧に戻る →

2026/08/14 19:41

神のために、Kubernetes で CPU リミットを使用するのをやめてください

## Japanese Translation: 元の要約は明確で正確であり、よく構成されています。厳密な改善は必要ありませんが、以下に全ての情報を保持しつつさらにより滑らかで流れの良い、やや推敲されたバージョンを示します: **改訂された要約:** 主な推奨事項は、Kubernetes コンテナからの CPU リミットの廃止です。これは記憶容量制限(OOM キルを防ぐ保護機能)とは異なり、Linux CFS スケジューラによって 100 ミリ秒以内のウィンドウ内で人工的な凍結を引き起こします。このスロットリングは、処理器数に基づいて動的にリソースを割り当てる .NET アプリケーションに特に悪影響を与える、ガベージコレクションへの飢餓や沈黙するロジックエラーなどの重大な失敗につながります。 これらの制限を撤去することで、以下の顕著な利益が得られます:クラスタあたり年間約 92,000 ドルのハードウェア統合による節約、トラフィックスパイク時のテールレイテンシの減少、および計算集約型タスクに対する起動時間の大幅な短縮です。これを安全に実装するためには、組織はプロセッサ数(具体的には `DOTNET_PROCESSOR_COUNT`)に対してフラートワイドデフォルトを設定し、スロットリング比率の観測可能性を向上させた上で変更を展開する必要があります。今後のステップとしては、長期にわたる P95 使用データに基づいてリソースリクエストを再サイズ化し、オートスケーリングを最適化することです。未信憑性の高いワークロードや Guaranteed QoS を必要とするワークロードについては、例外を残して近隣のアプリケーションに影響を与えることを防ぐ必要があります。

2026/08/14 18:55

DeepSeek ピークオフピーク料金更新

## Japanese Translation: DeepSeek-V4-Pro が本日公式リリースされ、AI エージェントに重大なアップグレードが施され、生産性が大幅に向上しました。今回の更新では、V4-Pro および V4-Flash の両方で利用可能な柔軟な推論モードを導入しており、「low」は単純なタスク向け、「high」は日常のエージェントワークフロー向け、「max」は複雑な課題向けです。目玉機能として、OpenAI Responses API のネイティブサポートと最適化された Codex インテグレーションを提供し、開発をシームレスに行うためのワンクリック設定が可能です。特筆すべきは、アプリ上で「Expert モード」を通じてこれらの強化機能をアクセスできる一方で、元の API インターフェースでは標準的なモデル名をそのまま維持できる点です。重要なのは、API 料金体系が変更され、2026 年 8 月 16 日 UTC 午後 4 時より有効となるオフピーク時の料金がピーク時の半額という新構造が導入されたことです。この変更は、企業が重負荷な処理をコストのかからない時間帯にスケジュールすることで運用費を削減することを促しており、ビジネスは現在の技術ワークフローを維持しつつ、支出を最適化し、複雑な業務も容易に遂行できるようになります。

2026/08/14 2:23

Gemini 3.7 Flash

## 日本語翻訳: ## サマリー: Google は、開発者の効率性を即時に向上させることを目的として 160 カ国で利用可能にし、最も高度なコーディングモデルとなる Gemini 3.7 Flash を公開しました。これは先行モデルからわずか 3 週間後のリリースであり、開発者のフィードバックおよびアルゴリズムの革新に応じたものであり、この急速な更新によりコストが大幅に削減されました(価格が半減し、100 万入力トークンあたり 0.75 ドル、100 万出力トークンあたり 3.75 ドル)。技術的ベンチマークは能力の著しい飛躍を確認しています:モデルはゼロから動作するコードを生成する際に 43.6% の精度を達成しました(対して 34.4%)、およびソフトウェアのエラーを修正する際の成功率は 65.3% に向上しました(対して 49.0%)。また、複雑なドキュメントの解析、現実世界の業務ワークフロー(AutomationBench スコアが 17.0% から 30.4% に改善)、Web 開発タスクにおいて優れており、Arena.ai で Elo スコア 1588 を達成しました。開発者は、Google Antigravity、Google AI Studio、Android Studio、または公式 API を活用して、これらの改善点を直ちにプロジェクトに統合することができます。この発表は、セキュリティサイバー分野など機密性の高い領域での乱用を防ぐために更新された Frontier Safety の防護措置を通じて厳格な安全プロトコルを維持しつつ、Google Workspace アプリ内でより高い生産性を約束します。安価さと多面的な高性能を組み合わせることで、このモデルは専門家のソフトウェアエンジニアリングにおける人工知能の新たな基準を設定します。

Show HN:Colibri を使って P2P スワーム上で Moe モデルを実行できる Lumabri | そっか~ニュース