
2026/09/09 5:07
MacBook Pro で 4 つの SSD からストリーミングし、トークン速度が 1 トークン/秒の Kimi K3(2.8T)
RSS: https://news.ycombinator.com/rss
要約▶
日本語翻訳:
元のサマリーは読みやすいですが、Key Points List に含まれる数量的な深みに欠け、欠落している指標なしでは具体的なパフォーマンスに関する主張を評価することが困難です。以下の改良版は、重要なデータポイントを取り入れつつ文脈の流れを維持したものです:
サマリー
このプロジェクトは、ARGODRIVE の Deltafin フォークを使用して、アップストリーム仕様に従い(専門家プリューニングやウェイトの減少など、品質を犠牲にするショートカットを導入しない)、Apple M5 Max MacBook Pro(128 GB RAM)上で 2.8T パラメータの Kimi K3 MoE モデルをフルスケールで展開することを実証しています。パフォーマンス分析によると、デコードスループットはプロンプト長に応じて約 0.96〜1.13 tokens/s(アップストリームの約 0.68 tokens/s)と安定しています。しかし、このセットアップには 512 トークンのプロンプトに対する「最初のトークンまでの時間」(Time to First Token)の遅延が約 375 秒と大きく、これはプリフィル中に特定のメモリ専門家を読み直す効率が悪い(具体的には各レイヤーの専門家を 8 倍読み返す)ことが原因です。SSD スケールは対数曲線に従い、最も低速なレイヤーがペースを規定します。ドライブを追加しても収益性が低下し、1 ドライブがベースラインである 4 ドライブの約 52%、2 つのミラーリングが約 73%、3 ドライブが約 90% を提供します。このプロジェクトは、精度を犠牲にして(例えば専門家のウェイトを約 3 bit に減少させるなど)人工的に速度を上げる他のイニシアチブと区別されます。ユーザーは
--full モード(1.7 TB のローカルダウンロード)または --stream(オンデマンドキャッシング)のいずれかを選択できます。デフォルトでは Inferact の Kimi-K3-DSpark が含まれており、生テキストタスク用にはオプションの Qwen アクセラレーラーが用意されています(チャット速度ではありません)。コードは MIT ライセンスで公開され、Moonshot AI と何らの関係もありません。アップグレードには cargo build を通じた手動メンテナンスが必要であり、アップストリームのライセンス条項に従っています。将来の計画は、プリフィルの読み直し問題を解決して起動遅延を排除することに焦点が当てられています。本文
Kimi K3(2.8T 未剪定モデル)を M5 Max MacBook Pro で高速に動作させる:Argodrive Deltafin ベンチマークと導入ガイド
📋 TL;DR と主要な発見
- ハードウェア構成: 単一の M5 Max MacBook Pro(メモリ 128 GB)、4 つの SSD を使用。
- モデル規模: Kimi K3(パラメータ 2.8 兆、MoE)、専門知能重み合計 1.45 TB。
- 安定したデコード速度:
- 公開プロンプト(17 トークン)で 0.96 tok/s(Upstream は 0.68 と報告済み)。
- Drafter 有効化によりさらに高速化が可能。
- 現実的な限界:
- 512 トークンのプロンプトでは、最初のトークン生成までに約 6.3 分 かかります(各レイヤーの専門知能を 8 回再読み込みするプリファイル処理のため)。
- 改善計画は存在しますが、現在はまだ実装されていません。
- スケーラビリティ:
- ドライブ数による性能:4 ドライブ基準に対し、1 ドライブが約 52%、2 ドライブが約 73%、3 ドライブが約 90% です。
- ボトルネックは総帯域幅ではなく、各レイヤーの 16 回の読み込みのうち最も遅いもので決まります。
- 再現性: 全ての数値は、正確なプロンプトを使用した 1 回のカールドラン(初期実行)の結果です。詳細ログは
フォルダ内にあります。k3-public-bench/
⚡ アップストリームベンチマーク:M5 Max vs M1 Max
- 現在の性能 (M5 Max): 0.9232 - 1.1252 tok/s(構成・設定により変動)。
- 注: Upstream ベンチでは M1 Max ラップトップで測定されており、M5 Max はそれよりも大幅に高速です。
- 比較データ (gavamedia/deltafin):
- 最新の M1 Max メトリック:0.2901 token/s(前回のアップデートより +1.9%)。
- 直前の結果:0.2847 token/s(+7.0%)、0.2660 token/s(+102.9%)など、パフォーマンスが継続的に向上しています。
🎯 ミッションと設計思想
- 完全未剪定 (Full Pruned): 何も剪定されず、K3 が全てのトークンを決定します。
- 16 の専門知能フル活用: すべての専門知識バンクを各トークンにおいて完全に活用し、近道や妥協は行いません。
- 品質の基準: Kimi K3 そのものがすべての推測を検査・承認します。小型ドラフトモデルによる先行推測は速度向上のため許可されますが、K3 が最終確認を行います。
- 実験的目的: コンシューマーハードウェアの限界挑戦および研究探求を目的としています。製品プロモーションではありません。
🛠 インストールとセットアップ
Deltafin は必要なものをほぼ自動的にインストールします。不足している場合は「要件」を確認してください。
1. ソースコードの取得とコンパイル
git clone https://github.com/gavamedia/deltafin.git cd deltafin # リリースビルド(最適化済み) cargo build --locked --release
2. モデル重みのダウンロード
通常、ディスクへの完全ダウンロードが最も高速です。
完全インストール(推奨)
./target/release/deltafin setup --full
ディスク容量不足の場合(ストリーミング読み込み)
- 注意: 開始時に 215 GB の空き領域が必要です。
- 動作: 必要に応じて専門知能のみオンデマンドで取得し、キャッシュを構築します。初期は低速ですが、時間が経過すると空間効率が高まります。
./target/release/deltafin setup --stream
3. オプション機能の追加
DSpark (標準搭載)
- Kimi-K3-DSpark を使用し、K3 の埋め込みベクトルをマテリアライズしません。
- チャットやサーバーリクエストにおいて自動的に有効化されます。
- ダウンフェール時は完全な K3 が独自に動作します。
Qwen (高速化アドオン)
- 生テキスト継続(Raw Continuation)のための別個アドオンです。
- 効果: 推測速度が向上し、K3 の確認時間を短縮します(17 トークンの完了で 2.7 倍 の高速化)。
- インストール:
./target/release/deltafin setup-qwen
- または完全セットアップ時に含める:
./target/release/deltafin setup --full --include-qwen
📈 アップグレード手順
フォアークされたリポジトリを最新の状態にする場合:
./target/release/deltafin upgrade
- 動作: 必要なものを取得し、バイナリを再コンパイルします。モデル・キャッシュ・重みは変更されません。
- 重要な注意点:
が何もないことを確認してから実行してください。git status- ビルド環境の維持: 旧版からアップグレードする場合、ビルド環境変数(CUDA/CPU など)は保持されます。設定を変更したい場合は一度手動で再ビルドする必要があります。
- 警告: クリーンで非分岐したブランチが必要です。予期せぬ状況ではアップグレードを安全に停止します。
🚀 コマンドラインでの使用例
チャットモード(推奨)
K3 の監査済みチャットテンプレートを使用し、エンドマーカーで停止します。
./target/release/deltafin run --chat \ --prompt "What are the three largest moons of Saturn?"
生継続モード (Raw Continuation)
出力を制限し、終了境界なしの純粋なテキスト生成です。
./target/release/deltafin run \ --prompt "The capital of France is" --max-new 17
スタット付き実行
累積スループットとネイティブトランザクション統計を表示します。
./target/release/deltafin run \ --prompt "The largest planet in our solar system is" --max-new 17 --stats
オプション: トークン生成時に診断情報を出力します。--stats- 長对话: ヒストリが増大するため、短かい完了に比べて著しく低速になります。
🌐 OpenAI 互換サーバーとして実行
API サーバーを起動し、一般的なクライアントツールと連携します。
./target/release/deltafin serve --host 127.0.0.1 --port 8000
テストリクエスト (curl)
curl http://127.0.0.1:8000/v1/chat/completions \ -H 'Content-Type: application/json' \ -d '{"model":"deltafin-kimi-k3","stream":true,"messages":[{"role":"user","content":"Hello!"}]}'
サーバーの特性:
- 実装:
,/v1/chat/completions
,/v1/completions
を実装(SSE 対応)。/v1/models - 精度: グリッド探索のみ、厳密なチェックを実行します。
- キャッシュ: 会話状態の再利用と DSpark 検証済み速度向上を自動で行います。
- 設定項目:
- デフォルトレスポンス上限:100 万トークン。クライアント統合時は
で制限してください。--max-tokens N - リクエストサイズ制限:デフォルト 128 MiB(
)。--max-request-bytes
- デフォルトレスポンス上限:100 万トークン。クライアント統合時は
📖 ドキュメントと技術情報
以下のドキュメントで詳細を確認してください。
- ネイティブランタイム: Rust コア、C ABI プロバイダー、ルーター追跡、専門知能プリフェッチの実装概要。
- OpenAI サーバーリファレンス: API フィールドの受容条件、自動チャット速度向上の詳細。
- ヘルスチェック: インストールコンポーネントの検証(ネットワーク不要)。
- ネイティブストレージ:
で準備されるデフォルトの row-int8 リジデントスパインや、ロスレスな scale4 サイドカー選択。setup - パフォーマンスリファレンス: ベンチマークハネスによる測定再現方法と M1 Max の参考値。
- 構成設定: 重要なフラグ・環境変数と品質ガーディアンのリスト。
- プラットフォーム対応: MPS/Metal、CUDA、ネイティブ CPU のサポート状況。
🙏 クレジット
Deltafin の開発には以下のプロジェクトや貢献者が存在します:
- Moonshot AI: K3 の重み・アーキテクチャ公開。
- Inferact: 変更しない K3 専用 DSpark チェックポイント公開。
- GigaToken: 安定順並列トークナイゼーションパスの着想。
- Maurice Brown (trumb): Linux/aarch64/x86 SIMD/DGX Spark 測定の検証。
- colibri: 攻撃的 MoE ストリーミングとルータールックアヘッドの実証。
- ds4 / DwarfStar: 正確な専門知能ストリーミングとキャッシュ所有権の技術提供。
- Qwen: オプションの高速生完了モデル供給(0.6B/1.7B)。
- コミュニティ: flash-linear-attention, PyTorch, llama.cpp/ggml, tiktoken など。
⚖️ ライセンスと免責事項
- コードライセンス: Deltafin のソースコードは MIT。
- サードパーティ資料: Kimi K3 重み、DSpark チェックポイント、Qwen チェックポイントなどは上流の条項を保持します。
- 独立宣言: Deltafin は Moonshot AI と一切関係のない独立したプロジェクトです。