MacBook Pro で 4 つの SSD からストリーミングし、トークン速度が 1 トークン/秒の Kimi K3(2.8T)

2026/09/09 5:07

MacBook Pro で 4 つの SSD からストリーミングし、トークン速度が 1 トークン/秒の Kimi K3(2.8T)

RSS: https://news.ycombinator.com/rss

要約

日本語翻訳:

元のサマリーは読みやすいですが、Key Points List に含まれる数量的な深みに欠け、欠落している指標なしでは具体的なパフォーマンスに関する主張を評価することが困難です。以下の改良版は、重要なデータポイントを取り入れつつ文脈の流れを維持したものです:

サマリー

このプロジェクトは、ARGODRIVE の Deltafin フォークを使用して、アップストリーム仕様に従い(専門家プリューニングやウェイトの減少など、品質を犠牲にするショートカットを導入しない)、Apple M5 Max MacBook Pro(128 GB RAM)上で 2.8T パラメータの Kimi K3 MoE モデルをフルスケールで展開することを実証しています。パフォーマンス分析によると、デコードスループットはプロンプト長に応じて約 0.96〜1.13 tokens/s(アップストリームの約 0.68 tokens/s)と安定しています。しかし、このセットアップには 512 トークンのプロンプトに対する「最初のトークンまでの時間」(Time to First Token)の遅延が約 375 秒と大きく、これはプリフィル中に特定のメモリ専門家を読み直す効率が悪い(具体的には各レイヤーの専門家を 8 倍読み返す)ことが原因です。SSD スケールは対数曲線に従い、最も低速なレイヤーがペースを規定します。ドライブを追加しても収益性が低下し、1 ドライブがベースラインである 4 ドライブの約 52%、2 つのミラーリングが約 73%、3 ドライブが約 90% を提供します。このプロジェクトは、精度を犠牲にして(例えば専門家のウェイトを約 3 bit に減少させるなど)人工的に速度を上げる他のイニシアチブと区別されます。ユーザーは

--full
モード(1.7 TB のローカルダウンロード)または
--stream
(オンデマンドキャッシング)のいずれかを選択できます。デフォルトでは Inferact の Kimi-K3-DSpark が含まれており、生テキストタスク用にはオプションの Qwen アクセラレーラーが用意されています(チャット速度ではありません)。コードは MIT ライセンスで公開され、Moonshot AI と何らの関係もありません。アップグレードには
cargo build
を通じた手動メンテナンスが必要であり、アップストリームのライセンス条項に従っています。将来の計画は、プリフィルの読み直し問題を解決して起動遅延を排除することに焦点が当てられています。

本文

Kimi K3(2.8T 未剪定モデル)を M5 Max MacBook Pro で高速に動作させる:Argodrive Deltafin ベンチマークと導入ガイド

📋 TL;DR と主要な発見

  • ハードウェア構成: 単一の M5 Max MacBook Pro(メモリ 128 GB)、4 つの SSD を使用。
  • モデル規模: Kimi K3(パラメータ 2.8 兆、MoE)、専門知能重み合計 1.45 TB
  • 安定したデコード速度:
    • 公開プロンプト(17 トークン)で 0.96 tok/s(Upstream は 0.68 と報告済み)。
    • Drafter 有効化によりさらに高速化が可能。
  • 現実的な限界:
    • 512 トークンのプロンプトでは、最初のトークン生成までに約 6.3 分 かかります(各レイヤーの専門知能を 8 回再読み込みするプリファイル処理のため)。
    • 改善計画は存在しますが、現在はまだ実装されていません。
  • スケーラビリティ:
    • ドライブ数による性能:4 ドライブ基準に対し、1 ドライブが約 52%、2 ドライブが約 73%、3 ドライブが約 90% です。
    • ボトルネックは総帯域幅ではなく、各レイヤーの 16 回の読み込みのうち最も遅いもので決まります。
  • 再現性: 全ての数値は、正確なプロンプトを使用した 1 回のカールドラン(初期実行)の結果です。詳細ログは
    k3-public-bench/
    フォルダ内にあります。

⚡ アップストリームベンチマーク:M5 Max vs M1 Max

  • 現在の性能 (M5 Max): 0.9232 - 1.1252 tok/s(構成・設定により変動)。
    • : Upstream ベンチでは M1 Max ラップトップで測定されており、M5 Max はそれよりも大幅に高速です。
  • 比較データ (gavamedia/deltafin):
    • 最新の M1 Max メトリック:0.2901 token/s(前回のアップデートより +1.9%)。
    • 直前の結果:0.2847 token/s(+7.0%)、0.2660 token/s(+102.9%)など、パフォーマンスが継続的に向上しています。

🎯 ミッションと設計思想

  • 完全未剪定 (Full Pruned): 何も剪定されず、K3 が全てのトークンを決定します。
  • 16 の専門知能フル活用: すべての専門知識バンクを各トークンにおいて完全に活用し、近道や妥協は行いません。
  • 品質の基準: Kimi K3 そのものがすべての推測を検査・承認します。小型ドラフトモデルによる先行推測は速度向上のため許可されますが、K3 が最終確認を行います。
  • 実験的目的: コンシューマーハードウェアの限界挑戦および研究探求を目的としています。製品プロモーションではありません。

🛠 インストールとセットアップ

Deltafin は必要なものをほぼ自動的にインストールします。不足している場合は「要件」を確認してください。

1. ソースコードの取得とコンパイル

git clone https://github.com/gavamedia/deltafin.git
cd deltafin

# リリースビルド(最適化済み)
cargo build --locked --release

2. モデル重みのダウンロード

通常、ディスクへの完全ダウンロードが最も高速です。

完全インストール(推奨)

./target/release/deltafin setup --full

ディスク容量不足の場合(ストリーミング読み込み)

  • 注意: 開始時に 215 GB の空き領域が必要です。
  • 動作: 必要に応じて専門知能のみオンデマンドで取得し、キャッシュを構築します。初期は低速ですが、時間が経過すると空間効率が高まります。
./target/release/deltafin setup --stream

3. オプション機能の追加

DSpark (標準搭載)

  • Kimi-K3-DSpark を使用し、K3 の埋め込みベクトルをマテリアライズしません。
  • チャットやサーバーリクエストにおいて自動的に有効化されます。
  • ダウンフェール時は完全な K3 が独自に動作します。

Qwen (高速化アドオン)

  • 生テキスト継続(Raw Continuation)のための別個アドオンです。
  • 効果: 推測速度が向上し、K3 の確認時間を短縮します(17 トークンの完了で 2.7 倍 の高速化)。
  • インストール:
./target/release/deltafin setup-qwen
  • または完全セットアップ時に含める:
./target/release/deltafin setup --full --include-qwen

📈 アップグレード手順

フォアークされたリポジトリを最新の状態にする場合:

./target/release/deltafin upgrade
  • 動作: 必要なものを取得し、バイナリを再コンパイルします。モデル・キャッシュ・重みは変更されません。
  • 重要な注意点:
    • git status
      が何もないことを確認してから実行してください。
    • ビルド環境の維持: 旧版からアップグレードする場合、ビルド環境変数(CUDA/CPU など)は保持されます。設定を変更したい場合は一度手動で再ビルドする必要があります。
    • 警告: クリーンで非分岐したブランチが必要です。予期せぬ状況ではアップグレードを安全に停止します。

🚀 コマンドラインでの使用例

チャットモード(推奨)

K3 の監査済みチャットテンプレートを使用し、エンドマーカーで停止します。

./target/release/deltafin run --chat \
  --prompt "What are the three largest moons of Saturn?"

生継続モード (Raw Continuation)

出力を制限し、終了境界なしの純粋なテキスト生成です。

./target/release/deltafin run \
  --prompt "The capital of France is" --max-new 17

スタット付き実行

累積スループットとネイティブトランザクション統計を表示します。

./target/release/deltafin run \
  --prompt "The largest planet in our solar system is" --max-new 17 --stats
  • --stats
    オプション
    : トークン生成時に診断情報を出力します。
  • 長对话: ヒストリが増大するため、短かい完了に比べて著しく低速になります。

🌐 OpenAI 互換サーバーとして実行

API サーバーを起動し、一般的なクライアントツールと連携します。

./target/release/deltafin serve --host 127.0.0.1 --port 8000

テストリクエスト (curl)

curl http://127.0.0.1:8000/v1/chat/completions \
  -H 'Content-Type: application/json' \
  -d '{"model":"deltafin-kimi-k3","stream":true,"messages":[{"role":"user","content":"Hello!"}]}'

サーバーの特性:

  • 実装:
    /v1/chat/completions
    ,
    /v1/completions
    ,
    /v1/models
    を実装(SSE 対応)。
  • 精度: グリッド探索のみ、厳密なチェックを実行します。
  • キャッシュ: 会話状態の再利用と DSpark 検証済み速度向上を自動で行います。
  • 設定項目:
    • デフォルトレスポンス上限:100 万トークン。クライアント統合時は
      --max-tokens N
      で制限してください。
    • リクエストサイズ制限:デフォルト 128 MiB
      --max-request-bytes
      )。

📖 ドキュメントと技術情報

以下のドキュメントで詳細を確認してください。

  • ネイティブランタイム: Rust コア、C ABI プロバイダー、ルーター追跡、専門知能プリフェッチの実装概要。
  • OpenAI サーバーリファレンス: API フィールドの受容条件、自動チャット速度向上の詳細。
  • ヘルスチェック: インストールコンポーネントの検証(ネットワーク不要)。
  • ネイティブストレージ:
    setup
    で準備されるデフォルトの row-int8 リジデントスパインや、ロスレスな scale4 サイドカー選択。
  • パフォーマンスリファレンス: ベンチマークハネスによる測定再現方法と M1 Max の参考値。
  • 構成設定: 重要なフラグ・環境変数と品質ガーディアンのリスト。
  • プラットフォーム対応: MPS/Metal、CUDA、ネイティブ CPU のサポート状況。

🙏 クレジット

Deltafin の開発には以下のプロジェクトや貢献者が存在します:

  • Moonshot AI: K3 の重み・アーキテクチャ公開。
  • Inferact: 変更しない K3 専用 DSpark チェックポイント公開。
  • GigaToken: 安定順並列トークナイゼーションパスの着想。
  • Maurice Brown (trumb): Linux/aarch64/x86 SIMD/DGX Spark 測定の検証。
  • colibri: 攻撃的 MoE ストリーミングとルータールックアヘッドの実証。
  • ds4 / DwarfStar: 正確な専門知能ストリーミングとキャッシュ所有権の技術提供。
  • Qwen: オプションの高速生完了モデル供給(0.6B/1.7B)。
  • コミュニティ: flash-linear-attention, PyTorch, llama.cpp/ggml, tiktoken など。

⚖️ ライセンスと免責事項

  • コードライセンス: Deltafin のソースコードは MIT
  • サードパーティ資料: Kimi K3 重み、DSpark チェックポイント、Qwen チェックポイントなどは上流の条項を保持します。
  • 独立宣言: Deltafin は Moonshot AI と一切関係のない独立したプロジェクトです。

同じ日のほかのニュース

一覧に戻る →

2026/09/08 23:55

Google DeepMind、AlphaGenome アトラスをリリース

## Japanese Translation: ## サマリー: Google DeepMind は、ヒトゲノムにおけるあらゆる可能な単一ヌクレオチド変異の影響を予測することを目的とした画期的なツール「AlphaGenome Atlas」を導入しました。この 1 ペタバイト規模の巨大データセットは、全ての 90 億個の可能性のある変化について事前に影響を計算しており、「AVI スコア」というスコアを用いてどの遺伝的変異が最も重要かを瞬時に優先順位付けします。この革新は、稀少疾患の原因特定という重要な課題に対処しており、例えば広域研究所(Broad Institute)で同定された *DNM1* 遺伝子の特定の突然変異によって誤ったスプライスサイトが作成される問題に対処しています。さらに、54,000 人以上の UK Biobank 参加者のデータに適用した際、アトラスは非コード領域と身体質量指数(BMI)との新しい関連性を発見しました。予測された分子効果に基づいて変異をグループ化することで、従来の手法よりも 22% も多くの関連性を明らかにし、BMI に関連する 19 の遺伝的領域を同定しました。複雑で高度なプログラミングスキルを必要とする以前の手法とは対照的に、このツールは直感的なウェブサイトポータルを通じてアクセス可能となり、世界の臨床研究者へのアクセスを民主化しています。結局のところ、アトラスは科学者が膨大な技術的専門知識を必要とせずに最も有望な遺伝的なリードにリソースを集中させることを可能にし、発見のスピードを加速させています。

2026/09/09 6:47

大規模言語モデルが適応的探索によって新たな社会的バイアスを発明する

## Japanese Translation: OpenReview にアクセスする前に、新規ユーザーは作業を続行するには強制のセキュリティ検証手順を完了する必要があります。既存のアカウント保有者は直接ログインすることでこの要件を回避でき、これにより自動的にメインインターフェースに遅延なくリダイレクトされます。その結果、新規ユーザーはチェックを完了させるまでワークフローを一時的に停止する必要があり、登録済みアカウント向けの免除を利用しない限りです。組織が新しい人材オンボーディングを行う場合、これらの個人が認証を完了する間、一時的な摩擦が発生する可能性があります。したがって、このプラットフォームは新規参入者に対して厳格な入場を強制し、一方で検証済みのユーザーにはシームレスなアクセスを維持します。

2026/09/08 22:36

DaVinci Resolve 21.1 の紹介

## Japanese Translation: Blackmagic Design ウェブサイトは知的財産権を保護し、データ追跡に関する明確なユーザーの同意を確保しています。すべての項目は Blackmagic Design Pty. Ltd. 2026 の著作権(全権利 Reserved)により保護され、商標はそれぞれの所有者が所有します。MSRP は関税を含むが、消費税および送料は含まれません。本サイトはリマーケティングサービスを使用して、第三者のウェブサイトにおいて以前訪れたユーザーへ広告を表示していますが、これらの実践は明確なプライバシーポリシーと利用規約によって規制されています。ユーザーは、ブラウザのクッキー設定を通じていつでもリマーケティングからの除外を選択することで、デジタルフットプリントに対する即時の制御を保持し、プライバシー好みを尊重しつつ広告体験を形成します。データ使用の詳細については専用 Privacy Policy が用意されており、ユーザーは商業的界限および追跡メカニズムについて完全に意識した上でプラットフォームをナビゲートできるよう empowered されます。 ## Text to translate Improved summary below (clearer flow, corrects the likely logical error about trademarks belonging to "their specific owners rather than the company" by aligning with the key point that trademarks are property of their respective owners, and maintains clarity on all major points). Summary: The Blackmagic Design website protects intellectual property and ensures clear user consent regarding data tracking. All items are copyright Blackmagic Design Pty. Ltd. 2026 (all rights reserved), while all trademarks remain the property of their respective owners. MSRP includes duties but excludes sales tax and shipping costs. The site uses remarketing services to advertise on third-party websites to previous visitors; however, these practices are governed by explicit privacy policies and terms. Users retain immediate control over their digital footprint by opting out of remarketing at any time through their browser's cookie settings, which effectively shapes their advertising experience while respecting privacy preferences. For detailed information on data usage, a dedicated Privacy Policy is available, empowering users to navigate the platform with full awareness of commercial boundaries and tracking mechanisms.