単一AMD MI300X上で動作する DeepSeek V4 Flash

2026/08/04 19:00

単一AMD MI300X上で動作する DeepSeek V4 Flash

RSS: https://news.ycombinator.com/rss

要約

Japanese Translation:

このリポジトリは、量子化(quantization)オフロードなしで単一の AMD MI300X GPU 上で DeepSeek-V4-Flash-0731 のハイパフォーマンスかつ生産環境でのデプロイを可能にする。このセットアップでは、ネイティブ精度と大容量コンテキストウィンドウがサポートされており、256K で検証され、アーキテクチャレベルでは最大 1M が対応可能である。また、AMD FP8 正誤エラー(FNUZ E4M3 バリアント起因)および MoE ルーティングのバグといった重要なハードウェア固有の問題を解決している。パフォーマンスベンチマークは例外的に優れている:シングルストリームモードでの持続的デコード速度が 1 秒当たり 168.6 トークン、プリフィル速度が 7.9–8.5K トークン/秒、メモリ不足またはエンジンエラーなしで 64 ストリーム跨过のバースト並列性が 1 秒当たり 830 トークンまで到達する。これらの成果を達成するには、vLLM に ROCm ナイトリーアーティファクト(vLLM_IMAGE: vllm/vllm-openai-rocm@sha256:e68d18b2ba50298661bfc49baf01158fbf036645c2362cccf3e8a7a79fe6c69a)を適用した特定のパッチが必要です。具体的には、MXFP4 ビットマトリックスルーティングマスク、フューズド SiLU 配置、gfx942 シェイプ用 AITER チューニングテーブル、FP8 キャッシュライターのシャッフル修正が含まれる。デプロイには大きなリソースを必要とする:HBM で約 192 GiB(最高水位は約 204.5 GB)、CPU KV テアで約 235 GiB のシステム RAM、ディスク容量で約 500 GB(モデルキャッシュ単体でも約 156 GB)。プロセスには、CUDA グラフキャプチャのための初期の起動フェーズ(約 5 分)が含まれ、その後健康チェックにより安定したメモリ使用量(GPU KV プールが約 20 GB、プレフィックスキャッシュ排退用 CPU テアが約 96 GiB)を確認する。準備完了後、システムは API エンドポイントを介して煙テストを行うことができ、これらは DSpark-7 推測デコード(確率的ドラフティングとブロック拒否)をサポートしている。このソリューションは、企業に最先端 AMD ハードウェアを複雑な AI ワークロードに効果的に利用するための産業グレードの経路を提供する。

本文

MI300X 単一カードでの DeepSeek V4 Flash 実行環境

このリポジトリは、AMD MI300X の一台で production 環境にて

deepseek-ai/DeepSeek-V4-Flash-0731
を動作させるための構成設定とパッチを提供します。 Docker Compose スタック、SHA-256 ピニングされたファイルオーバーレイ、upstream に対する参照差分、およびチューニングテーブルが含まれます。チェックポイントは出荷時のものであり、追加の重み量子化またはオフロードなしで動作します。


🚀 パフォーマンス結果 (vLLM ROCm nightly 0.26.1rc1.dev229+g124154a88.rocm723, AITER 0.1.19)

メトリック結果
シングルストリームデコード (各ストリームの中央値、DSpark-7)168.6 tok/s
プリフィル (チューニングカーネル使用時)7.9–8.5K tok/s
(出荷プロファイルでの新規プロンプト: 6,988–7,019 tok/s)
同時ストリーム数:8集計 542 tok/s、各ストリームの中央値 90.3 tok/s
ストライク(バースト)同時ストリーム数:64集計 830 tok/s、OOM なし、エンジンエラーなし
コンテキストサイズ256K が検証済み (アーキテクチャは最大 1M をサポート)
HBM 上の重み容量156.67 GiB — 追加の量子化または重みオフロードなし

⚠️ 重要な背景: 公式 vLLM レシピでは NVIDIA と新しい AMD ハードウェアが対象となっていますが、MI300X で信頼性高く動作させるためには以下の修正が必要でした。

  • FP8 フォーマットの正解性確保 (OCP セマンティクスとの互換性問題)
  • 高同時性における MoE ルーティングの修正
  • 因果推論および CPU-KV 同期の検証
  • チューニングされていないカーネル形状への対応

🖥 なぜ MI300X か?

MI300X は以下の特徴を備えており、単一 GPU デプロイメントに適しています。

  • 大容量メモリ: HBM3 が 192 GB、メモリバンド幅が 5.3 TB/s
  • コスト効率: H100 SXM5 より HBM 容量が 2.4 倍大きく、リストプライスでは約半分のコストで調達可能。
  • モデル収容: 304B パラメータのチェックポイントは全体が HBM に収まります。
    • PCIe を介した重みのストリーミングやレイヤーオフロードなし。
    • GPU KV ポール用に 20 GB の余地、CPU テア (DRAM) 用に 96 GiB を割り当て可能。
    • 1 枚のカードで 2–8 つの同時ストリーム(典型的な負荷)および最大 64 ストリームのバースト処理が可能。

FP8 実装の違い (重要)

  • MI300X (CDNA3) は AMD/Graphcore 独自の E4M3 の
    fnuz
    バリエーションを実装しています。
  • MI325X や以降のモデルは OCP 標準の FP8 を使用します。
  • 注意: OCP セマンティクスを想定したカーネルを MI300X で使用する場合、最大 2 倍の誤差が発生する可能性があります。そのため、FP8 実装の正解性が最優先事項であり、パフォーマンスチューニングはその後に行われました。

🛠 リポジトリ構成と追加機能

ファイル構造

.
├── compose.yaml         # Production スタック (vLLM ROCm + Caddy)、SHA-256 ピン固定版
├── Caddyfile.example    # Caddyfile へのコピー先(ホスト名・メール設定用)
├── vllm-entrypoint.sh   # 起動前に /dev/shm の陈旧 CPU-KV mmap を削除
├── SHA256SUMS           # ランタイムアーティファクトの SHA-256 ピニング
├── patches/             # バイト単位の Production オーバーレイ
│   ├── *.py            # コンテナ内で只読みとしてマウント(修正済みコード)
│   ├── diffs/*.patch   # upstream ベースリビジョンに対する差分形式
│   └── README.md       # 出所と再生成手順
└── tuning/              # パフォーマンスチューニング用データ
    └── *.csv           # gfx942 用の AITER A8W8 ブロックスケールテーブル

このリポジトリが追加する主な機能

  1. 正解性オーバーレイ: ピニングされた ROCm nightly 向け(upstream vLLM に未実装の修正を含む)。
  2. 検証済みのサービング構成:
    • 確率的 DSpark ドラフト、ブロック拒否、静的 K=7 を採用。
    • スケジューラー予算:2,048 トークン
    • 遅延を防ぐプリフィル上限:1,024 トークン
  3. AITER GEMM チューニング: gfx942 用の再帰的形状テーブルと MXFP4 専門家の OGS 幾何学オーバーライドをパッケージ化。
  4. ハイブリッド KV 戦略:
    • GPU キャッシュ:20 GB (
      fp8_ds_mla
      )。
    • CPU テアオフロード:96 GiB
    • upstream issue #47282 / PR #47291 のロード経路フェンシング修正を含みます(マージされていない修正)。

📦 デプロイ手順

1. ホストの要件確認

  • GPU: MI300X (gfx942, 304 CU, ~192 GiB HBM) × 1
  • OS/ドライバー: AMD カーネルドライバーが動作すること、最近の Docker Compose。
  • RAM: CPU KV テア用に ~235 GiB
  • ディスク: モデルキャッシュのみで約 156 GB、システム用で ~500 GB

2. ピニングされたランタイムとモデルをプル

以下のコマンドを実行し、公式 SHA-256 が固定されたイメージを使用します。

VLLM_IMAGE='vllm/vllm-openai-rocm@sha256:e68d18b2ba50298661bfc49baf01158fbf036645c2362cccf3e8a7a79fe6c69a'
MODEL='deepseek-ai/DeepSeek-V4-Flash-0731'
REVISION='7872f01b1d1fe23eabc4c98b48bffcef5a386062'

docker pull "$VLLM_IMAGE"
docker run --rm --entrypoint hf \
  -v /root/.cache/huggingface:/root/.cache/huggingface \
  "$VLLM_IMAGE" download "$MODEL" --revision "$REVISION"

3. ファイルの準備

# Caddyfile の設定(ホスト名、メール、ソース CIDR を編集)
cp Caddyfile.example Caddyfile 

# ディレクトリ作成と権限設定
mkdir -p aiter-cache crash-dumps
chmod +x vllm-entrypoint.sh

# シュムチェック(重要:初回起動前に必ず確認してください)
sha256sum -c SHA256SUMS

4. サービスの起動

docker compose config -q
docker compose up -d
docker compose logs -f inference

健康状態の確認

健康的な起動には約 5 分 かかります。以下のログがすべて表示されることを確認してください。

  • ✅ モデル読み込み:156.67 GiB
  • ✅ ドラフトモデル DSpark ロード済み:96 パラメータ
  • ✅ GPU KV キャッシュサイズ:1,927,444 トークン
  • ✅ 最大同時性比:7.35 倍 (262,144 トークン)
  • ✅ mmap ファイル作成:
    /dev/shm/vllm_offload_...mmap
    (103.08 GB)
  • ✅ CUDA グラフキャプチャ (FULL)

メモリチェック 起動完了後、以下のコマンドで VRAM を確認してください。

rocm-smi --showmeminfo vram
  • ウォームアップ後の最高水位は約 204.5 GB (総容量 205.8 GB) です。
  • 警告: 数百 MB のみ残っている場合、サーバーは起動しますが、最初の要求で失敗する可能性があります

5. スモークテスト

HOST='your-host.example.com'
curl -fsS "https://$HOST/v1/models"

# プロンプト: Calculate 17 * 23. Answer with the number only.
curl -sS "https://$HOST/v1/completions" \
  -H 'Content-Type: application/json' \
  -d "{\"model\": \"deepseek-ai/DeepSeek-V4-Flash-0731\",
       \"prompt\": \"Calculate 17 * 23. Answer with the number only.\",
       \"temperature\": 0, \"max_tokens\": 32}"

🧩 パッチの概要 (重要修正)

patches/*.py
は、コンテナ内で只読み (
ro
) でマウントされるフルファイルオーバーレイです。

オーバーレイマウント先パス修正内容必須条件
gpt_oss_triton_kernels_moe...
fused_moe/experts/gpt_oss_triton_kernels_moe.py
MXFP4 ビット行列パディングレーンの修正 (グローバル境界マスク) + フューズ SiLU + 高速 DeepSeek ルーティングMXFP4 Triton パス使用時。標準マスクでは忘却なスキーマを引き起こします。
mxfp4.fused-silu.py
fused_moe/oracle/mxfp4.py
フューズ SiLU カーネル用のゲート/インタリーブレイアウト修正フューズ SiLU オーバーレイ使用时のみ。標準 SiLU を維持する場合はスキップ可。
triton-kernels-matmul-ogs-opt...
matmul_ogs_details/opt_flags.py
gfx942 MXFP4 OGS タイル幾何学 (最大 1,536 ルート行) の設定gfx942 での性能向上。標準ではルート行>768 で劇的に劣化します。
fused_compress_quant_cache...
common/ops/fused_compress_quant_cache.py
FNUZ FP8 + ライトニングインデキサーの 16×16 事前シャッフルMI300X で必須 (MI325X/MI355X は OCP)。バイト配列形式を解釈すると 2 倍エラー。
aiter_pa_mqa_logits.i64.py
aiter/ops/triton/gluon/pa_mqa_logits.py
KV オフセット 64 ビットオフセットの補正KV ポールが 4 GiB を超える場合に必須。小さい場合はスキップ可。
rocm_aiter_mla_sparse.prefill...
rocm_aiter_mla_sparse.py
決定論的 torch.topk + ブロック H=64 のヘッダー事前フィルタツールコール再現性を確保するため必須。ブロック H=64 はパフォーマンス向上。
rocm_aiter_mla.dspark-causal.py
v1/attention/backends/mla/rocm_aiter_mla.py
因果多トークンスペキュレイティブ検証ロジックROCm 小頭 MLA での DSpark 動作に必須 (現状 upstream と同じ)。
dspark-speculator.independent...
spec_decode/dspark/speculator.py
ドラフト提案 Gumbel ノイズの独立化 (塩付け)
draft_sample_method=probabilistic
使用时のみ。
kv_offload_cpu_gpu_worker.load...
cpu/gpu_worker.py
CPU→GPU KV ロードパスのフェンス (#47282, #47291)
--kv-offloading-backend native
を使用する場合のみ必須。

🛑 2 つの致命的な正解性修正の詳細

  1. MXFP4 ルーティング: パディングレーンをグローバル境界ではなく論理的ブロックサイズでマスクしない場合、ルーティングマトリクスが汚染され、似ているツール名や長いプロンプトでの「忘却」が発生します。
  2. FP8 フォーマット: DeepSeek V4 のキャッシュは
    float8e4b8
    (シャッフル済み) です。OCP 形式を MI300X に使用すると最大 2 倍の誤差が出ます。

⚡ スペキュレイティブデコード & パフォーマンス

デコード性能

Production 構成における主要な最適化と結果です。

変更内容効果・結果
A8W8 GEMM 形状チューニング (gfx942)シングル/ダブルストリーム +42–62%
8–64 ストリーム +10–35%
フューズ SiLU & 高速ルーティングC1 デコード:34.5 → 56.6 tok/s (+64%)
ルーティング速度: 42.6 → 11.9 µs/レイヤー
ブロック H=64 スパーサプリフィルプリフィル到達:7.9–8.5K tok/s
スパーサテンショントレース: 317 → 142 ms/要求
静的 K=7 & 確率的ドラフトシングルストリーム正解性:119.5 tok/s
スケジューリング最適化 (2K 予算, 1K プリフィル上限)短い要求の TTFT: 8.2 s → 0.5 s (52K クールドプリフィル後)

ファイナルコンカレンシースウィープ結果

  • 条件: プロンプト約 400 単語、ストリーミング、温度=1.0, top_p=0.95。
  • 出力: C1–C8 で 512 トークン、C64 で 256 トークン。
ストリーム数集計 tok/s各ストリーム中央値デコードTTFT p50
1126.2168.6 tok/s1.026 s
2145.4152.7 tok/s0.939 s
4316.8108.6 tok/s0.369 s
8542.390.3 tok/s1.027 s
64830.216.4 tok/s2.190 s

DSpark について: 受入率はプロンプトに依存します。これらはユニバーサルベンチマークではなく、この正確な構成のためのゲート値として扱ってください。

プリフィル性能の詳細

  • チューニングカーネル使用時: スケジューラー予算に応じて 7.9–8.5K tok/s まで到達可能 (C1: 8.192T で 7.90–7.99K)。
  • Production プロファイル: レイテンシ分離のため予算を 2,048 トークン に制限し、新規プロンプトでは 6,988–7,019 tok/s
  • プリフィル上限: 設定 1,024 トークン。これにより 8.9K プロンプトでも C1 で 5.20–5.29K tok/s を維持。
  • TTFT 改善: 52K クールドプリフィルを待たずに並ぶ短い要求の TTFT は、8.2 s から 0.5 s に劇的に低下。

⚠️ Production ノート (注意事項)

  • HBM ヘッドルームは限られています。
    • ウォームアップ後の最高水位:204.5 GB (総容量 205.8 GB)。
    • 警告: 30 GB の KV ポールをロードすると、
      HSA_STATUS_ERROR_OUT_OF_RESOURCES
      エラーでグラフキャプチャ中に失敗します。
    • --kv-cache-memory-bytes
      を引き上げず、HBM 使用量の増大を厳密に監視してください。
  • CPU KV テアの扱い
    • --kv-offloading-size 96 --kv-offloading-backend native
      は、破棄されたプレフィックスキャッシュエントリ用に
      /dev/shm
      ~103 GB をマッピングします。
    • エントリーポイントスクリプトはクラッシュ後の陈旧マップを自動削除します。
  • スケジューラー警告について
    • DSpark-7 は 2,048 トークン予算からドラフトスロットを予約するため、1,664 トークンのスケジューラー警告が予期されます。
    • 予算を引き上げると、利用可能な KV 容量が減ります。
  • 起動直後の挙動
    • カーネルウォームアップが必要: 最初のプリフィルはカーネルを初期化します (8.9K トークンで約 5.3 秒かかる)。その後の実行は約 1.7 秒です。
    • 必須操作: トラフィックを受理する前に、未キャッシュのプリフィルを実行してください。
  • 正解性テストの重要性
    • スループットだけでなく、以下のバリデーションスイートで正解性を必ず確認してください。
    • 2 ターンのツールコールフィクスチャ。
    • BFCL サブセット (正確な呼び出し 74–76/90)。
    • OpenCode ツールスキーマチェック。
    • 380K トークンニードルリコール (ネイティブおよび DSpark パス両方)。

📜 ライセンスと出所

  • スタック・ドキュメント・オーバーレイ: Apache-2.0 (AITER 由来のものは MIT ヘッダー保持)。
  • モデル: DeepSeek-V4-Flash-0731 は MIT ライセンス。
  • 差分ベース:
    patches/README.md
    に各アップストリームベースリビジョンが記録されています。

📚 参考文献

すべてのリンクは検証済み(2026 年 8 月 4 日時点)です。

同じ日のほかのニュース

一覧に戻る →

2026/08/05 7:01

インターポールが警告、アフリカのサイバー犯罪の半分以上を AI が支えデジタル詐欺急増

## 日本語訳: 以下に、元の草案から欠落していた特定の地域的なニュアンスおよび文脈源をより適切に統合しつつ、明瞭さを維持するためにもたらされた改善されたバージョンが示されます。 ## サマリー(改善版) INTERPOL の 2026 アフリカサイバー脅威評価によると、人工知能はアフリカ全体でサイバー犯罪における支配的な力となり、報告された事例の半分以上を原動力とし、2024 年の 1,9200 万ドルから 2025 年には 4,8400 万ドルへと金融損失を増大させています。状況は地域によって多様です:西アフリカおよび南部アフリカは主要な詐欺センターを擁しており(調査対象国の 72% で特定)、中央アフリカではビジネスメールへの侵害やロマンス詐欺の発生率が高く、東アフリカではモバイルマネー詐欺、重要インフラに対するランサムウェア攻撃、合成アイデンティティ犯罪に苦しんでいます。特定のセックス extortion の急増が明らかで、TrendAI がディープフェイクに関連する約 60 万件の事例を検出しています。犯罪者はこれらのツールをソーシャルメディアやモバイルマネーおよびデジタル銀行のようなプラットフォームと組み合わせ、ローンの目的や SIM カード登録のために合成アイデンティティを伴う複雑なスキームを実行するために使用します。しかし、依然として重大な脆弱性が存在しており、特に南部アフリカのように高度なデジタル接続を有する国々において、銀行、通信事業者および法執行機関間の弱い連携は、犯罪者が盗まれた資金を瞬時に国境を超えて移動させることを可能にしています。これらの課題にもかかわらず、対応は増えつつあります;2025 年だけでも、セネガルの新しいオンライン報告プラットフォームを含むサイバー犯罪法の更新を行ったアフリカ諸国は 17 カ国あり、Serengeti 2.0 など共同作戦を促進し、それらは 1,500 件以上の逮捕と 1 億ドル以上の資金の回復をもたらしました。将来のセキュリティは、これらの進化する AI 駆動型の脅威に対処するために、持続的な国際協力および強化された地域準備に依存します。

2026/08/05 1:36

Mistral の Shieldstral:マルチモーダル検閲向けに公開された 3B オープンウェイトモデル

## 日本語訳: Shieldstral は、NVIDIA との Open Secure AI Alliance の初メンバーとして Apache 2.0 ライセンスの下でリリースされた、30 億パラメータを持つオープンウェイトのマルチモーダル安全性分類器です。このモデルは、テキストと画像の安全性評価を単一の適応型インターフェースに統合し、1 トークンから定量化された連続的な安全性スコアを返します。Shieldstral は、コンテンツモデレーションを文脈・厳格度に適応する質問応答タスクとして位置付け、推論時に再トレーニングなしで平易な言語でのポリシーを受け入れる 3 つのコンポーネント(<Instruct>:文脈/厳格度、<Query>:はい/いいえの安全性に関する質問、<Document>:評価対象のテキストまたは画像)を採用しています。Shieldstral は、プロンプト分類、回答モデレーション、拒否検出、毒性検出を単一の適応可能な問題に統合します。性能については、テキスト安全性、拒否検出、ポリシー適応性、マルチモーダルベンチマークにおいて、最大 7 倍のサイズを持つオープンガードモデルと同等かそれ以上の性能を示し、1 つの 16GB の NVIDIA GPU で効率的に動作します。Forge 上でのエンドツーエンドトレーニングでは、多様なラベル形式を持つ現実および合成データを組み合わせたヘテロ지니어ズなデータを使用し、以下の 4 つの主要な課題に取り組んでいます:(1)ヘテロ지니어ズなデータタクソノミーの統合、(2)暗記ではなく判別の学習、(3)画像に基づく安全性の根拠付け、(4)LoRA と SLERP メージを介した補完的なチェックポイントの組み合わせです。データ処理では、ソースごとの厳格度調整(ジャイルブレイク用は厳しく、回答品質用は緩い)を行い、定量化された意思決定境界を学習し、一般的な画像データセットを負例として使用するとともに、視覚・言語再ランク付けにより誤ラベル付けされたペアをフィルタリングしました。今後の計画としては、多言語対応の拡大、長文書に対する堅牢性の向上、およびマルチモーダル安全性機能の幅広化が含まれます。

2026/08/05 0:16

Show HN: 肌の色調を多様化する単純なアルゴリズムと色彩空間

## Japanese Translation: このプロジェクトは、デジタルアートおよびキャラクター作成向けに包摂的なツールを促進することを目的とした、簡略化された RGB ベースの色空間を導入します。これは、現在のシステム(絵文字:5 色、メイクアップパレット:約 50 色など)の限界に対処するものです。本モデルは、生物学的要因(メラニンや血流など)、個々のバイアス、健康状態(例:黄疸など)、および異なるディスプレイ環境によって複雑化している人間の肌トンの莫大な複雑性に対する科学的権威を主張するのではなく、実用的で「十分良好な」エンジニアリングの起点を優先します。手法は、手動での RGB データラベリング、主成分分析(PCA)によるデータセットの変換、Desmos 3D、SymPy、matplotlib、scikit-learn などのツールを用いた球面式のフィッティングを含みます。得られたシステムは、PCA 軸から導かれる 3 つの独立した値を利用し、UI を介して調整されます。ここで、可変的な球半径パラメータは色の変化を制御します;具体的には、この半径を小さくすると、すべての肌トーン(深肤色、白人、冷色調、温色調)において一様に変化が減少し、特定のグループを不均衡に排除することはありません。原点点はニュートラルな曖昧なトーンを表し、マッピングバイアスを特定するために有用です。今後の作業では、専門家ラベラーを用いてモデルを微調整し、黄疸や白斑症などの状態に対する簡略化された表現を取り入れる予定です。本アプローチは科学的でないことを認める一方で、エンジニアリング用途においては依然として非常に機能性を備えていることを認識しています。