
2026/08/30 3:22
vLLM 0.28.0
RSS: https://news.ycombinator.com/rss
要約▶
Japanese Translation:
このリリースは、主要なアーキテクチャ変更と拡張ハードウェアサポートにより AI 推論を加速することに焦点を当てた決定的なアップグレードです。主なパフォーマンス向上としては、ファインズドカーネルによって大きなモデル(特に MegaMoE)で最大 1.5〜3 倍の高速化、推論の最適化(DFlash2/DSpark)、GPU ごとに約 17 GiB のメモリ節約を実現する共有エキスパートシャッディングなどがあります。この更新はハードウェア互換性を大幅に拡大し、NVIDIA アーキテクチャ(Blackwell SM90/B12X を含む、ネイティブな DSA/FlashInfer パスを備えたもの)および AMD ROCm プラットフォーム(gfx950/gfx120x)、MLA および FP8 推論向けの特定の最適化を可能にします。
機能面では、Weight Offloading、マルチレイヤー MTP KV キャッシュ、アテンション不要なモデルサポートといった機能を備えた Model Runner V2 が導入されました。また、バッチトークン上限値を 16384 に倍増させたり、Mamba モデルにデフォルトでプレフィックスキャッシュを有効化したりするなどの推論デフォルトも標準化されています。エコシステムの主要な更新としては、PyTorch 2.12 と Transformers 5.15.0 への移行が必須となり、ディスクオフローディングをサポートする階層型 KV キャッシュシステムが追加されました。さらに、gRPC を通じたネイティブ Rust フロントエンドサポートが追加され、Muse Glimmer、Ling 3.0 Flash、Qwen3.8 など多数の新しいモデルへの対応も開始(AMD 向け)。組織は、これらの高度な機能を利用するために、非推奨化された関数や特定の依存関係に関する破壊的な変更に対応する必要があります。
本文
vLLM 0.28.0 リリースノート
ハイライト
vLLM 0.28.0 は、Kimi-K3 の大規模最適化およびDeepSeek V4のサポートを主軸とした重要なリリースです。76 名の新しいコントリビューターを含む 584 コミットで構成されています。
Kimi-K3 パフォーマンス強化
スタック全体における Kimi-K3 向けの大規模最適化 (#50484, #50654, #51311 など) が実施されました。
- DCP(Decode Context Parallelism)のサポート導入
- 融合型 FlashKDA デコードおよびプリフィル カーネルの実装
- MegaMoE への SiTU(スループット内活性化) サポートの追加
- シーケンス並列性用の GEMM-RS の実装
- カーネルレベルで 1.5〜3 倍のパフォーマンス向上 (#51070) を達成
- 適応的な推論用トークン予算の採用により、DSpark TTFT が約 60% 改善 (#51725)
- オプションの共有エキスパートシャッディングによる GPU あたり約 17 GiB のメモリ節約 (#50912)
- V2 モデルランナーの実装により、Kimi-K3 が ROCm で動作可能に (#51653)
DeepSeek V4 サポート
スパース MLA(Mixture of Long Attention)によるエンドツーエンドの実現が完了。
- 通常のデコード、MTP、DSpark 推論的デコードの全対応 (#51538)
- AMD Quark NVFP4 サポート (#47972)
- リゾニング努力プロンプトおよびマッピング (#50580)
- スパース Top-k メタデータカーネルの最適化 (#52084, #51967)
- 緊密な eager CUDA グラフ領域の実装 (#51430, #52401)
- gfx11 および gfx950 での ROCm 実装 (#47017, #52212)
その他の主要機能と改善
- 推論的デコード: DFlash2(ローカル畳み込みと候補セレクター付)(#52816)、DSpark による信頼度スケジューリング検証 (#47808)、ドラフトモデル向けの非同期スケジューリング自動有効化 (#48341)
- Model Runner V2: E/P/D の disaggregation、ウェイトオフロード、マルチレイヤー MTP KV キャッシュサポート、トランスフォーマーおよびアテンションフリーモデルの対応。
- KV キャッシュオフロード: ディスクオフロード (#49644)、アウトオブツリー二次階層マネージャー、ティアリング指標の実装。
- Rust フロントエンド & gRPC: 独立したレンダラー、gRPC によるマルチモーダル画像推論、明示的なデータ並列ランクルーティングの追加。Protobuf スキーマが公開されました。
- デフォルト設定の変更:
が 8192 から 16384 に引き上げられた (#51726)max_num_batched_tokens- Mamba モデル向けにプレフィックスキャッシュがデフォルトで有効化されました (#50991)
- Blackwell CUDA グラフキャプチャのデフォルトは 1024 に設定されました (#49390)
互換性のない変更 (Breaking Changes)
以下の更新により、旧バージョンからの移行時に注意が必要です。
- bitsandbytes のサポート: アウトオブツリープラグインに移行了されました (#43529)。
- Transformers のアップデート: バージョンが 5.15.0 に更新されました (#51668)。
- 機能の削除:
- 非推奨の
(実行時 KV スケール計算)が削除されました (#49389)。calculate_kv_scales
が削除されました (#48684)。override_attention_dtype
- 非推奨の
リリースアーティファクト
Python Wheels
| プラットフォーム | インストールコマンド |
|---|---|
| PyPI (CUDA 13.0) | |
| PyPI (CUDA 13.0, uv) | |
| ROCm | |
Docker イメージ
| プラットフォーム | Docker イメージ |
|---|---|
| CUDA 13.0 (デフォルト) | ( も動作します) |
| CUDA 12.9 | |
| CUDA 13.0 + Ubuntu 24.04 | |
| CUDA 12.9 + Ubuntu 24.04 | |
| ROCm | |
| CPU | |
| XPU | |
その他のアーティファクト
Assets セクションより以下も入手可能です:
- ソースディストリビューションの tarball
- x86_64 および arm64 向けの CUDA 12.9 Python wheels
- x86_64 および arm64 向けの CUDA 13.0 Python wheels
- x86_64, arm64, macOS 向けの CPU Python wheels
モデルサポートと拡張
新規・対応モデル
- Muse Glimmer (#51655)
- Ling 3.0 Flash: BF16、MTP、パーサーサポートを備えたバージョンおよび FP8 バリアント (#51045, #51265)。
- Dots3 NOTE: ネイティブマルチモーダルサポート (#51255)。
- Interns2mobius (#51149)
主要モデルの改善
- Qwen (AMD ROCm): Qwen3.8 対応 (#50068)、GDN 用融合型 CUDA カーネル (#51674)、GDN ゲート調整 (#51812)。
- Transformers モデリングバックエンド: MLA サポート、ハードウェア非依存モデル定義、強化されたマルチモーダルパスの実装。
- LoRA: Gemma4 用のビジョンタワー LoRA、Keye と Ultravox の追加対応。
- ビジョンエンコーダ: Kimi-K2.5 および Ernie-4.5-VL 用の ViT フル CUDA グラフ、Qwen3-VL エンコーダー用 torch.compile の採用。
- MoE: Mistral Large 3 向けの EPLB サポート拡張および追加 MoE バックエンドの導入。
パフォーマンスと安定性
- 推論的デコードカバレッジ: KimiLinear への EAGLE3 サポート、Qwen3.6 dSpark アクセプタンス対応。
- 正しさと安定性: MiniMax-M3 NVFP4 推論、圧縮テンソル FP8 MoE SwiGLU パラメータの修正、可変長オーディオバッチパディングの実装、Qwen3-Omni クラッシュ修正など多数のバグフィックス。
- マルチモーダルパフォーマンス: オンデバイスマルチモーダル前処理正規化の融合、高速プレースホルダーおよびトークン一致スキャンの実装。
エンジンコアとスケジューリング
推論的デコード(Inference Decoding)
- DSpark 信頼度スケジューリング検証 (#47808)
- Top-k DSpark マーコフ投影 (#49969)
- DFlash2:ローカル畳み込みと候補セレクター付きの実装 (#52816)。
- ドラフトモデル向け非同期スケジューリングの自動有効化 (#48341)。
- MTP 尾部全還元とローカル argmax ドラフトトークンの融合 (#49793)。
- 推論的スケジューリング入力トークン向けの適応予算 (#51725)。
KV キャッシュ & スケジューリング
- MLA チャンク化文脈向けのリクエスト別スケジューリング (#50613)。
- 微細粒度プレフィッチマッチングによる部分尾部プレフィックス再利用 (#50507)。
- KV キャッシュレイアウトリファクタにおけるバックエンド公開 KV パッキングの実装 (#51612, #51704)。
- プレフィックスキャッシュ OFF 時における LIFO 解放ブロック再利用順序の復元 (#51482)。
- 優先度スケジューリングでのサイレントリクエストスキップ修正 (#49206)。
パフォーマンス向上
- GPU<->CPU シンクロ化の排除を CI シンクロチェックで守る仕組みの実装。
- 予測子フィルタリング付き新 JIT ウォームアップインフラ (#49315)。
- 8 ワープでの Top-k/top-p Triton サンプラー起動 (#51507)。
- オフラインビーム検索でのデトケナ化スキップ (#50333)。
- 長期コンテキスト MLA キャッシュ集約の最適化 (#51739)。
ハイブリッド & Mamba
- デフォルトでプレフィックスキャッシュ ON (#50991)。
- Mamba アテンションモジュールリファクタの最終段階 (#44857)。
- 状態コピー Triton カーネルの 3D グリッドタイル化 (#49436)。
RL ワークフロー & 堅牢性
- NCCL およびスパース NCCL による状態保持型トレーニング送信。
- タグ選択型 GPU メモリ解放用の
(#52514)。CuMemAllocator.discard() - シングルノードエグゼキュータ向けの
rendezvous が起動ポート競合を排除 (#50999, #51652)。file:// - エンジン起動中のフロントエンドプロセス監視機能の実装。
ハードウェア & パフォーマンス対応
NVIDIA
- SM12x 向け FlashInfer XQA デコードサポート (#49718)。
- SM100 向け CuTeDSL 融合クエリカーネル (#49792)。
- MTP=3 用の SM90 ネイティブ DSA デコードパス (#52164)。
- GB10 融合型 MoE FP8 チューニング設定 (#52502)。
AMD ROCm
- torch 2.12 / triton 3.7 スタックのアップグレード (#50607)。
- GFX120x 向けの AITER および FP8 推論有効化。
- gfx11 向け DeepSeek-V4 サポート (#47017)。
- gfx950 向け最適化 Triton スパース MLA デコード (#52212)。
- 4-bit TurboQuant KV キャッシュ向けの FlyDSL デコードアテンションカーネル。
- Kimi-K3 KDA デコードカーネルの融合 (#50654)。
Intel XPU
- ブロックワイス GEMM を含む torch 線形バックエンドの実装。
- INC DeepSeek V4 モデル向け MXFP8 線形ウェイトの実装。
- 計算とのオーバーラップを持つ非同期スケジューリング PP サンプルドトークンブロードキャスト。
CPU
- DeepSeek-V2/V3 が CPU で動作可能な MLA バックエンド (#49453)。
- triton-cpu ウィールの実装 (#52092)。
- s390x 向けの GPTQ および AWQ 有効化 (#51148)。
大規模サービシング (Large Scale Serving)
E/P/D disaggregation
- Model Runner V2 の E/P/D サポート (#38390)。
- GPU サイド前処理による重複画像前処理の削除 (#50390)。
- EC コネクタースケジューラー/ワーカーメタデータ配管の実装。
KV オフロード & Mooncake
- SimpleCPUOffloadConnector 向けのディスクオフロード (#49644)。
- module_path を通じたアウトオブツリー二次階層マネージャーの実装。
- ストアグループセマンティクス (#44956)、テナント ID サポート (#48069) の追加。
コネクター & 並列性
- NIXL 互換性ハッシュに含まれる転送モード (push/pull) の実装。
- EPLB バランス計算の修正およびテスト (#51813)。
- 高密度マルチノード DP の再スコープ (#49212)。
クwantization(量子化)と新カーネル
オンライン量子化
- オンライン MXFP4 サポートの実装 (#49347)。
- TP 間で共有されるオンラインウェイトスケール (#49764)。
- オンライン NVFP4 エキスパートパッキングでの精度保持 (#50029)。
NVFP4 & 新カーネル
- CUTLASS 経由のバッチ不変 NVFP4 MoE の実装。
- ブロックワイス scaled_mm (#49932)。
- エミュレーションカーネル付き DeepSeek-V4 AMD Quark NVFP4 (#47972)。
- SwiGLU-OAI および ReLU2 アクティベーション付き CuTeDSL MoE。
修正
- 動的 INT8 W8A8 MoE 設定の修正 (#50833)。
- TritonExperts クラッシュの修正 (#51411)。
- FlashInfer CUTLASS 用の MXFP4 変換 (#51038)。
API & フロントエンドの新機能
全般
- HTTP ヘッダーからのリクエスト優先度解析 (#51089)。
- セッション ID の配管機能 (#48048)。
- /inference/v1/generate への content_parts の追加 (#51478)。
- vLLM レシピのネイティブ設定ベースデプロイおよびベンチマークとの接続。
Rust フロントエンド
- 独立したレンダラー (#50289)。
- gRPC マルチモーダル画像推論 (#50368)。
- 明示的なデータ並列ランクルーティング (#51178)。
- RL ライフサイクル制御 (#51316)。
互換性と構造化出力
- Anthropic API: クライアント原因のエラーに対する 4xx レターン、disable_parallel_tool_use の保持。
- Cohere: アップストリームのパーサー修正、ベクトル化されたバイナリ埋め込みビットパックング。
- 構造化出力: xgrammar での要求停止トークンマスクの実装、未使用トークン ID の拒否。
堅牢性
- uvicorn シグナルハンドラの競合回避による無効化 (#50916)。
- 統合されたエントリーポイント例外ハンドラー (#52261)。
- 高価な作業前の生成入力バウディング (#51447)。
セキュリティと依存関係
セキュリティ対策
- サンプリートレート模倣による DoS 攻撃の防止(オーディオデコード耐久性ガードを回避)(#49948)。
- DeepStream は GPU バックエンドとして分類され、ピクセル限度が適用される (#50755)。
が_load_ov2_processor
でガードされる (#52952)。resolve_trust_remote_code
主要な依存関係のアップデート
- Transformers: 5.15.0
- huggingface-hub: 1.27.0
- ROCM: torch 2.12, triton 3.7, torchaudio, torchvision
- ランタイムイメージは Ubuntu 24.04 にアップグレード。
コントリビューター情報
新規コントリビューター
以下のメンバーが初めて貢献しました(一部リスト): @acheamponge, @acmore, @anhtra3889, @anujbolewar, @arthurgao2003, @baodii, @bitborne, @bohnstingl, @ccaadaro, @cmiyai, @d4l3k, @dmai-afk, @dmholtz, @efschu, @fangchenli, @fanxingran, @fatday, @fattchris, @fcui-amd, @gabriel-peracio, @gchinora, @guanxingithub, @haregali, @hsusul, @iwannagotobed, @jacobzhang22, @jairitAge, @jamesETsmith, @Jimmy-adams, @jyan-R, @Kaif10, @karen-sy, @Lin-z-w, @liushujia122, @Luosuu, @mispa-ms, @mkhazraee, @NVShreyas, @pavelzak, @positive666, @rajfirke, @Rapisurazurite, @rchalamala, @RobbieJ, @ruirui6946, @RyanJHamby, @samuelkim7, @shanewidanagama, @shikamd123, @SilenNaihin, @skysnow2001, @Sundaresan-G, @syedalijaseem, @taking-lying-flat, @tandixit95, @Tejas-Raj01, @theminghuang, @tobymao, @TrainToGPB, @tzulingk, @UgaTheDev, @varoudis, @Vegetog, @vitamin-chaos, @wangxian001, @WillZZZy, @xiaopusun, @xijiaat, @xudonlyu, @yifjiang, @yu-xin-c, @zcxGGmu, @ziqifan617, @zobinHuang
全体的なコントリビューター
@yewentao256, @AndreasKaratzas, @njhill, @mgoin, @aoshen02, @khluu, @hmellor, @stefankoncarevic, @taneem-ibrahim, @LucasWilkinson, @chaunceyjiang, @jikunshang, @zufangzhu, @bigPYJ1151, @NickLucche, @askliar, @fxmarty-amd, @Rohan138, @gty111, @zhenwei-intel, @Isotr0py, @jeejeelee, @ZJY0516, @wangxiyuan, @BugenZhao, @yma11, @zyongye, @DarkLight1337, @jperezdealgaba, @zhou9402, @connorcarpenter15, @kliuae, @lucifer1004, @Alex-ai-future, @aarushjain29, @TheEpicDolphin, @chaojun-zhang, @pmanczak, @WoosukKwon, @BabyDrangoner, @noooop, @almogtavor, @hongxiayang, @fuscof-ibm, @gau-nernst, @zxd1997066, @tlrmchlsmth, @music-dino, @zexplorerhj, @S1ro1, @jdebache, @sfeng33, @mayuyuace, @ganeshr10, @benchislett, @tzulingk, @gcanlin, @ivanium, @divakar-amd, @R3hankhan123, @sagearc, @vhagor, @ronensc, @micah-wil, @qyYue1389, @vanshbhatia-amd, @hao-aaron, @chengy-sysu, @elvircrn, @taking-lying-flat, @omerpaz95, @Etelis, @vllmellm, @frank-suwen, @KernelClint, @Fangzhou-Ai, @louie-tsai, @simondanielsson, @maxyanghu, @dmai-afk, @KurodaKanbei, @ziqifan617, @bastefaniak, @ECMGit, @haregali, @cmiyai, @fede-kamel, @drakosha, @vineethsaivs, @zcxGGmu, @TQCB, @skysnow2001, @shenoyvvarun, @karen-sy, @fattchris, @RyanJHamby, @shikamd123, @namgyu-youn, @zzt93, @abmfy, @reidliu41, @Rapisurazurite, @tandixit95, @mganczarenko, @yimdev, @anujbolewar, @LiuYinfeng01, @lk-chen, @NVShreyas, @huangzhilin-hzl, @varoudis, @Yejing-Lai, @mkhazraee, @jzakrzew, @TrainToGPB, @waynehacking8, @zixi-qi, @Sundaresan-G, @mindungil, @bitborne, @Wauplin, @jacobzhang22, @zhewenl, @bnellnm, @pisceskkk, @Lin-z-w, @gabriel-peracio, @SilenNaihin, @baodii, @YunzhuLu, @xwu-intel, @BWAAEEEK, @thisjiang, @maobaolong, @anhtra3889, @JaredforReal, @lvhan028, @xiaolong-intel, @andyxning, @cleonard530, @gnovack, @MatthewBonanni, @wangxian001, @lengrongfu, @Tejas-Raj01, @simon-mo, @vitamin-chaos, @arpera, @jairitAge, @jimmy-adams, @ILikeIneine, @woosebastian, @haic0, @edwinlim0919, @fcui-amd, @jhu960213, @jinzhen-lin, @coltonottley, @walterbm, @meenchen, @matteso1, @djramic, @gchinora, @davidjpyu, @tianmu-li, @xiaopusun, @majunze2001, @Vegetog, @puririshi98, @janeyx99, @RobbieJ, @oonyshch, @thegoldenflow, @Srinivasoo7, @fatday, @acheamponge, @efschu, @rajfirke, @fanxingran, @xudonlyu, @lcskrishna, @xijiaat, @GirasoleY, @d4l3k, @samuelkim7, @tarukumar, @acmore, @theminghuang, @khushali9, @wzhao18, @Priyjain-amd, @yiz-liu, @lkm2835, @dmholtz, @Dao007forever, @liushujia122, @LopezCastroRoberto, @UgaTheDev, @tuukkjs, @aditi-amd, @guan404ming, @yiliu30, @zou3519, @Luosuu, @JoursBleu, @varun-sundar-rabindranath, @mpashkovskii, @yu-xin-c, @WillZZZy, @vrdn-23, @xyang16, @ccrhx4, @tanpinsiang, @russellb, @fxfxfxfxfxfxfxfx, @afriedri, @yifjiang, @Akashcodes732, @HF-001, @ovidiusm, @arthurgao2003, @TomerBN-Nvidia, @hotTea123, @vx120, @bohnstingl, @qwerqwerqwe8688-jpg, @jasonozuzu-cohere, @vineetatiwari27, @ruirui6946, @linitra24, @syedalijaseem, @nickus, @yzong-rh, @s3woz, @jhaotingc, @lukealonso, @Jie-Fang, @kzwrime, @xianbaoqian, @velonica0, @ccaadaro, @yisustc, @fangchenli, @iwannagotobed, @zobinHuang, @rchalamala, @shanjiaz, @jamesETsmith, @stacyroberts, @guanxingithub, @biswapanda, @shanewidanagama, @UranusSeven, @hsusul, @tobymao, @mispa-ms, @jeffreywang88, @SayHelloToWorld, @jyan-R, @oops-oom, @shantipriya-amd, @andakai, @akii96, @shen-shanshan, @Kaif10, @yitingdc, @positive666, @pavelzak, @SubSir, @ywang96