{"id":34677,"topic":"ai","source":"网易","title":"大模型本地部署最强引擎，vLLM 大版本更新 - 网易","url":"https://www.163.com/dy/article/L1LN5D4R0519EA27.html","url_hash":"2e17e3b58d18b4c834a4c2ae953b13d4edc8eba7","author":"","summary":"<a href=\"https://news.google.com/rss/articles/CBMiYkFVX3lxTE9KcHBWSHhKajN3T1hjTUdkUDYwTUFTT1VsUzc3MGlBMmFmeVRMdFlQR0lpcFFMVWRPWF9sT09NZ0dsTnRiV1J2eE94Rm1QRWZJVkR6aVA5cEJocFNpeGpJOFZn?oc=5\" target=\"_blank\">大模型本地部署最强引擎，vLLM 大版本更新</a>&nbsp;&nbsp;<font color=\"#6f6f6f\">网易</font>","content":"vLLM 又搞大动作了，月初刚发了0.24，我详细分析过：\n今天 v0.25 正式版发布了\n老规矩，本文就所有更新，挑重点给大家分享一下\n先来一张全景图，一眼看懂这次更新的核心模块：\nvLLM v0.25 核心更新全景图 新模型支持一览\n这版新支持的模型架构不少：\n模型\nMiMo-V2.5\n小米最新视觉-语言模型\nLaguna XS.2\n新架构，支持 DFlash\nMoondream3\n轻量多模态，支持 query 和 caption\nQianfan-OCR\n百度千帆 OCR 模型\nCohere MoE\nCohere 的 MoE 架构\nDeepSeek V4\n新增 AMD/ROCm 支持 + 流水线并行\nQwen3.5\nMamba 混合架构，Model Runner V2 支持\n特别提一下DeepSeek V4 现在可以跑在 AMD 卡上了，对于不想被 NVIDIA 绑架的同学来说是个好消息\n多硬件平台扩展\nvLLM 现在的硬件覆盖面越来越广：\n- AMD ROCm 7.2.2— DBO 动态批优化、Fused Allreduce+RMSNorm、Fused Shared Expert \n- CPU— FP8 attention for AMX/AVX-512，FP8 W8A16 linear/MoE，RISC-V 支持 \n- Intel XPU— top-k/top-p 采样、out-of-place all-reduce、LoRA \n- IBM Power— VSX 注意力后端 \n从 NVIDIA 到 AMD 到 Intel 到 IBM，甚至还有 RISC-V，vLLM 这是要做推理引擎界的\"全平台通吃选手\"\n推测解码支持 Thinking Budget\n这个特性非常关键，很多人可能忽略了\n现在 DeepSeek-R1、Qwen3 这类推理模型在生成时有个\"思考预算\"（thinking budget），之前用推测解码会和这个机制冲突，导致生成结果不正确\nv0.25 修复了这个问题，推测解码现在可以正确感知 reasoning token 的边界了，意思是：推理模型也能享受推测解码的加速，这在之前是不行的\n此外还新增了：\n- Gemma4 的 MTP（Multi-Token Prediction）推测解码 \n- MiMo-V2.5 的 MTP 支持 \n- Mistral 的 EAGLE 推测解码 \n- Cohere Eagle 推测解码 \n推测解码阵营越来越壮大了\n性能优化：一堆实打实的提升\n这版的性能优化点非常多，挑几个有代表性的：\n- FlashInfer top-k/top-p 采样器默认开启— 采样速度更快 \n- AllPool.forward 快了 51%— Embedding 模型直接受益 \n- GPU↔CPU 同步消除— 减少不必要的等待 \n- numpy 零拷贝 embedding 序列化— Embedding API 响应更快 \n- FlashInfer FP8 异步 TP 融合— 张量并行场景加速 \n- allreduce + RMS 融合重新启用— DP/PP 场景受益 \n- Docker 镜像缩小 2.5GB— 通过延迟下载 FlashInfer cubin 实现 \n性能这块 vLLM 是真舍得下功夫，每个版本都能看到十几项针对性的 kernel 优化\nKV Cache 卸载 + HMA 混合内存分配器\n这是面向大规模部署的重磅功能\nKV Cache 卸载（把不活跃的 KV 缓存从 GPU 卸载到 CPU）之前就有了，这次 v0.25 把它和HMA（Hybrid Memory Allocator，混合内存分配器）完全打通了：\n- 调度器侧滑动窗口分组支持 \n- MooncakeStoreConnector 支持分布式 KV 卸载 \n- DCP/PCP 协议支持 \n你可以用更少的 GPU 显存服务更多的并发请求，同时保持较高的吞吐量，对于那些 context window 很长的场景（比如 128K 上下文的模型），这个功能非常有价值\n量化支持更新\n- NVFP4— KV Cache 支持、ModelOpt NVFP4 W4A16、all-gather GEMM 融合 \n- MXFP4— Humming MXFP4 MoE 后端 \n- TurboQuant— 混合模型和统一量化支持 \nNVFP4 在这个版本获得了大量支持，如果你用的是 Hopper 或 Blackwell 卡，4-bit 量化的性能和精度平衡会更好\nAPI 改进\n- Responses API支持流式 tool calling（ - required和命名工具选择）\n- OpenAI 兼容性增强： - system_fingerprint字段、- prompt_embeds、渲染后的 prompt 文本\n- XGrammar 0.2.0— 结构化 tags 支持严格的 tool calling + reasoning \n- 新增 Fastokens tokenizer 支持 \n- RLHF 显式 weight update API \n官方当前 Quickstart 给出的基础环境是 Linux 与 Python 3.10 到 3.13，NVIDIA CUDA 用户推荐用uv管理环境\nuv venv --python 3.12 --seed\nsource .venv/bin/activate\nuv pip install vllm --torch-backend=auto\n如果你是 Docker 用户，镜像小了 2.5GB，拉取速度会明显快一些\n总结\n如果你在生产环境跑 LLM 推理服务，vLLM 依然是我的首选推荐，这个项目的迭代速度和社区活跃度都是顶级的，每个版本都能看到实质性的进步\n特别声明：以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布，本平台仅提供信息存储服务。\nNotice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.","image_url":null,"lang":"zh","published_at":"2026-07-12T11:53:05+00:00","fetched_at":"2026-07-12T12:15:08+00:00","status":"read","starred":0,"extract_state":"ok","summary_auto":"vLLM 又搞大动作了，月初刚发了0.24，我详细分析过：\n今天 v0.25 正式版发布了\n老规矩，本文就所有更新，挑重点给大家分享一下\n先来一张全景图，一眼看懂这次更新的核心模块：\nvLLM v0.25 核心更新全景图 新模型支持一览\n这版新支持的模型架构不少：\n模型\nMiMo-V2.5\n小米最新视觉-语言模型\nLaguna XS.2\n新架构，支持 DFlash\nMoondream3\n轻量多模态，支持 query 和 caption\nQianfan-OCR\n百度千帆 OCR 模型\nCohere MoE\nCohere 的 MoE 架构\nDeepSeek V4\n新增 AMD/ROCm 支持 + 流水线并行\nQwen3.5\nMamba 混合架构，Model Runner V2 支持\n特别提一下DeepSeek V4 现在可以跑在 AMD 卡上了，对于不想被 NVIDIA 绑架的同学来说是个好消息\n多硬件平台扩展\nvLLM 现在的硬件覆盖面越来越广：\n- AMD ROCm 7.2.2— DBO 动态批优化、Fused Allreduce+RMSNorm、Fused Shared Expert \n- CPU— FP8 attention for AMX/AVX-512，FP8 W8A16 linear/MoE，RISC-V 支持 \n- Intel XPU— top-k/top-p 采样、out-of-place all-reduce、LoRA \n- IBM Power— VSX 注意力后端 \n从 NVIDIA 到 AMD 到 Intel 到 IBM，甚至还有 RISC-V，vLLM 这是要做推理引擎界的\"全平台通吃选手\"\n推测解码支持 Thinking Budget\n这个特性非常关键，很多人可能忽略了\n现在 DeepSeek-R1、Qwen3 这类推理模型在生成时有个\"思考预算\"（thinking budget），之前用推测解码会和这个机制冲突，导致生成结果不正确\nv0.25 修复了这个问题，推测解码现在可以正确感知 reasoning token 的边界了，意思是：推理模型也能享受推测解码的加速，这在之前是不行的\n此外还新增了：\n- Gemma4 的 MTP（Multi-Token Prediction）推测解码 \n- MiMo-V2.5 的 MTP 支持 \n- Mistral 的 EAGLE 推测解码 \n- Cohere Eagle 推测解码 \n推测解码阵营越来越壮大了\n性能优化：一堆实打实的提升\n这版的性能优化点非常多，挑几个有代表性的：\n- FlashInfer top-k/top-p 采样器默认开启— 采样速度更快 \n- AllPool.forward 快了 51%— Embedding 模型直接受益 \n- GPU↔CPU 同步消除— 减少不必要的等待 \n- numpy 零拷贝 embedding 序列化— Embedding API 响应更快 \n- FlashInfer FP8 异步 TP 融合— 张量并行场景加速 \n- allreduce + RMS 融合重新启用— DP/PP 场景受益 \n- Docker 镜像缩小 2.5GB— 通过延迟下载 FlashInfer cubin 实现 \n性能这块 vLLM 是真舍得下功夫，每个版本都能看到十几项针对性的 kernel 优化\nKV Cache 卸载 + HMA 混合内存分配器\n这是面向大规模部署的重磅功能\nKV Cache 卸载（把不活跃的 KV 缓存从 GPU 卸载到 CPU）之前就有了，这次 v0.25 把它和HMA（Hybrid Memory Allocator，混合内存分配器）完全打通了：\n- 调度器侧滑动窗口分组支持 \n- MooncakeStoreConnector 支持分布式 KV 卸载 \n- DCP/PCP 协议支持 \n你可以用更少的 GPU 显存服务更多的并发请求，同时保持较高的吞吐量，对于那些 context window 很长的场景（比如 128K 上下文的模型），这个功能非常有价值\n量化支持更新\n- NVFP4— KV Cache 支持、ModelOpt NVFP4 W4A16、all-gather GEMM 融合 \n- MXFP4— Humming MXFP4 MoE 后端 \n- TurboQuant— 混合模型和统一量化支持 \nNVFP4 在这个版本获得了大量支持，如果你用的是 Hopper 或 Blackwell 卡，4-bit 量化的性能和精度平衡会更好\nAPI 改进\n- Responses API支持流式 tool calling（ - required和命名工具选择）\n- OpenAI 兼容性增强： - system_fingerprint字段、- prompt_embeds、渲染后的 prompt 文本\n- XGrammar 0.2.0— 结构化 tags 支持严格的 tool calling + reasoning \n- 新增 Fastokens tokenizer 支持 \n- RLHF 显式 weight update API \n官方当前 Quickstart 给出的基础环境是 Linux 与 Python 3.10 到 3.13，NVIDIA CUDA 用户推荐用uv管理环境\nuv venv --python 3.12 --seed\nsource .venv/bin/activate\nuv pip install vllm --torch-backend=auto\n如果你是 Docker 用户，镜像小了 2.5GB，拉取速度会明显快一些\n总结\n如果你在生产环境跑 LLM 推理服务，vLLM 依然是我的首选推荐，这个项目的迭代速度和社区活跃度都是顶级的，每个版本都能看到实质性的进步\n特别声明：以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布，本平台仅提供信息存储服务。\nNotice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.","cluster_id":null,"extract_retries":0,"extract_error":null,"contract_version":"news_item.v1","format_contract_version":"news_item_formats.v1","dedup_url":"https://www.163.com/dy/article/L1LN5D4R0519EA27.html","quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 2688 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":2688,"summary_length":2688,"usable_text_length":2688,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":2688,"summary_length":2688}},"news_item":{"id":34677,"canonical_url":"https://www.163.com/dy/article/L1LN5D4R0519EA27.html","source_url":"https://www.163.com/dy/article/L1LN5D4R0519EA27.html","title":"大模型本地部署最强引擎，vLLM 大版本更新 - 网易","source_name":"网易","author":null,"published_at":"2026-07-12T11:53:05+00:00","locale":"zh","topic":"ai","tags":[],"rss_summary":"<a href=\"https://news.google.com/rss/articles/CBMiYkFVX3lxTE9KcHBWSHhKajN3T1hjTUdkUDYwTUFTT1VsUzc3MGlBMmFmeVRMdFlQR0lpcFFMVWRPWF9sT09NZ0dsTnRiV1J2eE94Rm1QRWZJVkR6aVA5cEJocFNpeGpJOFZn?oc=5\" target=\"_blank\">大模型本地部署最强引擎，vLLM 大版本更新</a>&nbsp;&nbsp;<font color=\"#6f6f6f\">网易</font>","full_text":"vLLM 又搞大动作了，月初刚发了0.24，我详细分析过：\n今天 v0.25 正式版发布了\n老规矩，本文就所有更新，挑重点给大家分享一下\n先来一张全景图，一眼看懂这次更新的核心模块：\nvLLM v0.25 核心更新全景图 新模型支持一览\n这版新支持的模型架构不少：\n模型\nMiMo-V2.5\n小米最新视觉-语言模型\nLaguna XS.2\n新架构，支持 DFlash\nMoondream3\n轻量多模态，支持 query 和 caption\nQianfan-OCR\n百度千帆 OCR 模型\nCohere MoE\nCohere 的 MoE 架构\nDeepSeek V4\n新增 AMD/ROCm 支持 + 流水线并行\nQwen3.5\nMamba 混合架构，Model Runner V2 支持\n特别提一下DeepSeek V4 现在可以跑在 AMD 卡上了，对于不想被 NVIDIA 绑架的同学来说是个好消息\n多硬件平台扩展\nvLLM 现在的硬件覆盖面越来越广：\n- AMD ROCm 7.2.2— DBO 动态批优化、Fused Allreduce+RMSNorm、Fused Shared Expert \n- CPU— FP8 attention for AMX/AVX-512，FP8 W8A16 linear/MoE，RISC-V 支持 \n- Intel XPU— top-k/top-p 采样、out-of-place all-reduce、LoRA \n- IBM Power— VSX 注意力后端 \n从 NVIDIA 到 AMD 到 Intel 到 IBM，甚至还有 RISC-V，vLLM 这是要做推理引擎界的\"全平台通吃选手\"\n推测解码支持 Thinking Budget\n这个特性非常关键，很多人可能忽略了\n现在 DeepSeek-R1、Qwen3 这类推理模型在生成时有个\"思考预算\"（thinking budget），之前用推测解码会和这个机制冲突，导致生成结果不正确\nv0.25 修复了这个问题，推测解码现在可以正确感知 reasoning token 的边界了，意思是：推理模型也能享受推测解码的加速，这在之前是不行的\n此外还新增了：\n- Gemma4 的 MTP（Multi-Token Prediction）推测解码 \n- MiMo-V2.5 的 MTP 支持 \n- Mistral 的 EAGLE 推测解码 \n- Cohere Eagle 推测解码 \n推测解码阵营越来越壮大了\n性能优化：一堆实打实的提升\n这版的性能优化点非常多，挑几个有代表性的：\n- FlashInfer top-k/top-p 采样器默认开启— 采样速度更快 \n- AllPool.forward 快了 51%— Embedding 模型直接受益 \n- GPU↔CPU 同步消除— 减少不必要的等待 \n- numpy 零拷贝 embedding 序列化— Embedding API 响应更快 \n- FlashInfer FP8 异步 TP 融合— 张量并行场景加速 \n- allreduce + RMS 融合重新启用— DP/PP 场景受益 \n- Docker 镜像缩小 2.5GB— 通过延迟下载 FlashInfer cubin 实现 \n性能这块 vLLM 是真舍得下功夫，每个版本都能看到十几项针对性的 kernel 优化\nKV Cache 卸载 + HMA 混合内存分配器\n这是面向大规模部署的重磅功能\nKV Cache 卸载（把不活跃的 KV 缓存从 GPU 卸载到 CPU）之前就有了，这次 v0.25 把它和HMA（Hybrid Memory Allocator，混合内存分配器）完全打通了：\n- 调度器侧滑动窗口分组支持 \n- MooncakeStoreConnector 支持分布式 KV 卸载 \n- DCP/PCP 协议支持 \n你可以用更少的 GPU 显存服务更多的并发请求，同时保持较高的吞吐量，对于那些 context window 很长的场景（比如 128K 上下文的模型），这个功能非常有价值\n量化支持更新\n- NVFP4— KV Cache 支持、ModelOpt NVFP4 W4A16、all-gather GEMM 融合 \n- MXFP4— Humming MXFP4 MoE 后端 \n- TurboQuant— 混合模型和统一量化支持 \nNVFP4 在这个版本获得了大量支持，如果你用的是 Hopper 或 Blackwell 卡，4-bit 量化的性能和精度平衡会更好\nAPI 改进\n- Responses API支持流式 tool calling（ - required和命名工具选择）\n- OpenAI 兼容性增强： - system_fingerprint字段、- prompt_embeds、渲染后的 prompt 文本\n- XGrammar 0.2.0— 结构化 tags 支持严格的 tool calling + reasoning \n- 新增 Fastokens tokenizer 支持 \n- RLHF 显式 weight update API \n官方当前 Quickstart 给出的基础环境是 Linux 与 Python 3.10 到 3.13，NVIDIA CUDA 用户推荐用uv管理环境\nuv venv --python 3.12 --seed\nsource .venv/bin/activate\nuv pip install vllm --torch-backend=auto\n如果你是 Docker 用户，镜像小了 2.5GB，拉取速度会明显快一些\n总结\n如果你在生产环境跑 LLM 推理服务，vLLM 依然是我的首选推荐，这个项目的迭代速度和社区活跃度都是顶级的，每个版本都能看到实质性的进步\n特别声明：以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布，本平台仅提供信息存储服务。\nNotice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.","excerpt":"vLLM 又搞大动作了，月初刚发了0.24，我详细分析过：\n今天 v0.25 正式版发布了\n老规矩，本文就所有更新，挑重点给大家分享一下\n先来一张全景图，一眼看懂这次更新的核心模块：\nvLLM v0.25 核心更新全景图 新模型支持一览\n这版新支持的模型架构不少：\n模型\nMiMo-V2.5\n小米最新视觉-语言模型\nLaguna XS.2\n新架构，支持 DFlash\nMoondream3\n轻量多模态，支持 query 和 caption\nQianfan-OCR\n百度千帆 OCR 模型\nCohere MoE\nCohere 的 MoE 架构\nDeepSeek V4\n新增 AMD/ROCm 支持 + 流水线并行\nQwen3.5\nMamba 混合架构，Model Runner V2 支持\n特别提一下DeepSeek V4 现在可以跑在 AMD 卡上了，对于不想被 NVIDIA 绑架的同学来说是个好消息\n多硬件平台扩展\nvLLM 现在的硬件覆盖面越来越广：\n- AMD ROCm 7.2.2— DBO 动态批优化、Fused Allreduce+RMSNorm、Fused Shared Expert \n- CPU— FP8 attention for AMX/AVX-512，FP8 W8A16 linear/MoE，RISC-V 支持 \n- Intel XPU— top-k/top-p 采样、out-of-place all-reduce、LoRA \n- IBM Power— VSX 注意力后端 \n从 NVIDIA 到 AMD 到 Intel 到 IBM，甚至还有 RISC-V，vLLM 这是要做推理引擎界的\"全平台通吃选手\"\n推测解码支持 Thinking Budget\n这个特性非常关键，很多人可能忽略了\n现在 DeepSeek-R1、Qwen3 这类推理模型在生成时有个\"思考预算\"（thinking budget），之前用推测解码会和这个机制冲突，导致生成结果不正确\nv0.25 修复了这个问题，推测解码现在可以正确感知 reasoning token 的边界了，意思是：推理模型也能享受推测解码的加速，这在之前是不行的\n此外还新增了：\n- Gemma4 的 MTP（Multi-Token Prediction）推测解码 \n- MiMo-V2.5 的 MTP 支持 \n- Mistral 的 EAGLE 推测解码 \n- Cohere Eagle 推测解码 \n推测解码阵营越来越壮大了\n性能优化：一堆实打实的提升\n这版的性能优化点非常多，挑几个有代表性的：\n- FlashInfer top-k/top-p 采样器默认开启— 采样速度更快 \n- AllPool.forward 快了 51%— Embedding 模型直接受益 \n- GPU↔CPU 同步消除— 减少不必要的等待 \n- numpy 零拷贝 embedding 序列化— Embedding API 响应更快 \n- FlashInfer FP8 异步 TP 融合— 张量并行场景加速 \n- allreduce + RMS 融合重新启用— DP/PP 场景受益 \n- Docker 镜像缩小 2.5GB— 通过延迟下载 FlashInfer cubin 实现 \n性能这块 vLLM 是真舍得下功夫，每个版本都能看到十几项针对性的 kernel 优化\nKV Cache 卸载 + HMA 混合内存分配器\n这是面向大规模部署的重磅功能\nKV Cache 卸载（把不活跃的 KV 缓存从 GPU 卸载到 CPU）之前就有了，这次 v0.25 把它和HMA（Hybrid Memory Allocator，混合内存分配器）完全打通了：\n- 调度器侧滑动窗口分组支持 \n- MooncakeStoreConnector 支持分布式 KV 卸载 \n- DCP/PCP 协议支持 \n你可以用更少的 GPU 显存服务更多的并发请求，同时保持较高的吞吐量，对于那些 context window 很长的场景（比如 128K 上下文的模型），这个功能非常有价值\n量化支持更新\n- NVFP4— KV Cache 支持、ModelOpt NVFP4 W4A16、all-gather GEMM 融合 \n- MXFP4— Humming MXFP4 MoE 后端 \n- TurboQuant— 混合模型和统一量化支持 \nNVFP4 在这个版本获得了大量支持，如果你用的是 Hopper 或 Blackwell 卡，4-bit 量化的性能和精度平衡会更好\nAPI 改进\n- Responses API支持流式 tool calling（ - required和命名工具选择）\n- OpenAI 兼容性增强： - system_fingerprint字段、- prompt_embeds、渲染后的 prompt 文本\n- XGrammar 0.2.0— 结构化 tags 支持严格的 tool calling + reasoning \n- 新增 Fastokens tokenizer 支持 \n- RLHF 显式 weight update API \n官方当前 Quickstart 给出的基础环境是 Linux 与 Python 3.10 到 3.13，NVIDIA CUDA 用户推荐用uv管理环境\nuv venv --python 3.12 --seed\nsource .venv/bin/activate\nuv pip install vllm --torch-backend=auto\n如果你是 Docker 用户，镜像小了 2.5GB，拉取速度会明显快一些\n总结\n如果你在生产环境跑 LLM 推理服务，vLLM 依然是我的首选推荐，这个项目的迭代速度和社区活跃度都是顶级的，每个版本都能看到实质性的进步\n特别声明：以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布，本平台仅提供信息存储服务。\nNotice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.","extraction":{"state":"ok","confidence":0.9,"error":null,"explanation":"High confidence: full text extraction produced 2688 characters.","diagnostics_url":"/api/diagnose?url=https%3A//www.163.com/dy/article/L1LN5D4R0519EA27.html","quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 2688 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":2688,"summary_length":2688,"usable_text_length":2688,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":2688,"summary_length":2688}}},"display_formats":["compact","card","full","digest_section","json"]},"daily_stack_record":{"title":"大模型本地部署最强引擎，vLLM 大版本更新 - 网易","url":"https://www.163.com/dy/article/L1LN5D4R0519EA27.html","summary":"vLLM 又搞大动作了，月初刚发了0.24，我详细分析过：\n今天 v0.25 正式版发布了\n老规矩，本文就所有更新，挑重点给大家分享一下\n先来一张全景图，一眼看懂这次更新的核心模块：\nvLLM v0.25 核心更新全景图 新模型支持一览\n这版新支持的模型架构不少：\n模型\nMiMo-V2.5\n小米最新视觉-语言模型\nLaguna XS.2\n新架构，支持 DFlash\nMoondream3\n轻量多模态，支持 query 和 caption\nQianfan-OCR\n百度千帆 OCR 模型\nCohere MoE\nCohere 的 MoE 架构\nDeepSeek V4\n新增 AMD/ROCm 支持 + 流水线并行\nQwen3.5\nMamba 混合架构，Model Runner V2 支持\n特别提一下DeepSeek V4 现在可以跑在 AMD 卡上了，对于不想被 NVIDIA 绑架的同学来说是个好消息\n多硬件平台扩展\nvLLM 现在的硬件覆盖面越来越广：\n- AMD ROCm 7.2.2— DBO 动态批优化、Fused Allreduce+RMSNorm、Fused Shared Expert \n- CPU— FP8 attention for AMX/AVX-512，FP8 W8A16 linear/MoE，RISC-V 支持 \n- Intel XPU— top-k/top-p 采样、out-of-place all-reduce、LoRA \n- IBM Power— VSX 注意力后端 \n从 NVIDIA 到 AMD 到 Intel 到 IBM，甚至还有 RISC-V，vLLM 这是要做推理引擎界的\"全平台通吃选手\"\n推测解码支持 Thinking Budget\n这个特性非常关键，很多人可能忽略了\n现在 DeepSeek-R1、Qwen3 这类推理模型在生成时有个\"思考预算\"（thinking budget），之前用推测解码会和这个机制冲突，导致生成结果不正确\nv0.25 修复了这个问题，推测解码现在可以正确感知 reasoning token 的边界了，意思是：推理模型也能享受推测解码的加速，这在之前是不行的\n此外还新增了：\n- Gemma4 的 MTP（Multi-Token Prediction）推测解码 \n- MiMo-V2.5 的 MTP 支持 \n- Mistral 的 EAGLE 推测解码 \n- Cohere Eagle 推测解码 \n推测解码阵营越来越壮大了\n性能优化：一堆实打实的提升\n这版的性能优化点非常多，挑几个有代表性的：\n- FlashInfer top-k/top-p 采样器默认开启— 采样速度更快 \n- AllPool.forward 快了 51%— Embedding 模型直接受益 \n- GPU↔CPU 同步消除— 减少不必要的等待 \n- numpy 零拷贝 embedding 序列化— Embedding API 响应更快 \n- FlashInfer FP8 异步 TP 融合— 张量并行场景加速 \n- allreduce + RMS 融合重新启用— DP/PP 场景受益 \n- Docker 镜像缩小 2.5GB— 通过延迟下载 FlashInfer cubin 实现 \n性能这块 vLLM 是真舍得下功夫，每个版本都能看到十几项针对性的 kernel 优化\nKV Cache 卸载 + HMA 混合内存分配器\n这是面向大规模部署的重磅功能\nKV Cache 卸载（把不活跃的 KV 缓存从 GPU 卸载到 CPU）之前就有了，这次 v0.25 把它和HMA（Hybrid Memory Allocator，混合内存分配器）完全打通了：\n- 调度器侧滑动窗口分组支持 \n- MooncakeStoreConnector 支持分布式 KV 卸载 \n- DCP/PCP 协议支持 \n你可以用更少的 GPU 显存服务更多的并发请求，同时保持较高的吞吐量，对于那些 context window 很长的场景（比如 128K 上下文的模型），这个功能非常有价值\n量化支持更新\n- NVFP4— KV Cache 支持、ModelOpt NVFP4 W4A16、all-gather GEMM 融合 \n- MXFP4— Humming MXFP4 MoE 后端 \n- TurboQuant— 混合模型和统一量化支持 \nNVFP4 在这个版本获得了大量支持，如果你用的是 Hopper 或 Blackwell 卡，4-bit 量化的性能和精度平衡会更好\nAPI 改进\n- Responses API支持流式 tool calling（ - required和命名工具选择）\n- OpenAI 兼容性增强： - system_fingerprint字段、- prompt_embeds、渲染后的 prompt 文本\n- XGrammar 0.2.0— 结构化 tags 支持严格的 tool calling + reasoning \n- 新增 Fastokens tokenizer 支持 \n- RLHF 显式 weight update API \n官方当前 Quickstart 给出的基础环境是 Linux 与 Python 3.10 到 3.13，NVIDIA CUDA 用户推荐用uv管理环境\nuv venv --python 3.12 --seed\nsource .venv/bin/activate\nuv pip install vllm --torch-backend=auto\n如果你是 Docker 用户，镜像小了 2.5GB，拉取速度会明显快一些\n总结\n如果你在生产环境跑 LLM 推理服务，vLLM 依然是我的首选推荐，这个项目的迭代速度和社区活跃度都是顶级的，每个版本都能看到实质性的进步\n特别声明：以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布，本平台仅提供信息存储服务。\nNotice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.","source":"网易","date":"2026-07-12T11:53:05+00:00","content":"vLLM 又搞大动作了，月初刚发了0.24，我详细分析过：\n今天 v0.25 正式版发布了\n老规矩，本文就所有更新，挑重点给大家分享一下\n先来一张全景图，一眼看懂这次更新的核心模块：\nvLLM v0.25 核心更新全景图 新模型支持一览\n这版新支持的模型架构不少：\n模型\nMiMo-V2.5\n小米最新视觉-语言模型\nLaguna XS.2\n新架构，支持 DFlash\nMoondream3\n轻量多模态，支持 query 和 caption\nQianfan-OCR\n百度千帆 OCR 模型\nCohere MoE\nCohere 的 MoE 架构\nDeepSeek V4\n新增 AMD/ROCm 支持 + 流水线并行\nQwen3.5\nMamba 混合架构，Model Runner V2 支持\n特别提一下DeepSeek V4 现在可以跑在 AMD 卡上了，对于不想被 NVIDIA 绑架的同学来说是个好消息\n多硬件平台扩展\nvLLM 现在的硬件覆盖面越来越广：\n- AMD ROCm 7.2.2— DBO 动态批优化、Fused Allreduce+RMSNorm、Fused Shared Expert \n- CPU— FP8 attention for AMX/AVX-512，FP8 W8A16 linear/MoE，RISC-V 支持 \n- Intel XPU— top-k/top-p 采样、out-of-place all-reduce、LoRA \n- IBM Power— VSX 注意力后端 \n从 NVIDIA 到 AMD 到 Intel 到 IBM，甚至还有 RISC-V，vLLM 这是要做推理引擎界的\"全平台通吃选手\"\n推测解码支持 Thinking Budget\n这个特性非常关键，很多人可能忽略了\n现在 DeepSeek-R1、Qwen3 这类推理模型在生成时有个\"思考预算\"（thinking budget），之前用推测解码会和这个机制冲突，导致生成结果不正确\nv0.25 修复了这个问题，推测解码现在可以正确感知 reasoning token 的边界了，意思是：推理模型也能享受推测解码的加速，这在之前是不行的\n此外还新增了：\n- Gemma4 的 MTP（Multi-Token Prediction）推测解码 \n- MiMo-V2.5 的 MTP 支持 \n- Mistral 的 EAGLE 推测解码 \n- Cohere Eagle 推测解码 \n推测解码阵营越来越壮大了\n性能优化：一堆实打实的提升\n这版的性能优化点非常多，挑几个有代表性的：\n- FlashInfer top-k/top-p 采样器默认开启— 采样速度更快 \n- AllPool.forward 快了 51%— Embedding 模型直接受益 \n- GPU↔CPU 同步消除— 减少不必要的等待 \n- numpy 零拷贝 embedding 序列化— Embedding API 响应更快 \n- FlashInfer FP8 异步 TP 融合— 张量并行场景加速 \n- allreduce + RMS 融合重新启用— DP/PP 场景受益 \n- Docker 镜像缩小 2.5GB— 通过延迟下载 FlashInfer cubin 实现 \n性能这块 vLLM 是真舍得下功夫，每个版本都能看到十几项针对性的 kernel 优化\nKV Cache 卸载 + HMA 混合内存分配器\n这是面向大规模部署的重磅功能\nKV Cache 卸载（把不活跃的 KV 缓存从 GPU 卸载到 CPU）之前就有了，这次 v0.25 把它和HMA（Hybrid Memory Allocator，混合内存分配器）完全打通了：\n- 调度器侧滑动窗口分组支持 \n- MooncakeStoreConnector 支持分布式 KV 卸载 \n- DCP/PCP 协议支持 \n你可以用更少的 GPU 显存服务更多的并发请求，同时保持较高的吞吐量，对于那些 context window 很长的场景（比如 128K 上下文的模型），这个功能非常有价值\n量化支持更新\n- NVFP4— KV Cache 支持、ModelOpt NVFP4 W4A16、all-gather GEMM 融合 \n- MXFP4— Humming MXFP4 MoE 后端 \n- TurboQuant— 混合模型和统一量化支持 \nNVFP4 在这个版本获得了大量支持，如果你用的是 Hopper 或 Blackwell 卡，4-bit 量化的性能和精度平衡会更好\nAPI 改进\n- Responses API支持流式 tool calling（ - required和命名工具选择）\n- OpenAI 兼容性增强： - system_fingerprint字段、- prompt_embeds、渲染后的 prompt 文本\n- XGrammar 0.2.0— 结构化 tags 支持严格的 tool calling + reasoning \n- 新增 Fastokens tokenizer 支持 \n- RLHF 显式 weight update API \n官方当前 Quickstart 给出的基础环境是 Linux 与 Python 3.10 到 3.13，NVIDIA CUDA 用户推荐用uv管理环境\nuv venv --python 3.12 --seed\nsource .venv/bin/activate\nuv pip install vllm --torch-backend=auto\n如果你是 Docker 用户，镜像小了 2.5GB，拉取速度会明显快一些\n总结\n如果你在生产环境跑 LLM 推理服务，vLLM 依然是我的首选推荐，这个项目的迭代速度和社区活跃度都是顶级的，每个版本都能看到实质性的进步\n特别声明：以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布，本平台仅提供信息存储服务。\nNotice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.","confidence":0.9,"diagnostics_url":"/api/diagnose?url=https%3A//www.163.com/dy/article/L1LN5D4R0519EA27.html","quality_bucket":"high","failure_kind":"none","retryable":false,"quality_reason":"High confidence: full text extraction produced 2688 characters.","quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 2688 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":2688,"summary_length":2688,"usable_text_length":2688,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":2688,"summary_length":2688}},"tags":[]},"fallback_formats":["markdown","json","html"],"actions":{"read":"/item/34677","export_markdown":"/api/items/34677/export?format=markdown","export_json":"/api/items/34677/export?format=json","diagnose":"/api/diagnose?url=https%3A//www.163.com/dy/article/L1LN5D4R0519EA27.html"},"formats":{"full":{"id":34677,"title":"大模型本地部署最强引擎，vLLM 大版本更新 - 网易","url":"https://www.163.com/dy/article/L1LN5D4R0519EA27.html","source":"网易","author":null,"published_at":"2026-07-12T11:53:05+00:00","locale":"zh","topic":"ai","tags":[],"excerpt":"vLLM 又搞大动作了，月初刚发了0.24，我详细分析过：\n今天 v0.25 正式版发布了\n老规矩，本文就所有更新，挑重点给大家分享一下\n先来一张全景图，一眼看懂这次更新的核心模块：\nvLLM v0.25 核心更新全景图 新模型支持一览\n这版新支持的模型架构不少：\n模型\nMiMo-V2.5\n小米最新视觉-语言模型\nLaguna XS.2\n新架构，支持 DFlash\nMoondream3\n轻量多模态，支持 query 和 caption\nQianfan-OCR\n百度千帆 OCR 模型\nCohere MoE\nCohere 的 MoE 架构\nDeepSeek V4\n新增 AMD/ROCm 支持 + 流水线并行\nQwen3.5\nMamba 混合架构，Model Runner V2 支持\n特别提一下DeepSeek V4 现在可以跑在 AMD 卡上了，对于不想被 NVIDIA 绑架的同学来说是个好消息\n多硬件平台扩展\nvLLM 现在的硬件覆盖面越来越广：\n- AMD ROCm 7.2.2— DBO 动态批优化、Fused Allreduce+RMSNorm、Fused Shared Expert \n- CPU— FP8 attention for AMX/AVX-512，FP8 W8A16 linear/MoE，RISC-V 支持 \n- Intel XPU— top-k/top-p 采样、out-of-place all-reduce、LoRA \n- IBM Power— VSX 注意力后端 \n从 NVIDIA 到 AMD 到 Intel 到 IBM，甚至还有 RISC-V，vLLM 这是要做推理引擎界的\"全平台通吃选手\"\n推测解码支持 Thinking Budget\n这个特性非常关键，很多人可能忽略了\n现在 DeepSeek-R1、Qwen3 这类推理模型在生成时有个\"思考预算\"（thinking budget），之前用推测解码会和这个机制冲突，导致生成结果不正确\nv0.25 修复了这个问题，推测解码现在可以正确感知 reasoning token 的边界了，意思是：推理模型也能享受推测解码的加速，这在之前是不行的\n此外还新增了：\n- Gemma4 的 MTP（Multi-Token Prediction）推测解码 \n- MiMo-V2.5 的 MTP 支持 \n- Mistral 的 EAGLE 推测解码 \n- Cohere Eagle 推测解码 \n推测解码阵营越来越壮大了\n性能优化：一堆实打实的提升\n这版的性能优化点非常多，挑几个有代表性的：\n- FlashInfer top-k/top-p 采样器默认开启— 采样速度更快 \n- AllPool.forward 快了 51%— Embedding 模型直接受益 \n- GPU↔CPU 同步消除— 减少不必要的等待 \n- numpy 零拷贝 embedding 序列化— Embedding API 响应更快 \n- FlashInfer FP8 异步 TP 融合— 张量并行场景加速 \n- allreduce + RMS 融合重新启用— DP/PP 场景受益 \n- Docker 镜像缩小 2.5GB— 通过延迟下载 FlashInfer cubin 实现 \n性能这块 vLLM 是真舍得下功夫，每个版本都能看到十几项针对性的 kernel 优化\nKV Cache 卸载 + HMA 混合内存分配器\n这是面向大规模部署的重磅功能\nKV Cache 卸载（把不活跃的 KV 缓存从 GPU 卸载到 CPU）之前就有了，这次 v0.25 把它和HMA（Hybrid Memory Allocator，混合内存分配器）完全打通了：\n- 调度器侧滑动窗口分组支持 \n- MooncakeStoreConnector 支持分布式 KV 卸载 \n- DCP/PCP 协议支持 \n你可以用更少的 GPU 显存服务更多的并发请求，同时保持较高的吞吐量，对于那些 context window 很长的场景（比如 128K 上下文的模型），这个功能非常有价值\n量化支持更新\n- NVFP4— KV Cache 支持、ModelOpt NVFP4 W4A16、all-gather GEMM 融合 \n- MXFP4— Humming MXFP4 MoE 后端 \n- TurboQuant— 混合模型和统一量化支持 \nNVFP4 在这个版本获得了大量支持，如果你用的是 Hopper 或 Blackwell 卡，4-bit 量化的性能和精度平衡会更好\nAPI 改进\n- Responses API支持流式 tool calling（ - required和命名工具选择）\n- OpenAI 兼容性增强： - system_fingerprint字段、- prompt_embeds、渲染后的 prompt 文本\n- XGrammar 0.2.0— 结构化 tags 支持严格的 tool calling + reasoning \n- 新增 Fastokens tokenizer 支持 \n- RLHF 显式 weight update API \n官方当前 Quickstart 给出的基础环境是 Linux 与 Python 3.10 到 3.13，NVIDIA CUDA 用户推荐用uv管理环境\nuv venv --python 3.12 --seed\nsource .venv/bin/activate\nuv pip install vllm --torch-backend=auto\n如果你是 Docker 用户，镜像小了 2.5GB，拉取速度会明显快一些\n总结\n如果你在生产环境跑 LLM 推理服务，vLLM 依然是我的首选推荐，这个项目的迭代速度和社区活跃度都是顶级的，每个版本都能看到实质性的进步\n特别声明：以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布，本平台仅提供信息存储服务。\nNotice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.","full_text":"vLLM 又搞大动作了，月初刚发了0.24，我详细分析过：\n今天 v0.25 正式版发布了\n老规矩，本文就所有更新，挑重点给大家分享一下\n先来一张全景图，一眼看懂这次更新的核心模块：\nvLLM v0.25 核心更新全景图 新模型支持一览\n这版新支持的模型架构不少：\n模型\nMiMo-V2.5\n小米最新视觉-语言模型\nLaguna XS.2\n新架构，支持 DFlash\nMoondream3\n轻量多模态，支持 query 和 caption\nQianfan-OCR\n百度千帆 OCR 模型\nCohere MoE\nCohere 的 MoE 架构\nDeepSeek V4\n新增 AMD/ROCm 支持 + 流水线并行\nQwen3.5\nMamba 混合架构，Model Runner V2 支持\n特别提一下DeepSeek V4 现在可以跑在 AMD 卡上了，对于不想被 NVIDIA 绑架的同学来说是个好消息\n多硬件平台扩展\nvLLM 现在的硬件覆盖面越来越广：\n- AMD ROCm 7.2.2— DBO 动态批优化、Fused Allreduce+RMSNorm、Fused Shared Expert \n- CPU— FP8 attention for AMX/AVX-512，FP8 W8A16 linear/MoE，RISC-V 支持 \n- Intel XPU— top-k/top-p 采样、out-of-place all-reduce、LoRA \n- IBM Power— VSX 注意力后端 \n从 NVIDIA 到 AMD 到 Intel 到 IBM，甚至还有 RISC-V，vLLM 这是要做推理引擎界的\"全平台通吃选手\"\n推测解码支持 Thinking Budget\n这个特性非常关键，很多人可能忽略了\n现在 DeepSeek-R1、Qwen3 这类推理模型在生成时有个\"思考预算\"（thinking budget），之前用推测解码会和这个机制冲突，导致生成结果不正确\nv0.25 修复了这个问题，推测解码现在可以正确感知 reasoning token 的边界了，意思是：推理模型也能享受推测解码的加速，这在之前是不行的\n此外还新增了：\n- Gemma4 的 MTP（Multi-Token Prediction）推测解码 \n- MiMo-V2.5 的 MTP 支持 \n- Mistral 的 EAGLE 推测解码 \n- Cohere Eagle 推测解码 \n推测解码阵营越来越壮大了\n性能优化：一堆实打实的提升\n这版的性能优化点非常多，挑几个有代表性的：\n- FlashInfer top-k/top-p 采样器默认开启— 采样速度更快 \n- AllPool.forward 快了 51%— Embedding 模型直接受益 \n- GPU↔CPU 同步消除— 减少不必要的等待 \n- numpy 零拷贝 embedding 序列化— Embedding API 响应更快 \n- FlashInfer FP8 异步 TP 融合— 张量并行场景加速 \n- allreduce + RMS 融合重新启用— DP/PP 场景受益 \n- Docker 镜像缩小 2.5GB— 通过延迟下载 FlashInfer cubin 实现 \n性能这块 vLLM 是真舍得下功夫，每个版本都能看到十几项针对性的 kernel 优化\nKV Cache 卸载 + HMA 混合内存分配器\n这是面向大规模部署的重磅功能\nKV Cache 卸载（把不活跃的 KV 缓存从 GPU 卸载到 CPU）之前就有了，这次 v0.25 把它和HMA（Hybrid Memory Allocator，混合内存分配器）完全打通了：\n- 调度器侧滑动窗口分组支持 \n- MooncakeStoreConnector 支持分布式 KV 卸载 \n- DCP/PCP 协议支持 \n你可以用更少的 GPU 显存服务更多的并发请求，同时保持较高的吞吐量，对于那些 context window 很长的场景（比如 128K 上下文的模型），这个功能非常有价值\n量化支持更新\n- NVFP4— KV Cache 支持、ModelOpt NVFP4 W4A16、all-gather GEMM 融合 \n- MXFP4— Humming MXFP4 MoE 后端 \n- TurboQuant— 混合模型和统一量化支持 \nNVFP4 在这个版本获得了大量支持，如果你用的是 Hopper 或 Blackwell 卡，4-bit 量化的性能和精度平衡会更好\nAPI 改进\n- Responses API支持流式 tool calling（ - required和命名工具选择）\n- OpenAI 兼容性增强： - system_fingerprint字段、- prompt_embeds、渲染后的 prompt 文本\n- XGrammar 0.2.0— 结构化 tags 支持严格的 tool calling + reasoning \n- 新增 Fastokens tokenizer 支持 \n- RLHF 显式 weight update API \n官方当前 Quickstart 给出的基础环境是 Linux 与 Python 3.10 到 3.13，NVIDIA CUDA 用户推荐用uv管理环境\nuv venv --python 3.12 --seed\nsource .venv/bin/activate\nuv pip install vllm --torch-backend=auto\n如果你是 Docker 用户，镜像小了 2.5GB，拉取速度会明显快一些\n总结\n如果你在生产环境跑 LLM 推理服务，vLLM 依然是我的首选推荐，这个项目的迭代速度和社区活跃度都是顶级的，每个版本都能看到实质性的进步\n特别声明：以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布，本平台仅提供信息存储服务。\nNotice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.","reading_time_min":2,"extraction":{"state":"ok","confidence":0.9,"error":null,"explanation":"High confidence: full text extraction produced 2688 characters.","diagnostics_url":"/api/diagnose?url=https%3A//www.163.com/dy/article/L1LN5D4R0519EA27.html","quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 2688 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":2688,"summary_length":2688,"usable_text_length":2688,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":2688,"summary_length":2688}}},"quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 2688 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":2688,"summary_length":2688,"usable_text_length":2688,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":2688,"summary_length":2688}},"actions":{"read":"/item/34677","export_markdown":"/api/items/34677/export?format=markdown","export_json":"/api/items/34677/export?format=json","diagnose":"/api/diagnose?url=https%3A//www.163.com/dy/article/L1LN5D4R0519EA27.html"}},"digest":{"id":34677,"title":"大模型本地部署最强引擎，vLLM 大版本更新 - 网易","url":"https://www.163.com/dy/article/L1LN5D4R0519EA27.html","source":"网易","topic":"ai","published_at":"2026-07-12T11:53:05+00:00","excerpt":"vLLM 又搞大动作了，月初刚发了0.24，我详细分析过： 今天 v0.25 正式版发布了 老规矩，本文就所有更新，挑重点给大家分享一下 先来一张全景图，一眼看懂这次更新的核心模块： vLLM v0.25 核心更新全景图 新模型支持一览 这版新支持的模型架构不少： 模型 MiMo-V2.5 小米最新视觉-语言模型 Laguna XS.2 新架构，支持 DFlash Moondream3 轻量多模态，支持 query 和 caption Qianfan-OCR 百度千帆 OCR 模型 Cohere MoE Cohere 的 MoE 架构 DeepSeek…","quality_bucket":"high","quality_reason":"High confidence: full text extraction produced 2688 characters.","reading_time_min":2,"cluster_id":null},"card":{"display_title":"大模型本地部署最强引擎，vLLM 大版本更新 - 网易","subtitle":"网易 · 2026-07-12","summary":"vLLM 又搞大动作了，月初刚发了0.24，我详细分析过： 今天 v0.25 正式版发布了 老规矩，本文就所有更新，挑重点给大家分享一下 先来一张全景图，一眼看懂这次更新的核心模块： vLLM v0.25 核心更新全景图 新模型支持一览 这版新支持的模型架构不少： 模型 MiMo-V2.5 小米最新视觉-语言模型 Laguna XS.2 新架构，支持 DFlash Moondream3 轻量多模态，支持 query 和 caption…","badges":["quality:high"],"links":{"read":"/item/34677","original":"https://www.163.com/dy/article/L1LN5D4R0519EA27.html","diagnose":"/api/diagnose?url=https%3A//www.163.com/dy/article/L1LN5D4R0519EA27.html"},"quality_warning":null},"export":{"title":"大模型本地部署最强引擎，vLLM 大版本更新 - 网易","url":"https://www.163.com/dy/article/L1LN5D4R0519EA27.html","summary":"vLLM 又搞大动作了，月初刚发了0.24，我详细分析过：\n今天 v0.25 正式版发布了\n老规矩，本文就所有更新，挑重点给大家分享一下\n先来一张全景图，一眼看懂这次更新的核心模块：\nvLLM v0.25 核心更新全景图 新模型支持一览\n这版新支持的模型架构不少：\n模型\nMiMo-V2.5\n小米最新视觉-语言模型\nLaguna XS.2\n新架构，支持 DFlash\nMoondream3\n轻量多模态，支持 query 和 caption\nQianfan-OCR\n百度千帆 OCR 模型\nCohere MoE\nCohere 的 MoE 架构\nDeepSeek V4\n新增 AMD/ROCm 支持 + 流水线并行\nQwen3.5\nMamba 混合架构，Model Runner V2 支持\n特别提一下DeepSeek V4 现在可以跑在 AMD 卡上了，对于不想被 NVIDIA 绑架的同学来说是个好消息\n多硬件平台扩展\nvLLM 现在的硬件覆盖面越来越广：\n- AMD ROCm 7.2.2— DBO 动态批优化、Fused Allreduce+RMSNorm、Fused Shared Expert \n- CPU— FP8 attention for AMX/AVX-512，FP8 W8A16 linear/MoE，RISC-V 支持 \n- Intel XPU— top-k/top-p 采样、out-of-place all-reduce、LoRA \n- IBM Power— VSX 注意力后端 \n从 NVIDIA 到 AMD 到 Intel 到 IBM，甚至还有 RISC-V，vLLM 这是要做推理引擎界的\"全平台通吃选手\"\n推测解码支持 Thinking Budget\n这个特性非常关键，很多人可能忽略了\n现在 DeepSeek-R1、Qwen3 这类推理模型在生成时有个\"思考预算\"（thinking budget），之前用推测解码会和这个机制冲突，导致生成结果不正确\nv0.25 修复了这个问题，推测解码现在可以正确感知 reasoning token 的边界了，意思是：推理模型也能享受推测解码的加速，这在之前是不行的\n此外还新增了：\n- Gemma4 的 MTP（Multi-Token Prediction）推测解码 \n- MiMo-V2.5 的 MTP 支持 \n- Mistral 的 EAGLE 推测解码 \n- Cohere Eagle 推测解码 \n推测解码阵营越来越壮大了\n性能优化：一堆实打实的提升\n这版的性能优化点非常多，挑几个有代表性的：\n- FlashInfer top-k/top-p 采样器默认开启— 采样速度更快 \n- AllPool.forward 快了 51%— Embedding 模型直接受益 \n- GPU↔CPU 同步消除— 减少不必要的等待 \n- numpy 零拷贝 embedding 序列化— Embedding API 响应更快 \n- FlashInfer FP8 异步 TP 融合— 张量并行场景加速 \n- allreduce + RMS 融合重新启用— DP/PP 场景受益 \n- Docker 镜像缩小 2.5GB— 通过延迟下载 FlashInfer cubin 实现 \n性能这块 vLLM 是真舍得下功夫，每个版本都能看到十几项针对性的 kernel 优化\nKV Cache 卸载 + HMA 混合内存分配器\n这是面向大规模部署的重磅功能\nKV Cache 卸载（把不活跃的 KV 缓存从 GPU 卸载到 CPU）之前就有了，这次 v0.25 把它和HMA（Hybrid Memory Allocator，混合内存分配器）完全打通了：\n- 调度器侧滑动窗口分组支持 \n- MooncakeStoreConnector 支持分布式 KV 卸载 \n- DCP/PCP 协议支持 \n你可以用更少的 GPU 显存服务更多的并发请求，同时保持较高的吞吐量，对于那些 context window 很长的场景（比如 128K 上下文的模型），这个功能非常有价值\n量化支持更新\n- NVFP4— KV Cache 支持、ModelOpt NVFP4 W4A16、all-gather GEMM 融合 \n- MXFP4— Humming MXFP4 MoE 后端 \n- TurboQuant— 混合模型和统一量化支持 \nNVFP4 在这个版本获得了大量支持，如果你用的是 Hopper 或 Blackwell 卡，4-bit 量化的性能和精度平衡会更好\nAPI 改进\n- Responses API支持流式 tool calling（ - required和命名工具选择）\n- OpenAI 兼容性增强： - system_fingerprint字段、- prompt_embeds、渲染后的 prompt 文本\n- XGrammar 0.2.0— 结构化 tags 支持严格的 tool calling + reasoning \n- 新增 Fastokens tokenizer 支持 \n- RLHF 显式 weight update API \n官方当前 Quickstart 给出的基础环境是 Linux 与 Python 3.10 到 3.13，NVIDIA CUDA 用户推荐用uv管理环境\nuv venv --python 3.12 --seed\nsource .venv/bin/activate\nuv pip install vllm --torch-backend=auto\n如果你是 Docker 用户，镜像小了 2.5GB，拉取速度会明显快一些\n总结\n如果你在生产环境跑 LLM 推理服务，vLLM 依然是我的首选推荐，这个项目的迭代速度和社区活跃度都是顶级的，每个版本都能看到实质性的进步\n特别声明：以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布，本平台仅提供信息存储服务。\nNotice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.","source":"网易","date":"2026-07-12T11:53:05+00:00","content":"vLLM 又搞大动作了，月初刚发了0.24，我详细分析过：\n今天 v0.25 正式版发布了\n老规矩，本文就所有更新，挑重点给大家分享一下\n先来一张全景图，一眼看懂这次更新的核心模块：\nvLLM v0.25 核心更新全景图 新模型支持一览\n这版新支持的模型架构不少：\n模型\nMiMo-V2.5\n小米最新视觉-语言模型\nLaguna XS.2\n新架构，支持 DFlash\nMoondream3\n轻量多模态，支持 query 和 caption\nQianfan-OCR\n百度千帆 OCR 模型\nCohere MoE\nCohere 的 MoE 架构\nDeepSeek V4\n新增 AMD/ROCm 支持 + 流水线并行\nQwen3.5\nMamba 混合架构，Model Runner V2 支持\n特别提一下DeepSeek V4 现在可以跑在 AMD 卡上了，对于不想被 NVIDIA 绑架的同学来说是个好消息\n多硬件平台扩展\nvLLM 现在的硬件覆盖面越来越广：\n- AMD ROCm 7.2.2— DBO 动态批优化、Fused Allreduce+RMSNorm、Fused Shared Expert \n- CPU— FP8 attention for AMX/AVX-512，FP8 W8A16 linear/MoE，RISC-V 支持 \n- Intel XPU— top-k/top-p 采样、out-of-place all-reduce、LoRA \n- IBM Power— VSX 注意力后端 \n从 NVIDIA 到 AMD 到 Intel 到 IBM，甚至还有 RISC-V，vLLM 这是要做推理引擎界的\"全平台通吃选手\"\n推测解码支持 Thinking Budget\n这个特性非常关键，很多人可能忽略了\n现在 DeepSeek-R1、Qwen3 这类推理模型在生成时有个\"思考预算\"（thinking budget），之前用推测解码会和这个机制冲突，导致生成结果不正确\nv0.25 修复了这个问题，推测解码现在可以正确感知 reasoning token 的边界了，意思是：推理模型也能享受推测解码的加速，这在之前是不行的\n此外还新增了：\n- Gemma4 的 MTP（Multi-Token Prediction）推测解码 \n- MiMo-V2.5 的 MTP 支持 \n- Mistral 的 EAGLE 推测解码 \n- Cohere Eagle 推测解码 \n推测解码阵营越来越壮大了\n性能优化：一堆实打实的提升\n这版的性能优化点非常多，挑几个有代表性的：\n- FlashInfer top-k/top-p 采样器默认开启— 采样速度更快 \n- AllPool.forward 快了 51%— Embedding 模型直接受益 \n- GPU↔CPU 同步消除— 减少不必要的等待 \n- numpy 零拷贝 embedding 序列化— Embedding API 响应更快 \n- FlashInfer FP8 异步 TP 融合— 张量并行场景加速 \n- allreduce + RMS 融合重新启用— DP/PP 场景受益 \n- Docker 镜像缩小 2.5GB— 通过延迟下载 FlashInfer cubin 实现 \n性能这块 vLLM 是真舍得下功夫，每个版本都能看到十几项针对性的 kernel 优化\nKV Cache 卸载 + HMA 混合内存分配器\n这是面向大规模部署的重磅功能\nKV Cache 卸载（把不活跃的 KV 缓存从 GPU 卸载到 CPU）之前就有了，这次 v0.25 把它和HMA（Hybrid Memory Allocator，混合内存分配器）完全打通了：\n- 调度器侧滑动窗口分组支持 \n- MooncakeStoreConnector 支持分布式 KV 卸载 \n- DCP/PCP 协议支持 \n你可以用更少的 GPU 显存服务更多的并发请求，同时保持较高的吞吐量，对于那些 context window 很长的场景（比如 128K 上下文的模型），这个功能非常有价值\n量化支持更新\n- NVFP4— KV Cache 支持、ModelOpt NVFP4 W4A16、all-gather GEMM 融合 \n- MXFP4— Humming MXFP4 MoE 后端 \n- TurboQuant— 混合模型和统一量化支持 \nNVFP4 在这个版本获得了大量支持，如果你用的是 Hopper 或 Blackwell 卡，4-bit 量化的性能和精度平衡会更好\nAPI 改进\n- Responses API支持流式 tool calling（ - required和命名工具选择）\n- OpenAI 兼容性增强： - system_fingerprint字段、- prompt_embeds、渲染后的 prompt 文本\n- XGrammar 0.2.0— 结构化 tags 支持严格的 tool calling + reasoning \n- 新增 Fastokens tokenizer 支持 \n- RLHF 显式 weight update API \n官方当前 Quickstart 给出的基础环境是 Linux 与 Python 3.10 到 3.13，NVIDIA CUDA 用户推荐用uv管理环境\nuv venv --python 3.12 --seed\nsource .venv/bin/activate\nuv pip install vllm --torch-backend=auto\n如果你是 Docker 用户，镜像小了 2.5GB，拉取速度会明显快一些\n总结\n如果你在生产环境跑 LLM 推理服务，vLLM 依然是我的首选推荐，这个项目的迭代速度和社区活跃度都是顶级的，每个版本都能看到实质性的进步\n特别声明：以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布，本平台仅提供信息存储服务。\nNotice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.","confidence":0.9,"diagnostics_url":"/api/diagnose?url=https%3A//www.163.com/dy/article/L1LN5D4R0519EA27.html","quality_bucket":"high","failure_kind":"none","retryable":false,"quality_reason":"High confidence: full text extraction produced 2688 characters.","quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 2688 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":2688,"summary_length":2688,"usable_text_length":2688,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":2688,"summary_length":2688}},"tags":[],"format_contract_version":"news_item_formats.v1"}}}