vLLM 官方博客发布技术长文,说明在 DeepSeek-V4.1-Flash 发布后三周内,团队与 Inferact 社区通过 SWA bounded replay、CUDA graphs 以及多项内核融合优化,使低并发场景提速 1.9 倍,在 150 TPS 约束下吞吐提升 5.3 倍,并给出精度与性能的实测边界。
vLLM 详解 DeepSeek-V4.1-Flash 优化:智能体吞吐提升约 5 倍