vLLM 官方博客发布分离式推理实用指南,面向 vLLM v0.30.0 及以上版本,讲解把 prefill 与 decode 拆成两个实例、把分词与解析等 CPU 工作移到无 GPU 前端,以及两者组合的部署方式。文章给出适用场景表、KV 缓存传输的实测数据与注意事项,并说明多轮对话双向传输和推理模型模板不匹配等风险
vLLM 发布分离式推理实用指南:拆开 prefill、decode 与 CPU 前端