vLLM 发布 vllm-metal v0.28.0:在 Apple Silicon 上支持并发推理服务
vLLM 官方博客宣布首个正式版本 vllm-metal v0.28.0,把 vLLM 的 V1 调度器、分页 KV 缓存与 OpenAI 兼容服务端带到 Apple Silicon,模型执行由 MLX 与 Metal 承担。该版本引入批量多 token 预测、GGUF 与混合模型支持,并在 M5 上启用更快的预填充路
vLLM 发布 vllm-metal v0.28.0:在 Apple Silicon 上支持并发推理服务