AWS 为 Amazon SageMaker Inference 实时端点新增前缀感知路由策略,把共享相同提示前缀的请求固定发往同一实例,使 KV 缓存得以复用。官方在 Llama 3.1 70B 上的基准显示,长上下文场景 P50 首字延迟最多降低 77%,KV 缓存命中率从约 25% 提升到 80% 以上,路由本身
SageMaker Inference 推出前缀感知路由,降低 LLM 首字延迟