AWS 官方博客发布指南,介绍如何在 SageMaker HyperPod 上使用 vLLM 部署 Qwen3.8-2.4T-A95B 开源模型。该模型拥有 2.4 万亿参数,采用混合注意力架构,支持 NVFP4 量化,可在单节点 8 卡 B300 GPU 上运行,并提供 OpenAI 兼容接口。
AWS 详解在 SageMaker HyperPod 上部署 Qwen3.8-2.4T-A95B