在 Amazon SageMaker HyperPod 上使用 Curvine 为大型语言模型实现分层 KV 缓存
摘要
AWS 在 SageMaker HyperPod 上结合 Curvine 构建分层 KV 缓存,实现跨副本缓存复用,提升命中率并降低推理成本。
核心要点
- 三层缓存设计:L0(GPU HBM)使用 vLLM 原生 paged-attention,L1(CPU 内存)由 LMCache 管理,L2(Curvine 共享 NVMe)通过 FUSE 挂载为 ReadWriteMany PVC。
- 智能路由默认采用 prefix-aware 策略,基于前缀树选择副本;kv-aware 适合长文档处理,round-robin 适合无状态批量推理。
- 测试结果:跨 Pod 缓存命中率最高达 100%,TTFT 提升最高 2.7 倍,约 1900 token 提示的跨节点 L2 读取延迟约 56 ms。
- 7B 模型在 48GB GPU 上权重约 14GB,可留出 30GB 做 KV 缓存;32B 模型需约 64GB 权重,单卡无法容纳,需分片。
- 该架构使原本需要 P5 实例的工作负载可运行在更便宜的 G6e 实例上,降低每端点成本。
原文佐证
- On a test deployment, this achieved up to a 100 percent cross-Pod cache hit rate, up to a 2.7x TTFT improvement, and cross-node L2 read latency of about 56 ms for a approximately 1,900-token prompt.
- With this architecture, workloads that previously required P5 instances can run on lower-cost G6e instances, reducing per-endpoint cost.
AI 洞察
KV 缓存分层与跨节点共享有望成为 LLM 推理基础设施的标配能力,它直接改变了“大模型必须配大显存”的成本逻辑。对于采用方而言,这意味着可用更经济的实例运行大型模型,可能促使更多企业将长上下文和 RAG 业务迁至云端。这也表明云厂商正在从单纯比拼算力转向比拼推理优化和整体 TCO。