> 数据图表想问下各位网友NVIDIA Dynamo 智能路由器可避免 KV 缓存重新计算,从而加快模型响
2026-6-2 MoE、MLA 等模型算法反向影响推理基础设施设计,软件栈开始围绕缓存复用和多节点调度重构。以 DeepSeek 系列模型为例,DeepSeek-V3 采用 MLA(多头潜在注意力),DeepSeek-V4 在注意力层采用 CSA(压缩稀疏注意力)与 HCA(重度压缩注意力)的混合结构,核心方向都是通过压缩注意力表示来降低 KV Cache 占用、提升推理效率。模型结构的变化直接体现在推理软件栈的优化方向上:以 NVIDIA Dynamo 为例,其开源框架通过 KV 缓存感知路由,将新请求导向缓存重叠度最高的节点,减少重复的预填充计算。