> 数据图表想关注一下DeepSeek-V4 系列相较 V3.2 显著降低了长序列下的计算量与显存占用2026-6-2 长上下文与工具调用放大 KV Cache 占用,推理系统瓶颈从计算吞吐延伸至显存与缓存管理。DeepSeek-V4-Pro 支持 1M 上下文,在 1M token 上下文设置下,单 token 推理 FLOPs 降至 DeepSeek-V3.2 的 27%,KV 缓存占用仅为10%。但即使 KV 缓存已大幅优化,1M 上下文下的绝对占用规模仍然可观(可达数十 GB),结合较高并发限制(多请求竞争显存容量)和多轮工具调用(拉长 KV Cache 生命周期)场景,显存占用、缓存复用和请求路由成为影响推理吞吐的关键因素。国泰海通科技传媒