> 数据图表各位网友请教一下. KV Cache 工作原理2026-1-5根据华尔街见闻,在黄仁勋在 CES 演讲中,敏锐地捕捉到了 AI 模型侧的根本性变化Test-time Scaling(测试时扩展)。“推理不再是一次性的回答,而是一个思考的过程。”他指出,随着 DeepSeek R1 和 OpenAI o1 等模型的出现,AI 开始展现出思维链能力。这意味着 AI 在给出答案前,需要消耗大量的算力进行多步推理、反思和规划。同时,当 AI 从简单的问答转向长时间的复杂推理时,记忆瓶颈涌现。在 Agentic AI 时代,智能体需要记住漫长的对话历史和复杂的上下文,这会产生巨大的 KV Cache。传统的解决方案是将这些数据塞进昂贵的 HBM 显存中,但 HBM 容量有限且价格高昂,这被称为“显存墙”。AI 的工作记忆存储在 HBM 内存中。每生成一个 token,它都要读取整个模型和所有工作记忆。对于需要长期运行、拥有持续记忆的 AI 智能体,这种架构显然不可持续。中银国际综合其他