> 数据图表谁知道DeepSeek-V4 Transformer Block 结构示意图
2026-6-21)模型架构从单一稠密 Transformer 向混合架构演进。稠密 Transformer 在参数规模从千亿向万亿扩展时,面临两个主要问题显存占用、每 token 浮点运算成本的非线性增长。企业按量采购模型时往往较为关注推理账单,因此行业重点不再是堆参数,而是让每次前向传递只激活必要的计算,同时改进注意力算子来压低长序列的开销。由此形成两条技术路线:极端稀疏激活的 MoE、混合注意力与 MoE 协同。 极端稀疏激活 MoE 将总参数与激活参数脱钩,降低了万亿级模型的推理成本。稠密模型在接近万亿参数时遭遇显存与算力瓶颈,行业因此转向稀疏激活方案,例如,DeepSeek-V4 系列 Pro 版总参数 1.6 万亿、激活参数 490 亿,Flash 版总参数 2840 亿、激活参数 130 亿在百万 token 场景下,单 token 浮点运算降至 V3.2 的 27%,KV 缓存占用降至约十分之一。商业定价方面,Pro版缓存未命中输入输出0.4350.87百万 token(促销价),Flash 版输入输出0.140.28百万 token,低于主流百万上下文大模型价格(例如 Claude Sonnet 4.6 输入输出3.0015.00百万 token、GPT-5.4 输入输出2.5015.00百万token),这使过去因成本过高而仅作展示的百万上下文场景,开始具备工程按量采购的经济可行性。