> 数据图表

谁知道4.1、模型架构的演进:从Dense到MoE,模型大幅降本提效

2025-4-1
谁知道4.1、模型架构的演进:从Dense到MoE,模型大幅降本提效
4.1、模型架构的演进:从Dense到MoE,模型大幅降本提效DeepSeek提出DeepSeekMoE,在传统MoE架构之上继续降本提效。包括:1)细粒度专家分割:在保持模型参数和计算成本一致的情况下,用更精细的颗粒度对专家进行划分,更精细的专家分割使得激活的专家能够以更灵活和适应性更强的方式进行组合;2)共享专家隔离:采用传统路由策略时,分配给不同专家的token可能需要一些共同的知识或信息,因此多个专家可能会有参数冗余。专门的共享专家致力于捕获和整合不同上下文中的共同知识,有助于构建一个具有更多专业专家且参数更高效的模型。 负载均衡:MoE架构下容易产生每次都由少数几个专家处理所有tokens的情况,而其余大量专家处于闲置状态,此外,若不同专家分布在不同计算设备上,同样会造成计算资源浪费以及模型能力局限;负载均衡则类似一个公平的“裁判”,鼓励专家的选择趋于均衡,避免出现上述专家激活不均衡的现象。DeepSeek在专家级的负载均衡外,提出了设备级的负载均衡,确保了跨设备的负载均衡,大幅提升计算效率, 缓解计算瓶颈。图:MoE架构理解框架图:DeepSeekMoE对比传统MoE架构资料来源:《DeepSeekMoE: Towards Ultimate Expert Specialization in Mixture-of-Experts Language Models》、量子位请务必阅读报告附注中的风险提示和免责声明 48