> 数据图表咨询大家4.1、模型架构的演进:从Dense到MoE,模型大幅降本提效2025-4-14.1、模型架构的演进:从Dense到MoE,模型大幅降本提效MoE(Mixture of Experts,混合专家模型)是一种用于提升深度学习模型性能和效率的技术架构。其主要由一组专家模型和一个门控模型组成,核心思想是在处理任务时只激活部分专家模型,并通过门控模型控制专家模型的选择和加权混合。简言之,MoE在训练过程通过门控模型实现“因材施教”,进而在推理过程实现专家模型之间的“博采众长”。从Transformer架构上看,MoE使用稀疏的MoE层代替稠密的前馈网络(FFN)层,专家可以是 FFN,也可以是更复杂的网络,甚至是 MoE本身,这样就会形成有多层 MoE 的 MoE;而门控网络或者路由来决定将哪个 token 发送给哪个专家。图:MoE架构下,MoE层取代FFN层Transformer架构中,MoE层取代了传统的FFN层。MoE架构还可以将不同专家扩展到多个设备上,MoE层在不同设备之间共享,而其他层(例如注意力层)被复制。资料来源:《GShard: Scaling Giant Models with Conditional Computation and Automatic Sharding》、国海证券研究所请务必阅读报告附注中的风险提示和免责声明 46国海证券综合其他