> 数据图表

咨询下各位4.1、模型架构的演进:从Dense到MoE,模型大幅降本提效

2025-4-1
咨询下各位4.1、模型架构的演进:从Dense到MoE,模型大幅降本提效
4.1、模型架构的演进:从Dense到MoE,模型大幅降本提效MoE与Transformer融合,逐步成为主流架构。MoE 起源于 1991 年的论文《Adaptive Mixture of Local Experts》。2020年,谷歌Gshard首次将MoE引入Transformer构建分布式并行计算架构,打开MoE发展新思路。之后,MoE逐渐进入规模发展阶段,作为一种底层架构优化方法,与Transformer结合,陆续被用于推荐系统、自然语言处理、计算机视觉、多模态大模型等领域。 国内外主流企业差异化推进MoE大模型布局和落地,2024年全球MoE大模型数量呈爆发增长态势。据53AI网统计,2024年1-5月全球发布MoE大模型数量约20个,超2021-2023三年总量(约10个),且以多模态大模型为主(占比约90%)。谷歌、OpenAI、阿里、华为、腾讯等大型企业侧重利用MoE提升大模型性能和实用性。而Mistral AI、昆仑万维、MiniMax、幻方量化等初创企业侧重利用MoE低成本优势抢占AI市场。公司布局特点已发布模型发布时间参数规模图:MoE架构发展历程谷歌从算法、工具、模型、硬件、生态全面布局,力争MoE发展领航者OpenAl持续推出国际领先大模型,并利用MoE控制成本,GPT-4实现“性能/成本"提升70倍阿里华为腾讯利用MoE升级万亿及以上规模参数模型,并开源"小模型",追赶国际先进模型性能侧重MoE架构创新,提升大模型通用性和可移植性,如提出全新LocMoE架构通过MoE架构优化,结合模型量化方法,提升混元大模型性能,并赋能现有业务昆仑万维Mistral Al 把握全球首个MoE大模型开源先发优势,迅速提升品牌影响力和市场地位把握国内先发优势,重视MoE大模型训练/推理相关技术研发及海外业务扩展采用MLA(多头注意力)机制并自研MoE架构,实现成本大幅降低,应对大模型“价格战”幻方量化Switch TransformerGLaMV-MoELIMOEGemini 1.5 Pro2021.12021.122022.12022.122024.21.6万亿1.2万亿150亿56亿GPT4M6Qwen1.5-MoE-A2.7B盘古大模型混元大模型Mistral-8×7BMistral-8x22B天工2.0天工3.0DeepSeek-MoEDeepSeek-V22023.31.76万亿2021.112024.32024.22024.32023.122024.42024.22024.42024.12024.510万亿27亿560亿1760亿干亿4000亿20/160/1450亿2360亿资料来源:天翼智库、国海证券研究所请务必阅读报告附注中的风险提示和免责声明 47