> 数据图表

你知道2.3、豆包大模型:新模型豆包pro 1.5依靠稀疏MoE架构实现小参数高性能,MoE杠杆提升至7x

2025-4-1
你知道2.3、豆包大模型:新模型豆包pro 1.5依靠稀疏MoE架构实现小参数高性能,MoE杠杆提升至7x
2.3、豆包大模型:新模型豆包pro 1.5依靠稀疏MoE架构实现小参数高性能,MoE杠杆提升至7x2025年1月22日,豆包全新基础模型 Doubao-1.5-pro 正式发布,模型能力全面升级,融合并进一步提升了多模态能力。从训练和推理效率出发,Doubao-1.5-pro 使用稀疏 MoE 架构。在预训练阶段,仅用较小参数激活的 MoE 模型,性能即可超过 Llama-3.1-405B 等超大稠密预训练模型。 通过模型结构和训练算法优化,豆包将 MoE 模型的性能杠杆提升至 7 倍,此前业界的普遍水平为不到 3 倍。MoE 模型的性能通常可以用表现相同的稠密模型的总参数量和MoE模型的激活参数量的比值来确定,据豆包大模型团队公众号数据,如IBM的 Granite 系列模型中,800M激活的MoE模型性能可以接近2B总参数的稠密模型,性能比值大约在2.5倍(2000M/800M)。此前,业界的普遍水平在不到3倍的性能杠杆上。团队通过模型结构和训练算法优化,在完全相同的部分训练数据(9T tokens)对比验证下,用激活参数仅为稠密模型参数量 1/7 的 MoE 模型,超过了稠密模型的性能,将性能杠杆提升至 7 倍。图:Doubao-1.5-pro多个基准测试结果图:豆包模型与Dense模型性能对比图:豆包视觉多模态进一步提升资料来源:豆包大模型微信公众号请务必阅读报告附注中的风险提示和免责声明 30