> 数据图表

谁知道2.3、豆包大模型:开源MoE通信优化技术COMET、万卡集群部署已节省数百万 GPU 小时

2025-4-1
谁知道2.3、豆包大模型:开源MoE通信优化技术COMET、万卡集群部署已节省数百万 GPU 小时
2.3、豆包大模型:开源MoE通信优化技术COMET、万卡集群部署已节省数百万 GPU 小时COMET面向模型通信优化系统,再实现通信效率的显著提升。面对MoE架构跨设备通信开销巨大的问题,严重制约了训练效率和成本,COMET针对 MoE 模型的通信优化系统,通过细粒度计算-通信重叠技术,助力大模型训练优化;其中引入两项关键机制,1)共享张量依赖解析:通过分解和重调度共享张量,解决通信与计算之间的粒度错配问题,实现细至单 Token 级的重叠。2)自适应负载分配:动态分配 GPU 线程块资源,精准平衡通信与计算负载,消除流水线气泡。COMET已落地万卡集群,累计节省数百万 GPU 小时。豆包团队在多个大规模 MoE 模型中评估了 COMET 的端到端性能,COMET在 8 卡 H800 的实验集群中,端到端 MoE 模型(Mixtral-8x7B、Qwen2-MoE 等)的前向时延较其他基线系统可降低 31.8%-44.4%,且在不同并行策略、输入规模及硬件环境下均表现稳定。目前COMET 已实际应用于万卡级生产集群,助力 MoE 模型高效训练,并已累计节省数百万 GPU 小时。图:COMET设计结构图:COMET在多个MoE模型中的测试结果资料来源:豆包大模型微信公众号请务必阅读报告附注中的风险提示和免责声明 31