> 数据图表你知道2.2、DeepSeek开源库2:DeepEP专为MoE及EP设计的通信库,高效优化通信机制2025-4-12.2、DeepSeek开源库2:DeepEP专为MoE及EP设计的通信库,高效优化通信机制DeepEP是DeepSeekMoE的训推EP通信库,支持FP8专为Hopper GPU设计,低延迟超高速训练推理。 DeepEP是一个专为混合专家系统(MoE)和专家并行(EP)设计的通信库。在分布式系统中(如多GPU训练环境),所有处理单元之间需要高效地传递数据;尤其是MoE中因为不同专家需要频繁交换信息,并且MoE模型容易在专家并行中出现负载不均衡,导致每个专家分到的算力不均,不重要的专家难以发挥应有的性能。DeepEP通过高效且优化的All-to-All通信机制,支持节点内部和节点之间的通信,分别利用NVLink和RDMA实现。 据硅星GenAI公众号数据,在实测中,DeepEP在H800上4096个token同时处理的场景下,达到了153GB/s的传输速度,接近硬件理论极限(160GB/s)。图:英伟达的GPU节点内部及节点间通信资料来源:DOIT请务必阅读报告附注中的风险提示和免责声明 26国海证券综合其他