> 数据图表一起讨论下2.2、DeepSeek开源库1:FlashMLA大幅提升显存带宽+推理效率2025-4-12.2、DeepSeek开源库1:FlashMLA大幅提升显存带宽+推理效率2025年2月24日,DeepSeek开启了为其5天开源周的第一个开源项目——FlashMLA。FlashMLA是一个针对 Hopper GPU 优化的高效 MLA(多头潜在注意力机制)解码内核,支持变长序列处理,现在已经投入生产使用。FlashMLA实现在H800 SXM5 GPU上具有3000GB/s的内存速度上限以及580TFLOPS 的计算上限。 FlashMLA主要是通过优化MLA解码和分页KV缓存,提高LLM的推理效率,尤其是在H100/H800类高端GPU上发挥显著性能。当前GPU的计算速度远超内存速度,使得内存/访问成为影响 Transformer 模型执行操作的关键所在。DeepSeek 官方提到,FlashMLA 的灵感来自 FlashAttention 2&3 和 cutlass 项目。FlashAttention 是一种高效的注意力计算方法,专门针对 Transformer 模型的自注意力机制进行优化,核心目标是减少显存占用并加速计算。FlashAttention 注意力算法避免从HBM里读取或写入注意力矩阵,通过重新构建注意力计算等方式,比从HBM中读取中间注意力矩阵的传统方式速度更快。据DeepTech数据,经过测试,在减少内存/访问执行的条件下,与常见的 PyTorch Attention 相比,FlashAttention 的运行速度提高了 2-4 倍,所用内存则是前者的 5%-20%。图:FlashMLA灵感来自FlashAttention图:FlashMLA对比标准MHA的标准MHAFlashMLA时间复杂度内存复杂度适合长序列O(n2)O(n2)受限O(nk)O(nk)高度适合典型用例中短序列长序列、实时推理资料来源:APPSO公众号请务必阅读报告附注中的风险提示和免责声明 25国海证券综合其他