> 数据图表如何解释GLM-5 完整全链路训练流程2026-6-5GLM-5 采用了极具规模的混合专家(MoE)架构,总参数量达到 7440 亿,其中单 Token 激活参数量为 400 亿。该架构通过引入 DeepSeek 稀疏注意力(DSA)技术,在保持超长上下文保真度的同时,显著降低了训练与推理的计算开销。在对齐技术上,GLM-5 构建了一套全新的异步强化学习基础设施,通过解耦生成过程与训练过程,极大地提升了训练效率。此外,针对编程任务,GLM-5 构建了大量真实的执行环境,使模型能够在多轮长周期任务中学习错误修正行为。华西证券综合其他