> 数据图表

怎样理解Qwen3 后训练流程将 Thinking 能力、Non-thinking 能力与强到弱蒸馏纳入统一管线

2026-6-2
怎样理解Qwen3 后训练流程将 Thinking 能力、Non-thinking 能力与强到弱蒸馏纳入统一管线
3)后训练对模型性能的影响权重上升。随着预训练侧高质量公开语料的边际收益递减,继续增加 token 带来的能力提升越来越薄,行业竞争开始下沉到后训练阶段。目前,可验证的强化学习(RLVR)和蒸馏拒绝采样正在成为后训练的主要手段。DeepSeek 系列从 R1 到 V3.2 再到 V4,验证了 GRPO 算法加可验证奖励能引导模型在自己生成的轨迹上修正推理路径,在数学和代码领域效果显著。Qwen3技术报告也指出,用大模型批量生成推理轨迹、经拒绝采样筛选后灌给小模型,可以减少训练数据量、提升性能。后训练手段的有效性离不开数据,需要说明的是,目前合成数据在后训练中主要起辅助作用,后训练的最终可靠性与对齐校验,仍高度依赖真实数据。