> 数据图表如何解释4.3、DeepSeek带动纯强化学习新范式,引领通向AGI之路2025-4-14.3、DeepSeek带动纯强化学习新范式,引领通向AGI之路GRPO相对PPO节省了与策略模型规模相当的价值模型,大幅缩减模型训练成本。 传统强化学习更多使用PPO(近端策略优化),PPO中有3个模型,分别是参考模型(reference model)、奖励模型(reward model)、价值模型(value model),参考模型作为稳定参照,与策略模型的输出作对比;奖励模型根据策略模型的输出效果给出量化的奖励值,价值模型则根据对策略模型的每个输出预测未来能获得的累计奖励期望。ppo中的价值模型规模与策略模型相当,由此带来巨大的内存和计算负担。GRPO(群里相对策略优化)中省略了价值模型,采用基于组的奖励归一化策略,简言之就是策略模型根据输入q得到输出o(1,2,3),再计算各自的奖励值r(1,2,3),而后不经过价值模型,而是制定一组规则,评判组间价值奖励值的相对关系,进而让策略模型以更好的方式输出。图:GRPO相对传统PPO强化学习方式对比图:GRPO核心方法详解资料来源:AWS、《DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning》请务必阅读报告附注中的风险提示和免责声明 51国海证券综合其他