> 数据图表如何了解4.3、DeepSeek带动纯强化学习新范式,引领通向AGI之路2025-4-14.3、DeepSeek带动纯强化学习新范式,引领通向AGI之路DeepSeek探索LLM在没有任何监督数据的情况下发力推理能力的潜力,通过纯RL(强化学习)的过程实现自我进化。具体来说,DS使用DeepSeek-V3-Base 作为基础模型,并使用GRPO(群体相对策略优化)作为RL框架来提高模型在推理中的性能。在训练过程中,DeepSeek-R1-Zero自然而然地出现了许多强大而有趣的推理行为。经过数千次 RL 步骤后,DeepSeek-R1-Zero 在推理基准测试中表现出卓越的性能。例如,AIME 2024 的 pass@1 分数从15.6%增加到 71.0%,在多数投票的情况下,分数进一步提高到86.7%,与OpenAI-o1-0912的性能相当。图:R1-Zero在不同测试基准下超过o1mini甚至比肩o1的水平图:随时间推移DS模型性能显著提升资料来源:《DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning》请务必阅读报告附注中的风险提示和免责声明 50国海证券综合其他