> 数据图表如何解释复盘-LLM推理能力提升2026-1-1复盘-LLM推理能力提升◼ 推 理 能 力 被 重 点 强 化 : 2025 年 , 在 Scaling Law 的 限 制 下 , LLM 的 发 展 重 心 逐 步 从 训 练 转向推理,包括GPT、Gemini、DeepSeek等主流 模 型 都 重 点 强 化 推 理 能 力 , LLM 的 推 理 能 力获得较大提升。◼ 强 化 学 习 发 展 : DeepSeek-R1 改 进 了 传 统 大量 依 赖 人 工 标 注 的 SFT 技 术 , 在 后 训 练 阶 段 大规 模 使 用 了 强 化 学 习 技 术 , 使 得 其 在 仅 有 极 少标 注 数 据 的 情 况 下 极 大 提 升 了 模 型 的 推 理 能 力 ,在 数 学 、 代 码 等 问 题 上 都 达 到 或 接 近 一 流 模 型标 准 。 最 新 的 DeepSeekMath -V2 模 型 引 进 了Self- Verification ,通过模型的反复思考和自我 验 证 做 到 了 和 人 类 相 似 的 思 考 模 式 , 大 幅 提升了模型数学方面的能力 。◼ 模 型 思 维 链 优 化 : Gemini 3 引 入 了 Deep Think 模 式 , 通 过 允 许 模 型 做 更 多 的 思 考 和 更有 结 构 的 推 理 。 Gemini 3 Deep Think 在 最新的 ARC-AGI-2新 基 准 测试 中 拿下 45.1% 的 分数,大幅领先包括Gemini 3 Pro的其他对手。图表: DeepSeekMath-V2模型在IMO公开测试中展现了顶尖实力图表:Gemini Deep Think优化模型思维链后效果显著来源: 《DeepSeekMath-V2: Towards Self-Verifiable Mathematical Reasoning》 、Gemini官网、 DeepSeek官方公众号、 AI信息Gap公众号, ,长城证券产业金融研究院长城证券综合其他