> 数据图表

如何看待2.3.2 “Reasoner” ——o3发布为AGI的最重要节点,推理能力更加接近人类

2025-3-3
如何看待2.3.2 “Reasoner” ——o3发布为AGI的最重要节点,推理能力更加接近人类
2.3.2 “Reasoner” ——o3发布为AGI的最重要节点,推理能力更加接近人类◼ 推理能力真正接近人类:o3是OpenAI推出的最新大规模推理模型,经过强化学习(RL)训练,作为o1的进阶版本,在通用领域的推理能力上取得了重大突破。该模型在编程能力方面表现出色,CodeForces评分超过2700,达到了世界顶尖竞技程序员的水平,我们在o1发布前认为OpenAI新模型只有SWe Bench达到70%以上才是本质的突破。o3这一代模型在SWE-bench测试中获得71.7%的成绩,远超o1。ARC Prize上o3 的得分是 o1 的三倍,超过 85% 。 科学与数学能力提升上,在GPQA测试中,o3的得分为87.7%。◼ o3的架构有何改变?➢ 从模型架构上,OpenAI 并未披露o3详细架构,但表示o3在o1基础上大幅加强了强化学习的算力投入,并且可以选择推理时的算力投入。ARC Prize认为o3采用自然语言程序搜索,在token空间中进行思维链(Chain of Thought, CoT)搜索,结合蒙特卡罗树来指导搜索过程。◼ o3能够大规模替代人类工作了吗?➢ 以Arc Prize的测试为例,人类完成普通工作需要5美元,o3在低推理消耗下需要17-20美元。相较于人工成本,推理模型在完成普通工作的成本消耗仍有下降空间;我们认为o3系列的成本可能会在未来一年内继续大幅降低。图:OpenAI o3模型能力图:OpenAI “o系列”模型性能测评资料来源: ARC Prize等、天风证券研究所1010