> 数据图表咨询大家1.2.2、GPT-3以1750亿参数开启了预训练侧Scaling law叙事2025-4-11.2.2、GPT-3以1750亿参数开启了预训练侧Scaling law叙事2020年OpenAI发布GPT-3(1750亿参数模型),NLP模型迎来了转折点。1750亿参数突破了大规模预训练的界限,展示了显著的少样本和零样本学习能力,在推理时只需提供最少或无需示例即可执行任务。GPT-3的生成能力扩展到了创意写作、编程和复杂推理任务,展示了超大模型的潜力。预训练侧Scaling law的叙事开始出现,模型性能随着模型大小、数据集大小以及训练使用的计算量的增加而平稳提升。在2018年至2020年间,研究人员发现随着模型规模的增长,模型在捕捉复杂模式和泛化到新任务方面变得更好。这种规模效应得到了三个关键因素的支持:1)数据集大小:更大的模型需要庞大的数据集进行预训练;2)计算资源:强大硬件(如GPU和TPU)的可用性以及分布式训练技术,使得高效训练具有数十亿参数的模型成为可能;3)高效架构:混合精度训练和梯度检查点等创新降低了计算成本,使得在合理的时间和预算内进行大规模训练更加实际。图:Scaling law的三个方向资料来源:《Scaling Laws for Neural Language Models》Tom Henighan请务必阅读报告附注中的风险提示和免责声明 14国海证券综合其他