> 数据图表

如何解释1.2.3、Post-training重要性凸显,RLHF范式出现 (2021–2022)

2025-4-1
如何解释1.2.3、Post-training重要性凸显,RLHF范式出现 (2021–2022)
1.2.3、Post-training重要性凸显,RLHF范式出现 (2021–2022)GPT-3同时也表现出大型语言模型与人类价值观、偏好及期望保持一致上的挑战。其中,“幻觉”问题尤为突出,即LLM生成的内容可能与事实不符、缺乏意义或与输入提示相悖,给人以“言之凿凿却离题万里”之感。为应对模型幻觉,2021至2022年间,研究人员推动了监督微调(SFT)及基于人类反馈的强化学习(RLHF)等技术的进展。 SFT(有监督学习方法)通过提供明确的输入——输出对,模型学习其中的映射关系。但SFT的弊端包括有1)可扩展性问题:收集人类演示需劳动密集且耗时,尤其是对于复杂或小众任务;2)性能:简单模仿人类行为并不能保证模型会超越人类表现,或在未见过的任务上很好地泛化。RLHF(基于人类反馈的强化学习)解决了SFT中可扩展性和性能限制的问题。RLHF包括两个阶段,首先:1)根据人类偏好数据集训练一个奖励模型,该模型学习根据人类反馈评估输出的质量。2)使用强化学习微调LLM,奖励模型使用近端策略优化(PPO)指导LLM的微调,模型学会了生成更符合人类偏好和期望的输出。 2022年3月,OpenAI发布GPT-3.5,与GPT3架构相同但关键增强包括改进数据更好地遵循指令,减少了幻觉。图:监督微调SFT以及基于人类反馈的强化学习RLHF资料来源:《Demystifying Reasoning Models》Cameron R. Wolfe请务必阅读报告附注中的风险提示和免责声明 15