> 数据图表

咨询下各位端到端实现方法:模仿学习

2025-3-1
咨询下各位端到端实现方法:模仿学习
端到端实现方法:模仿学习算法实现层面,端到端的方法可以大致分为模仿学习和强化学习。模仿学习也称为从示范中学习,是一种通过模仿专家行为来训练智能体学习策略的方法。模仿学习中,一种广泛使用的方法是行为克隆(BC),将问题转化为监督学习问题。另一种方法是逆最优控制(IOC,也称为逆强化学习),利用专家示范来学习奖励函数。表1:模仿学习的两大算法类别类别简述优势挑战行为克隆(BC)在行为克隆中,通过最小化规划损失来实现智能体策略与专家策略的匹配,其中监督学习中的损失函数用于度量智能体动作与专家动作之间的距离。早期应用于自动驾驶的BC,利用端到端神经网络从摄像头输入生成控制信号(如方向盘转动、加速等)。为了使基于BC的端到端驾驶模型能够应对复杂的城市场景,业内提出了进一步改进,如多传感器输入、辅助任务和改进的专家设计。简洁性和高效性,因为无须手工设计奖励函数。协变量偏移。协变量偏差指的是在训练过程中模型训练时所用的数据分布(例如,某些路况、驾驶场景的频率)与实际部署时遇到的数据分布(例如,实际道路的复杂性和多样性)不一致。对于一般的模仿学习,一些在线方法已经提出以解决这个问题。在端到端自主驾驶的背景下一般采用DAgger方法。因果混淆。即模仿者会利用并依赖于输入组件与输出信号之间的错误相关性(模型可能会将某些表面上相关的因素,如天气、交通状况,错误地认为是决定驾驶行为的关键因素,从而导致决策不准确)。逆最优控制(IOC)逆最优控制是一种从专家示范中学习的算法,通过观察专家驾驶员的行为来推测出一个“奖励函数”。这个奖励函数可以理解为:专家做出的每一个动作都有一个“奖励值”,这些奖励值反映了每个行为的好坏。逆最优控制的主要方法分为对抗模仿学习(GAIL)与成本学习(CostLearning)。对抗模仿学习(GAIL):不仅仅是模仿专家的行为,而是通过让学习系统和专家系统之间“对抗”来学习最佳策略。具体来说,GAIL的目标是让一个“判别器”区分专家行为和学习行为,系统通过不断调整自己的行为,使得这个“判别器”无法再区分专家的行为和系统自己的行为。成本学习(Cost Learning) :将“奖励函数”替换成“成本函数”,两者含义相反。在成本学习中,自动驾驶系统会学习如何选择最低成本的行为。例如,在路上行驶时,系统会选择最少危险、最舒适的行驶轨迹,这些轨迹的“成本”是最小的。成本函数可以有不同的表示方法,例如鸟瞰图(BEV)中的成本体积、联合能量,以及概率语义占用层和自由空间层。在自动驾驶的场景中,奖励函数的定义非常复杂,因为要考虑的因素众多,比如路况、交通规则、其他车辆的行为等等,而且这些因素是动态变化的。所以,优化奖励函数非常困难。成本学习方法中,为了生成更现实的成本,通常需要结合高清地图(HD maps)、辅助感知任务和多传感器数据,这增加了为多模态多任务框架学习和构建数据集的难度。资料来源:Chen L, Wu P, Chitta K,et al,End-to-end Autonomous Driving: Challenges and Frontiers,焉知汽车,国元证券研究所请务必阅读正文之后的免责条款部分8