> 数据图表

如何解释理想:双系统并行,VLM规范端到端模型下限

2025-3-1
如何解释理想:双系统并行,VLM规范端到端模型下限
理想:双系统并行,VLM规范端到端模型下限图30:VLM模型在驾驶过程中,自动标注视频帧和传感器信号以生成轨迹和其他标签。此外,对视频帧应用自动描述生成,以生成行为和推理的描述。双系统工作原理:常规传感器进入到理想专门为Orin-X优化过的CNN主干网络,并提取特征融合,为了增强BEV空间特征表达能力,加入了记忆模块,不仅是时序记忆还有空间记忆。特意额外设计了另外两个输入,一个是自车状态信息,另一个是导航信息,信息进入Transformer编码器后,和加强后的BEV特征一起解码出动态障碍物、道路结构,OCC,行驶轨迹。这些输出主要有两重作用,第一重是输出EID,让用户放心,第二重是作为端到端模型的辅助监督任务,加速行驶轨迹的收敛。带有推理逻辑的视觉语言大模型,在处理多元异构信息(视觉、听觉、文本 00CR)得到结果时,具备更好的可感知性、可解释性。单一端到端模型中,深度学习的应用使得对模型的理解能力逐渐丧失,深度学习模型的不可解释和不可见性使人们难以理解模型的理论基础,而大模型众多参数更增加了理解难度,只能通过过拟合测试验证。在此基础上并联一个VLM模型的优势就在于使推理模型可解释性增强,并且应用强化学习实现无监督学习。VLM的另一个优势在于数据挖掘与场景理解。智能驾驶依赖海量数据,但有效数据占比低,可以通过VLM模型进行高效挖掘,加速数据分析和场景理解的迭代。请务必阅读正文之后的免责条款部分资料来源:Arai H, Miwa K, Sasaki K, et al,CoVLA: Comprehensive Vision-Language-Action Dataset for Autonomous Driving,国元证券研究所31