> 数据图表

我想了解一下端到端的挑战:数据

2025-3-1
我想了解一下端到端的挑战:数据
端到端的挑战:数据由于端到端算法基于数据驱动,大模型依赖大量的高质量数据进行训练。以训练数据为核心,重点关注数据量、数据标注、数据质量、数据分布、云端存储与超算中心等因素。2023年,特斯拉在端到端神经网络开发初期,就向系统输入了1000万个经过筛选的人类驾驶视频片段,按每段15秒估算,高清视频的总计时长超过4万小时。根据特斯拉的测算,单个端到端模型至少需要经100万个分布多样且高质量的视频片段训练才能正常运作。此外,在大规模数据收集的基础上,需要对海量道路场景的数据进行标注,将其转化为支撑算法训练的数据,这也需要重资产投入。因此,优质训练数据的体量与企业的自研实力、综合产品力、资金投入、智驾车型销量等因素密切相关,这些因素在一定程度上强化了车企的马太效应。真实数据中,长尾场景覆盖率低。长尾场景(暴雨、积雪或施工复杂环境中事故高发区域)中,车辆的行为决策需要高度鲁棒的模型支持,然而,这些场景在真实数据中占比极低,难以通过传统的路测覆盖全面。现有的仿真测试技术只能生成部分场景,而针对动态交互场景(如复杂的多车协同避让)的模拟能力有限,导致验证结果难以完全反映真实情况。因此,调整长尾场景在训练数据中的分布比例有很大的探索价值。目前的普遍解决方案是采用合成数据来模拟真实世界数据的特征分布。合成数据能够以较低成本增加训练数据的规模、丰富泛化场景的多样性,并有效生成长尾场景。例如,英伟达通过其Omniverse平台,利用合成数据提升模型对复杂场景的适应性。此外,特斯拉也采用合成数据生成边缘场景来扩充数据集,通过迭代方法捕捉更多边缘情况。表2:主要车企辅助驾驶里程累计情况特斯拉鸿蒙智行理想蔚来小鹏超16亿英里(2024年中报)4.6亿公里(2024.08)29.3亿公里(2024.12)14.8亿公里(2024.11)资料来源:汽车之心,中工汽车网,中国财经报,AI新能源低碳出行,国元证券研究所请务必阅读正文之后的免责条款部分756万公里(实车测试里程,2024.07)10