> 数据图表咨询大家LingBot-VLA 模型架构图
2026-6-23)高质量物理交互数据仍然稀缺,数据的质量、规模与多样性共同决定模型的泛化上限。VLA 模型和世界模型最终都指向真实物理交互数据不足的问题。语言模型可以使用互联网上的大规模文本训练,机器人数据则必须依赖真实硬件或高质量仿真环境采集,采集成本明显更高。目前行业同时依赖三类数据:仿真数据与视频数据用于大规模预训练,真实数据用于强化学习以覆盖长尾场景。三类方案各有利弊,技术路线尚未收敛仿真、视频数据与真实数据相结合的路径,或是未来数据采集与训练的主流方向。 真实数据具备高保真优势,但采集成本高昂。真实机器人数据能够记录机器人在真实环境中的动作执行结果和环境反馈,对 VLA 模型训练具有较高价值。但这类数据依赖真实硬件、人工遥操作和任务设计,采集成本较高,规模化难度较大。在真实数据规模化方向上,蚂蚁灵波科技开源的 LingBot-VLA提供了一个参照。该模型使用来自 9 种双臂机器人平台的约 2 万小时真实操作数据进行预训练,覆盖 AgiBot G1、AgileX 和 Galaxea R1Pro 等多种异构硬件配置。项目验证了真实数据规模与模型性能之间的正相关规律:随着预训练数据从 3000 小时扩展至 2 万小时,模型在下游任务的成功率持续提升,且在 2 万小时时仍未出现明显的性能饱和。在 RoboTwin 2.0 仿真基准的 50 项任务测试中,LingBot-VLA 的跨任务泛化成功率比 0.5 高出 9.92 个百分点。