> 数据图表

想关注一下FRAMESKIP 训练时帧选择与压缩轨迹接入流程

2026-5-1
想关注一下FRAMESKIP 训练时帧选择与压缩轨迹接入流程
4.2.3. VLA 训 练 帧 选 择 框 架 : 哈 尔 滨 工 业 大 学 和 中 关 村 学 院 等 团 队 提 出FrameSkip 框架以高信息帧重分配 VLA 训练监督 2026 年 5 月,Bin Yu 等人在 arXiv 发布题为FrameSkip: Learning from Fewer but More Informative Frames in VLA Training的论文。研究团队从训练数据层面对VLA 模型进行优化,提出 FRAMESKIP 框架,将机器人演示轨迹中的帧选择视为“时间监督分配”问题,通过保留更具信息量的帧、减少冗余低变化片段,在不改变模型架构、动作头、训练目标和推理流程的情况下提升训练效率。 随着 Open X-Embodiment 等大规模具身数据集的发展,VLA 模型越来越依赖密集机器人演示轨迹。这类轨迹通常由遥操作采集,包含从任务开始到结束的连续观测和动作。论文指出,传统训练往往按原始时间密度消耗所有帧,默认每一帧对策略学习同等重要但机器人轨迹中存在大量低变化、低信息片段,真正关键的监督往往集中在接近物体、接触、抓取、放置等稀疏转折时刻。密集使用所有帧不仅增加训练成本,也可能稀释关键动作阶段的学习信号。 FRAMESKIP 为每条演示轨迹中的帧分配重要性分数,并在目标保留比例下选择高重要性帧。其重要性估计同时考虑视觉变化、动作变化和任务进度信息,其中视觉-动作一致性用于避免仅凭动作幅度或画面变化造成的偏差。被保留帧形成压缩轨迹视图并接入数据加载器,训练时模型主要从这些高信息帧中学习未保留帧则可用于周期性上下文刷新,以保持轨迹连续性。论文还强调,保留比例表示留下的帧占比,而不是删除比例轨迹级剪枝结果可被缓存,使同一轨迹在不同训练阶段复用不同压缩视图。由于该方法只改变训练样本暴露方式,理论上可与不同 VLA 架构和训练配方兼容。