> 数据图表

咨询大家GTA-VLA 的 Guide、Think、Act 三阶段框架

2026-5-1
咨询大家GTA-VLA 的 Guide、Think、Act 三阶段框架
运行时推理机制入手,给扩散式动作模型增加“先草拟、再验证、必要时回退”的低延迟控制层。其价值在于把大模型动作生成与机器人实时性之间的矛盾拆解为可调节的成功率-延迟权衡。论文也指出,当前 FLASH 仍依赖启发式阈值,未来需要更自适应的轨迹验证和回退策略,以适配更复杂的接触、动态目标和边缘部署场景。4.2.2. 交互式具身推理 VLA:福田实验室和哈尔滨工业大学等团队提出 GTA VLA以点框轨迹视觉提示增强机器人策略的空间可控性 2026 年 5 月,Yiran Ling、Qing Lian 等来自 Futian Laboratory、哈尔滨工业大学、IDEA、湖南大学和 Visincept 的团队在 arXiv 发布题为Guide, Think, Act: Interactive Embodied Reasoning in Vision-Language-Action Models 的论文。研究团队提出GTA-VLA 框架,使用户能够通过可视化空间先验直接引导机器人策略,并将这些先验纳入视觉-语言-动作模型的具身推理过程。 现有 VLA 模型多采用从多模态观测到动作的直接“Sense-to-Act”映射。该方式在训练分布内有效,但在光照变化、相机视角变化、未见物体或目标歧义场景中,模型容易发生错误接地,且用户难以用简短语言纠正具体的抓取点、目标区域或运动路径。近年来具身 Chain-of-Thought 方法开始显式输出中间推理,但多数系统的推理仍主要来自模型内部判断,缺少把人类空间意图注入推理链的交互接口。 GTA-VLA 将策略分解为 Guide、Think 和 Act 三个阶段。在 Guide 阶段,用户可提供可选空间先验,包括任务相关的二维点、目标框或轨迹线这些先验与主视角图像和语言指令共同输入模型。在 Think 阶段,视觉语言骨干生成结构化的空间-视觉推理序列,将外部空间提示与内部任务分解、视觉接地和运动意图结合。在 Act 阶段,下游 Flow-Matching 动作头读取最新推理隐状态并生成连续动作,同时以较高控制频率执行低层动作。