FlashVLA:让机器人边执行边解码,单卡也能跑出 30 Hz
arXiv:2608.27384v1
VLA正逐渐成为机器人端到端操作的重要路线,但真实部署仍卡在推理延迟与异步执行不稳定上。以流匹配模型 π0.5 为例,每个动作块需要连续完成十次去噪,动作解码占单次推理时间的 75%。同步模式会让机器人在动作块交界处停顿,异步模式虽然把预测与执行重叠起来,却只能依据已经过时的观测生成动作;等动作真正下发时,机器人往往已经进入模型未见过的状态。现有方法通常只加速单次计算,或额外预测未来状态,难以同时解决延迟和时序错位。
FlashVLA 的核心改变是让多个动作块联合解码,而不是让每个动作块从纯噪声独立起步。系统维护一个流式动作缓冲区,其中不同位置的动作块处于交错的噪声等级:队首接近完成并即将执行,队尾则刚从纯噪声开始。每次前向计算都会让缓冲区内所有动作块共同推进一次去噪;预热完成后,模型每一步都能弹出一个可执行动作块,再从队尾补入新的噪声。完整去噪过程由此被摊到连续推理周期中,单步动作解码延迟最高降低 20 倍。
为了让联合解码符合真实执行顺序,FlashVLA 使用动作块级因果注意力:噪声较高、执行时间较晚的动作块可以关注更干净、即将执行的动作块,反向信息流则被屏蔽。未来动作因此能够感知机器人正在沿着怎样的轨迹前进,无需额外的未来状态预测器或动作条件模块。缓冲区还形成了一段结构化短期记忆,因为每个未来动作块都能参考多个更早的动作块。训练时,方法把同一观测对应的全部冷启动缓冲状态打包进一个样本,共享一次视觉编码,并用注意力掩码隔离不同配置,从而以轻量微调适配预训练的流匹配 VLA。
实验显示,这套结构没有用速度交换任务质量。在 LIBERO 的一步异步设置中,FlashVLA 将 π0.5 的平均成功率从 96.9%提升至 97.8%,同时把每步时间从 53.8 毫秒降至 22.1 毫秒,实现 2.43 倍加速;在 RoboTwin 2.0 长时程任务上,平均成功率更从 53.0%升至 89.6%,体现出动作块记忆对跨阶段操作的帮助。
这说明 VLA 的实时化不只依赖压缩模型或减少去噪步数,重新组织动作生成的时间结构,也能同时改善控制频率、轨迹连续性与长任务稳定性。
具身智能 论文 科研



