塔斯娱乐资讯网

WALL-SS 发布,世界模型的下一范式? 做动作条件世界模型,主流路线是视频扩

WALL-SS 发布,世界模型的下一范式?
做动作条件世界模型,主流路线是视频扩散,按clip组织,反复去噪出一段未来。改成自回归往下推更有前途,代价是误差顺着上下文累积,物体身份和动作历史跟着错乱。三个问题卡着落地,视觉先验够强时动作条件被绕开,记忆只留最近状态、全留则显存随时长涨,虚拟世界的成功率不能给真机策略当依据。

自变量机器人发布的 WALL-SS 走下一尺度自回归,先勾粗轮廓再补细节,把每一帧未来分颗粒度生成出来;整段具身经历写成观测与动作交替的因果序列,换来变长生成、流式续推和直接做强化学习。三个改进各对一个痛点。(图2)

[一] 尺度对齐的动作条件注入。动作轨迹被渲染成一段与 RGB 共享时间戳的动作视频,按视觉尺度分档注入,每一步生成都读得到同尺度的动作。同一初始帧换动作,未来跟着分岔,轨迹与指令的契合度大幅提升,动作跟随得分 0.29。

[二] 尺度压缩的长时间跨度记忆。同一套尺度层级反着用在时间上,近的 clip 保留细尺度因果状态,远的逐级压到粗尺度,动作历史同步压缩,内存上界与 clip 数无关。连续推演 60 秒,只留近期 clip 的版本轨迹误差冲到 0.8,全历史 KV 的到 0.48,WALL-SS 停在 0.2。

[三] 视觉动力学的在线策略对齐,把画面生成本身当成策略优化。模型采新鲜轨迹,两个冻结的裁判分别看每步转移合不合动作、长时窗内状态连不连贯,用 GRPO 更新。动作跟随和轨迹准确度同步提升,虚拟与真实的成功率吻合度达到 0.93。

✅ 同一套网络既能当模拟器按给定动作预测未来,也能当规划器自主规划路径,出方案到验方案的闭环在一个模型里跑完,600 对配对实验里给 checkpoint 排序的准确率是 89%。它内置动作解码头,从生成画面里直接读出下一步动作,无需外接模块,本身就是能指挥机器人的策略,真机平均任务进度 69.1,π0.5 是 49.6。

下一尺度自回归的价值在于,动作注入、记忆压缩和强化学习对齐由同一套网络一起承担,省掉三处各自打补丁。世界模型能当仿真平台用,替具身研发快速筛策略,周期就能缩短。眼下已经放出了论文和代码,能不能长成范式,还得看行业的跟进。[赞]

世界模型 机器人 论文解读 开源