塔斯娱乐资讯网

LiveVVT:高保真实时流式视频虚拟试穿框架 清华提出了创新的滚动流式扩散框架

LiveVVT:高保真实时流式视频虚拟试穿框架
清华提出了创新的滚动流式扩散框架LiveVVT,解决了传统视频虚拟试穿模型依赖全片段输入导致的超高延迟与计算开销问题。通过在固定大小的滚动窗口内执行交错噪声水平的联合去噪,实现了有界前瞻下的双向建模,并引入双重记忆机制确保长程一致性。实验表明,在保持高保真生成质量同时,相比同规模SOTA 模型MagicTryOn,首块延迟仅1.56s,降低了26.35 倍,吞吐量提升了11.37 倍,来到了22.39 FPS,且显存占用不随视频长度增加,真正实现了长视频流的实时虚拟试穿。

滚动流式去噪架构:
抛弃了传统的片段式处理,设计了基于交错噪声水平的滚动窗口。在每个推理步中,窗口内的多个视频块处于不同的去噪阶段:领先块接近完成,末尾块为纯噪声。通过联合去噪并每步输出一个干净块,模型在因果循环推理中保留了局部双向交互能力,既利用了未来帧的上下文进行遮挡推理,又保证了流式输出的实时性。

双重记忆机制解决长程漂移:
为应对长视频中的服装细节丢失和动作不连贯,模型设计了两种互补记忆模块。有界时间记忆通过缓存最近生成的键值特征,传播瞬时动态和遮挡上下文;持久全局外观记忆则利用目标服装和预先提取的正面参考帧构建,作为时间不变的锚点,在整个视频流中稳定服装纹理和穿着效果,有效抑制了长序列中的外观漂移。

渐进式蒸馏与协作匹配蒸馏:
为了将高质量的双向离线先验迁移至因果少步生成器,提出了三阶段训练策略。首先进行双向 VVT 基础学习;其次通过教师轨迹回归使模型适应因果注意力和少步采样;最后引入协作匹配蒸馏,将教师分布匹配与真实视频上的滚动流匹配相结合。这种设计对齐了训练与推理时循环分布,显著减轻了循环生成中的曝光偏差和误差累积。

长序列性能与资源效率:
由于采用了固定窗口和有界缓存,每步更新的延迟和峰值显存占用几乎不随视频时长增长。在512x384 分辨率下,模型能够以超过22 FPS 的速度持续运行,满足了直播电商和增强现实等场景部署需求。

消融实验分析:
引入正面参考帧显著降低了 VFID 指标,证明了全局锚点对稳定外观的作用;时间记忆则大幅提升了SSIM和LPIPS,增强了帧间结构一致性。蒸馏阶段,从阶段 I 到阶段 III,模型生成服装几何准确性和纹理细节逐级提升,验证了CoMD 在对齐流式推理轨迹方面必要性。
LLM 大模型 虚拟试穿 LiveVVT