一个AI,让鱼和台灯都动起来?
给人物做动作不稀奇;同一个AI能不能让人、鸟、鱼、昆虫、蛇形角色,甚至台灯这类关节物体都听懂文字并动起来?
【来源事实】9月4日提交的UniMate论文,把“每类角色一套动画模型”改成“一套模型读懂不同骨架”。输入是一份已经绑定骨架的3D资产和一句动作描述,不需要在测试时重新优化,也不用为每副骨架单独训练。
它的核心是拓扑感知扩散Transformer。可以把骨架想成一棵树:模型不仅看每个关节的位置,还把父子、兄弟关系和沿骨架的距离写进注意力;再用图拉普拉斯谱构造Spec-RoPE,让不同关节数量、不同连接方式也有可比较的位置编码;最后用全局拓扑条件器告诉每一层“这副身体整体长什么样”。
训练数据UniML3D包含13006条动作、2140232帧,覆盖双足、四足、鸟类、海洋、昆虫、蛇形和关节物体。论文在7类未见过的骨架、58条动作上测试:扩展版AnyTop的FID为2.711,UniMate降到0.757;多样性从8.139升到9.200。这里衡量的是受控基准中的运动质量与多样性,不等于所有角色都能直接用于商业制作。
【专家判断】这条路线真正有价值的地方,是把“身体结构”从固定模板变成模型输入。做游戏、影视或仿真时,验收别只看视频是否顺眼,至少要查四项:未见骨架能否泛化、脚与地面接触是否打滑、局部关节能否精确控制、导出后能否进入现有蒙皮和物理管线。
边界也很明确:数据中双足角色占84.1%,蛇形和海洋类只有0.3%与0.8%;模型仍会出现脚滑、悬空、穿地,文字也无法精确指定手脚轨迹。完整训练代码、权重和数据目前仍是“发表时发布”的承诺,复现闭环还要等。
一手 3D生成 扩散模型 计算机图形学
