AI不只要看懂世界,还要把世界写成代码
MirroS 的技术报告Code-as-World里提到,不同于只用像素,潜在latent特征或自然语言描述来表示世界,Code-as-World 尝试把和任务相关的世界结构写成一段可执行代码,用来描述物理组成,动态变化和视觉外观。
AI能生成一段看起来真实的视频,不代表它真的理解了这个世界。比如一个球从斜坡上滚下来,模型也许能预测下一帧的画面,却未必知道球为什么会这样运动。它可能并不知道球的速度,质量,摩擦力,也不一定能预测如果换一个斜坡角度,球最后会滚到哪里。
Code-as-World想做的是让AI不单能预测像素,还要尝试把整个场景重建成一段可以运行的代码。
这段代码需要描述三类东西:
Composition|世界里有什么
物体,几何结构,质量,摩擦力,重力,以及它们之间的空间关系。
Evolution|世界如何变化
物体的位置,速度,运动轨迹,以及碰撞,接触,弹跳等事件。
Appearance|世界如何被观察
相机位置,视角,背景,材质和光照。
三者结合后,AI 得到的不是一张静态场景图,而是一个可以执行的世界程序。
接下来,Agent 会不断循环Agentic Discovery Loop:
提出假设 → 编译代码 → 运行模拟 → 渲染视频 → 对比真实观测 → 修正代码
如果模拟结果和真实视频对不上,系统就要判断是物理参数错了,还是运动规律,相机角度或场景结构出了问题,用误差继续学习。
最后模型得到的不只是一段视频,还能得到视频背后的物理信息,这些数据可以用来训练模型做更准确的物理推理。在 QuantiPhy上的测试显示Code-as-World对物理的理解表现优于不少语言模型。
Code-as-World试图让 AI 从看起来懂了,走向能够进行物理推理,模拟,验证和干预这个世界。
当然,它距离真正理解现实还有很远。真实世界充满不确定性,单个视频也可能对应多个不同的物理解释,模拟器本身也可能带来偏差,但这是一个值得继续努力的方向。
人工智能 世界模型 具身智能 物理AI 多模态AI 机器人 论文分享 MirroS

