-
aaideit_admin 管理员
MirroS发布Code-as-World:将真实视频重写为可执行MuJoCo物理程序的智能体循环
MirroS发布了Code-as-World:一种通过可执行世界表示来表示物理世界的范式。论点狭窄且可测试:像素是物理场景的证据,而非其本体论。视频模型可以预测合理的帧序列,但不理解物理机制。Code-as-World通过提取场景的可执行表示来解决这一差距。
技术架构
MirroS技术报告认为,视频模型、3D重建和标题各自恢复场景的一部分,但none recovers其机制。Code-as-World将场景表示为可执行世界表示(EWR),三元组p = (C, E, A):
- C(代码):描述场景几何和物理的参数化表示
- E(引擎):执行代码的物理或动画模拟器
- A(动作):智能体可以执行的操作空间
在发布实现中,该三元组编译为在MuJoCo中执行的scene.json,具有两个可互换引擎:动画引擎(运动学姿态)和物理引擎(力和接触)。
逆向问题求解
从视频中恢复EWR是一个逆问题,因此团队将其框架为溯因搜索。智能体运行提出→实例化→执行→渲染→验证循环,最多K=5轮。对于视频输入,SAM 3提供实例遮罩和图像平面追踪。
性能表现
在匹配的五次评估预算下,循环在Visual Alignment、Object IoU、Traj-ADE和Accuracy@2%D上击败了Best-of-5独立采样,结果在第二个执行引擎下重复。候选视频来自WISA-80K,经运动过滤。
训练阶段
第一阶段在73,335个图像空间问答对上监督微调,这些问答对从RefCOCO/+/g、RefCLEF和GOT-10K构建,覆盖原始像素中的范围、位置、位移、速度和加速度。第二阶段对来自1,585个视频的world-space VQA应用GRPO。
量化结果
在QuantiPhy-validation(159项,MRA宏观平均覆盖2S/2D/3S/3D):4B = 50.6,9B = 55.4,27B推理 = 58.6,对比Gemini-3.1 Flash的54.8、ChatGPT-5.1的48.4和最强开放权重基线Qwen3-VL-32B-Instruct的40.2。
本文源自「MarkTechPost」