MirroS发布Code-as-World:将真实视频重写为可执行MuJoCo物理程序的智能体循环

MirroS发布了Code-as-World:一种通过可执行世界表示来表示物理世界的范式。论点狭窄且可测试:像素是物理场景的证据,而非其本体论。视频模型可以预测合理的帧序列,但不理解物理机制。Code-as-World通过提取场景的可执行表示来解决这一差距。

技术架构

MirroS技术报告认为,视频模型、3D重建和标题各自恢复场景的一部分,但none recovers其机制。Code-as-World将场景表示为可执行世界表示(EWR),三元组p = (C, E, A):

  • C(代码):描述场景几何和物理的参数化表示
  • E(引擎):执行代码的物理或动画模拟器
  • A(动作):智能体可以执行的操作空间

在发布实现中,该三元组编译为在MuJoCo中执行的scene.json,具有两个可互换引擎:动画引擎(运动学姿态)和物理引擎(力和接触)。

逆向问题求解

从视频中恢复EWR是一个逆问题,因此团队将其框架为溯因搜索。智能体运行提出→实例化→执行→渲染→验证循环,最多K=5轮。对于视频输入,SAM 3提供实例遮罩和图像平面追踪。

性能表现

在匹配的五次评估预算下,循环在Visual Alignment、Object IoU、Traj-ADE和Accuracy@2%D上击败了Best-of-5独立采样,结果在第二个执行引擎下重复。候选视频来自WISA-80K,经运动过滤。

训练阶段

第一阶段在73,335个图像空间问答对上监督微调,这些问答对从RefCOCO/+/g、RefCLEF和GOT-10K构建,覆盖原始像素中的范围、位置、位移、速度和加速度。第二阶段对来自1,585个视频的world-space VQA应用GRPO。

量化结果

在QuantiPhy-validation(159项,MRA宏观平均覆盖2S/2D/3S/3D):4B = 50.6,9B = 55.4,27B推理 = 58.6,对比Gemini-3.1 Flash的54.8、ChatGPT-5.1的48.4和最强开放权重基线Qwen3-VL-32B-Instruct的40.2。



本文源自「MarkTechPost