Hana's Blog
dWorldEval 论文精读:用离散扩散世界模型规模化评估机器人策略Blur image
Arxiv ID 2604.22152
幻觉翻译 2604.22152
publication pending

dWorldEval 让视觉、语言和 action chunk 共同成为离散 token,并联合生成未来观测与进度 token,以闭环想象 rollout 自动评估机器人策略。

推荐指数:

1. 论文概述#

【Paper】 dWorldEval 要解决的不是训练一个执行 policy,而是如何低成本比较大量机器人策略、checkpoint、任务和环境。真实执行慢且昂贵,传统仿真又受资产与 sim-to-real 偏差限制。论文提出一个以 Masked Discrete Diffusion(MDD)为核心的 action-conditioned world model,令候选 policy 在模型生成的世界中闭环执行,再由 imagined rollout 估计成功率。

一句话总结#

【Analysis】 核心因果链是:让 action 与图像处于同一 token 序列以提升 action faithfulness;用 sparse keyframe memory 减少多步漂移;把任务完成度作为与未来视觉共同生成的 progress token,从而将世界生成直接连到策略排名。

核心贡献#

【Paper】

  1. 将 RGB、instruction 和连续 action chunk 分别离散化后置于同一序列,使用一个 Transformer 做去噪生成。
  2. 以 sparse keyframe memory 维护长时域时空一致性,并显式加入时间 ID。
  3. 用 VLM 标注的离散 progress-as-text 与未来图像共同生成,终点 score 为 1 时自动判成功。
  4. 提出衡量状态变化的 Δ\DeltaLPIPS,并在 LIBERO、RoboTwin、真实双臂 AgileX 上评测 WorldEval、WorldGym、Ctrl-World 等基线。

【Paper】 作者来自 Current Robotics 与 University of Toronto。论文提供 项目主页,但截至本文写作时未公开官方模型训练/推理代码、checkpoint 或配置;因此本文不把项目网站源码误当作模型实现。

2. 背景与相关工作#

【Paper】 生成式 world model 可避免对每一个候选策略都进行真实执行,但作为 evaluator 必须同时满足:一,action controllability,给定失败 action 也不能把结果“修正”为成功;二,spatiotemporal consistency,长 rollout 中物体、机械臂和多相机视角不能逐渐矛盾;三,能区分任务完成与未完成。

【Paper】 作者认为现有 video diffusion evaluator 的根本问题是架构:许多方法将机器人动作作为 cross-attention 或 AdaLN 等附加条件,预训练视频先验则强烈偏向视觉上合理、往往也是“成功”的未来。尤其在训练主要含 expert demonstration、测试输入 suboptimal/OOD actions 时,视频 prior 容易压过弱控制条件。

【Analysis】 增加失败数据固然有用,却无法枚举所有错误动作。dWorldEval 的选择是把问题从“视频生成器是否听从外部 action condition”改成“包含 action token 的完整序列如何共同补全”:这不保证物理完美,却使 action 不再是可被忽略的旁路。

3. 问题定义#

【Paper】 输入为当前观测 oto_t、历史 hth_t、语言指令 ll 与 future action chunk at\mathbf a_t;world model Wθ\mathcal W_\theta 预测 horizon Δ\Delta 后的观测和任务进度:

(o^t+Δ,v^t+Δ)Wθ(ot,ht,l,at),v^t+Δ[0,1].(\hat o_{t+\Delta},\hat v_{t+\Delta}) \sim\mathcal W_\theta(\cdot\mid o_t,h_t,l,\mathbf a_t), \qquad \hat v_{t+\Delta}\in[0,1].

当前观测可包含同步的 third-person / wrist RGB;历史是关键帧记忆;action chunk 的长度和 Δ\Delta 对齐。模型的输出是“执行该 action 后世界会怎样”和“该状态完成到何种程度”,并不直接输出 policy action。

【Paper】 对候选策略 π\pi,让它与模型闭环,得到 imagined trajectory τ={o^0,o^Δ,,o^T}\tau=\{\hat o_0,\hat o_\Delta,\ldots,\hat o_T\}。论文以

J(π)=1Ni=1NS(τi)J(\pi)=\frac1N\sum_{i=1}^N\mathcal S(\tau_i)

作为 imagined success rate;S\mathcal S 可由人类查看生成结果给出,也可由终点 progress token 是否为 1 自动决定。

元素角色
Observation当前多视角 RGB;历史仅保留固定全局视角
Languageinstruction,经 LLaDA 转为 text token
Action连续 action chunk,经 FAST 转为离散 token
Output未来多视角视觉 token 与离散 progress token
目标与真实执行成功率相关、可正确排序的 imagined success rate

4. 方法#

4.1 Overall Architecture#

dWorldEval 统一离散扩散架构、稀疏关键帧记忆与 Progress-as-Text(论文 Figure 1)

【Paper】 低分辨率历史、当前多视角图像、instruction 和 action chunk 分别 tokenized 并串为 context;未来图像与进度构成被 mask 的 target suffix。Transformer 以 iterative parallel denoising 补全 target,之后 visual/text detokenizer 分别恢复下一步观测和数值 score。

4.2 核心模块#

Unified token sequence#

【Paper】 RGB 使用 MAGVIT-v2、language 使用 LLaDA、连续 action chunk 使用 FAST。各 tokenizer 的离散 code 经 index offset 后进入共同词表,展开为 history、current observation、instruction、action 与 target 的扁平序列。视觉 token 可通过同一个 self-attention backbone 直接关注 action token。

【Analysis】 “统一”不是让三个 modality 共用 encoder,而是让它们作为同一个 Transformer 的主序列元素共同参与推理。与 action 作为辅助 cross-attention condition 相比,future visual token 在每层 attention 都能读取 action token,这正是论文试图增强 controllability 的结构原因。

Sparse keyframe memory#

【Paper】 memory 按与 action chunk 对齐的固定 stride,从最近帧中选取 KK 个 keyframe;每帧前加绝对 frame index 的文本 token 保存时间顺序。为节省 token,history 只编码低分辨率固定全局视角;当前 observation 保留全分辨率多视角以刻画接触细节。

【Analysis】 这不是完整 video cache,而是以中间帧信息换取长期布局锚点。对 evaluator 而言尤为重要:单步图像再逼真,只要第十步物体位置漂移,policy ranking 就可能失真。

Progress-as-Text#

【Paper】 作者基于任务里程碑,用 few-shot prompting 令 SEED-1.5VL 生成完成度,将 00.20.40.60.81.0 等数值转为 text token,并附在未来视觉 target 后。推理时 parser 将生成文本解为 v^t+Δ\hat v_{t+\Delta};终点为 1 便判 imagined rollout 成功。

【Analysis】 进度和图像同源生成,避免了“视频模型生成结果、外置 classifier 独立评分”的不一致接口;但 VLM 伪标签的偏差也被写入了模型,离散分段是否适用于新任务仍需校准。

4.3 关键公式#

Masked Discrete Diffusion#

【Paper】 令可见 context 为 ct\mathbf c_t,未来视觉与 progress 的 target suffix 为 yt+Δ\mathbf y_{t+\Delta}。采样 λU(0,1)\lambda\sim\mathcal U(0,1) 后,以 mask forward process 得到 y~\tilde{\mathbf y},mask 位置为 Ωλ\Omega_\lambda。训练损失是:

LWM=Eτ,λ,y~[1m(λ)jΩλwjlogpθ(yjct,y~t+Δ,λ)].\mathcal L_{\rm WM}= \mathbb E_{\tau,\lambda,\tilde{\mathbf y}} \left[-\frac{1}{m(\lambda)}\sum_{j\in\Omega_\lambda}w_j \log p_\theta(y_j\mid\mathbf c_t,\tilde{\mathbf y}_{t+\Delta},\lambda)\right].

m(λ)m(\lambda) 是 mask probability;wjw_j 是 modality rebalancing weight;论文设 visual token 为 11、progress token 为 22。损失仅作用于被遮住的位置,推理则多轮并行填回这些离散 token。

Δ\DeltaLPIPS#

【Paper】 常规 LPIPS 比较静态外观,未必能发现“结果画面像、但 action 导致变化错了”。论文先取状态变化:

Δot=ot+Δot,Δo^t=o^t+Δot,\Delta o_t=o_{t+\Delta}-o_t,\qquad \Delta\hat o_t=\hat o_{t+\Delta}-o_t,

再使用:

ΔLPIPS=Et[dlpips(norm(Δo^t),norm(Δot))],\Delta\mathrm{LPIPS}=\mathbb E_t\left[ d_{\rm lpips}(\operatorname{norm}(\Delta\hat o_t),\operatorname{norm}(\Delta o_t))\right],

其中 norm\operatorname{norm} 是每样本 RMS normalization。较低的 Δ\DeltaLPIPS 表示预测到的视觉状态变化更接近真实变化,是 controllability proxy,并非直接的任务成功率。

4.4 Training#

【Paper】 LIBERO 使用 Object、Spatial、Goal、100 四个 suite 的同步 third-person/wrist 视角;约 5.5k 官方 expert demonstrations 之外还加入 1k suboptimal-policy failure rollouts。RoboTwin 选择 ARX 双臂,在 10 个 contact-rich tasks 使用 5.5k trajectories。真实平台是两条 6-DoF AgileX arms 与三台同步 RealSense 457 相机,数据为 5.2k trajectories,其中含 1k 人类采集 failure。

【Paper】 附录写明模型由 MMaDAVLA-8B 初始化,为 32 层、32 heads、hidden dimension 4096 的 bidirectional Transformer;使用 AdamW、8 张 H800、15 epochs、学习率 5×1055\times10^{-5}、global batch size 128。论文主文写 history 为 K=4K=41282128^2 keyframe,附录写作 256×256256\times256,两处不一致,不能合并为单一确定配置。

Algorithm 1 dWorldEval 联合视觉与进度训练
输入:
轨迹 (ht,ot,l,at,ot+Δ,vt+Δ)(h_t,o_t,l,\mathbf a_t,o_{t+\Delta},v_{t+\Delta})、三个 tokenizer、MDD Transformer
输出:
world model Wθ\mathcal W_\theta
  1. for 从平台轨迹采样当前帧、对齐 action chunk、未来帧和 progress label
  2. tokenize history、RGB、instruction、action,形成可见 context ct\mathbf c_t
  3. tokenize 未来 RGB 和 progress,按 λ\lambda mask target suffix
  4. 预测 masked token,按 LWM\mathcal L_{\rm WM} 计算视觉/进度加权去噪损失并更新 Transformer
  5. end for
  6. return 能生成未来观测与 progress 的 Wθ\mathcal W_\theta

4.5 Inference#

【Paper】 每个 prediction step 将 memory、当前观测、instruction 和 policy 输出 action chunk 写入 context;未来 observation/progress token 被 mask,再以 16-step iterative parallel decoding 生成。下一帧的生成图像加入 sparse memory,policy 再根据生成观测提出下一 action,形成闭环 imagined rollout。

【Paper】 完整 trajectory 在单张 H800 上需约 30–90 秒(约 1.5 秒/帧)。所以“scalable”是相对真实机器人反复执行,而非实时模拟器;计算预算仍限制可评估的策略数、seed 数与 rollout 长度。

Algorithm 2 闭环 imagined rollout 与策略评估
输入:
候选 policy π\pi、初始观测 o0o_0、任务 ll、world model Wθ\mathcal W_\theta、horizon TT
输出:
imagined trajectory 与 success estimate
  1. 初始化 o^0=o0\hat o_0=o_0 和空的 sparse memory
  2. for t=0,Δ,,TΔt=0,\Delta,\ldots,T-\Delta
  3. π(o^t,l)\pi(\hat o_t,l) 产生 action chunk at\mathbf a_t
  4. MDD 以 16 次并行去噪生成 (o^t+Δ,v^t+Δ)(\hat o_{t+\Delta},\hat v_{t+\Delta})
  5. 按 stride 更新 KK 个低分辨率 keyframe,记录生成状态与进度
  6. end for
  7. 终点 v^T=1\hat v_T=1 即成功;多个初始条件取平均得到 imagined success rate

4.6 代码实现对照#

【Code】 截至 2026-08-26,论文 arXiv 页面、PDF、项目主页与 GitHub 公开搜索均未提供 dWorldEval 的官方模型仓库。搜索到的 dworldeval/dworldeval.github.io 是项目网站仓库,不能用于核对 model definition、DataLoader、mask schedule、checkpoint 或实际 inference loop。

【Paper】 可确认的实现级信息仅来自论文:MMaDAVLA-8B 初始化、32-layer / 32-head / 4096-dim Transformer、K=4K=4 memory、[2,8][2,8] chunk-aligned horizon、visual/progress 权重 1/21/2、16-step decoding、AdamW 与 8×H800 训练。它们不等同于可复现实装。

5. 实验#

5.1 Experimental Setup#

真实 AgileX 双臂平台与生成 rollout 可视化(论文 Figure 2)

【Paper】 评测横跨三种 domain:

Domain数据与硬件主要评测
LIBERO四个 suite,同步第三人称与 wrist viewπ0\pi_0 checkpoints、failure-aware controllability
RoboTwinARX 双臂、10 个 tableware/contact-rich tasksπ0\pi_0、DexVLA、Diffusion Policy 等异构 policy 排序
Real world双 6-DoF AgileX、3 路 RealSense 457 viewBussing Table、Place Cup、Handover Block 等五任务

【Paper】 模型生成 2562256^2 多视角画面,Δ\Delta 与 action chunk length 对齐并从 [2,8][2,8] 中选取。模拟 benchmark 每任务运行 20 episodes,真实 benchmark 每任务 30 episodes。比较的 video diffusion baseline 为 WorldEval、WorldGym、Ctrl-World,训练切分保持一致。

5.2 Main Results#

dWorldEval 对 suboptimal action 的可控生成,以及无 memory 时的长时域漂移(论文 Figure 3)

【Paper】 LIBERO 上,dWorldEval 的 LPIPS 为 0.215Δ\DeltaLPIPS 在 expert/failure 子集为 0.315 / 0.352。WorldEval 为 0.262 / 0.423 / 0.701,WorldGym 为 0.218 / 0.347 / 0.650,Ctrl-World 为 0.220 / 0.334 / 0.416。failure 集的优势是论文的关键证据:一个 evaluator 必须正确生成失败,而不是把它视觉上补成成功。

【Paper】 在 policy evaluation,论文报告 real-vs-imagined Pearson correlation:LIBERO multi-view 0.910、RoboTwin 0.927、真实任务 0.918。单视角 LIBERO 的 dWorldEval rank violation 为 MMRV=0.013,基线最高到 0.039。这些数字只描述论文使用的 policy 集、数据与平台,不能外推为任意策略分布都具有 r0.9r\approx0.9

真实成功率与 world-model 估计成功率的相关性,以及无记忆消融(论文 Figure 5)

【Paper】 作者还比较多个 π0\pi_0 checkpoint,发现终点 progress token 的 Auto estimate 与人工基于生成图像的判断都接近真实执行曲线,并能追随个别 checkpoint 的非单调波动。这支持“共同生成的 score 可作 intrinsic metric”,但不是对任意任务 VLM progress 标签皆正确的证明。

联合生成未来观测与 progress token,并自动评估多组 policy checkpoint(论文 Figure 4)

5.3 Ablation Study#

【Paper】 memory round-trip ablation 先执行 HH 段 forward action,再执行 inverse action,比较最终与初始图像。H=5,10,15,20H=5,10,15,20 时,无 memory 的 LPIPS 为 0.177, 0.186, 0.302, 0.411,完整模型为 0.130, 0.145, 0.193, 0.243。正文出现的 0.21 与表格 H=20H=200.243 不完全一致,本文采用表格数字。

【Paper】 action-shuffle sanity check 随机替换 batch 内 future action chunk、保持历史和语言不变:对齐 action 的 LPIPS / Δ\DeltaLPIPS 为 0.215 / 0.324,shuffle 后为 0.461 / 0.697。逐步增加 inference-time swap probability 时,论文还观察到 Δ\DeltaLPIPS 上升而真实成功率相关性下降。该实验支持模型依赖 action,但“敏感”本身不等于在所有反事实条件下都因果正确。

5.4 Generalization#

【Paper】 论文的跨 domain fidelity 中,Δ\DeltaLPIPS 分别为:LIBERO third-person/wrist 0.324 / 0.303,RoboTwin top-down/wrist 0.317 / 0.345,真实平台 top-down/wrist 0.365 / 0.336。作者据此认为统一 tokenization 在不同 camera configuration 与 robot morphology 下保持相近质量。

【Analysis】 这里“泛化”主要是对不同 policy architecture、相机和三个训练过各自数据的 domain 的 evaluator fidelity;它不是完全未见 embodiment / task 的零样本迁移。更严格的 cross-embodiment holdout 尚未提供。

6. 方法分析#

6.1 为什么有效?#

【Analysis】 action 进入主 token sequence,缩小了模型靠当前画面与强成功先验绕过控制输入的空间。其次,低频 keyframe 将早期场景几何重新送回每一步 context,减少 rollout 中的累积误差。最后,score 与图像在同一生成目标中出现,外置 reward/classifier 的接口错配更少。

6.2 核心创新#

【Analysis】 真正的组合创新是面向 evaluation reliability 的三件事:token-level action control、稀疏的 long-horizon grounding、以及 generative success signal。Δ\DeltaLPIPS 则将“动作是否造成正确变化”从静态外观比较中单独抽出;不过 image-space metric 仍看不到抓取力、接触状态和遮挡后的物理量。

6.3 与已有方法的本质区别#

维度常见 video-conditioned evaluatordWorldEval
Action 位置cross-attention / modulation 等条件与视觉、文本共同位于主序列
长时上下文短窗口或隐式状态显式 K=4K=4 keyframe memory + time ID
成功判定人工、外部 oracle 或独立 classifier与未来视觉共同生成的 progress token
控制诊断静态 LPIPS 等状态差分 Δ\DeltaLPIPS

【Analysis】 统一 token 并不等于统一物理模型:它提升视觉 token 与 action token 交互的机会,却不能自动保证未见接触和 OOD action 的真实物理正确性。

6.4 关键假设#

【Analysis】 方法假定 action、观察和 future state 时间对齐;离散 tokenizer 未丢失关键控制信息;训练含有足够 failure/suboptimal coverage;VLM progress label 与人类成功定义一致;低分辨率单全局视角 history 足够锚定多视角接触场景;imagined rollout 不会迅速偏离真实 policy 的状态分布。

7. 局限性#

7.1 作者明确提出的局限#

【Paper】 作者将 OOD action 下的 controllability 与长时域物理/时空一致性视为现有 scalable evaluation 的关键难题,并针对其提出改善;论文没有单列 limitations 段,也没有宣称已解决所有 OOD action 或真实物理问题。

【Paper】 一条完整 rollout 在单张 H800 上约需 30–90 秒,说明它仍是计算密集的生成 proxy。且每个 domain 都使用对应训练轨迹,其可靠性需要与平台、相机和任务分布一起解释。

7.2 自己分析得到的局限#

【Analysis】 首先,VLM 伪标签错误会被 progress token 内化;生成 score 与生成图像彼此一致,不表示两者都与真实完成度一致。其次,memory 不能在没有真实传感器时纠正第一步生成错误,闭环误差仍会复合。再次,30–90 秒/trajectory 会限制大规模 seed、候选 policy 和长 horizon 筛选。最后,尚无官方代码、config、checkpoint,且分辨率描述局部不一致,独立复现困难。

8. 启发与研究思考#

【Analysis】 这篇工作提示未来的 evaluator 不应只追求未来帧好看,而应输出能检验的 task state、constraint violation 或 uncertainty。Δ\DeltaLPIPS 与 action shuffle 是很好的起点,但还可用反事实 action pair、接触传感器、simulator intervention 测试真正的 action causality。

【Analysis】 更实用的部署方式可能是把 dWorldEval 作为主动筛选器:对模型低置信度、候选策略排名接近、或长 rollout 的 case 请求真实执行,其余交给 imagined rollout。世界模型不必逐像素完美,却必须在候选 policy 的相对排序上不系统性偏向成功先验;更广的 holdout embodiment、真实干预和公开复现,是检验这一点的下一步。

dWorldEval 论文精读:用离散扩散世界模型规模化评估机器人策略
https://agusexp25.top/blog/paper-deep-dive-dworldeval
Author 菊花花
Published at August 26, 2026