

DUST 论文精读:双流扩散增强 World-Model VLA
精读 DUST:用双流 MMDiT、解耦噪声与异步采样,把未来视觉状态建模融入 VLA,并在仿真、真实机器人和跨 embodiment 数据上验证。
DUST 用双流 MMDiT 保持动作与未来视觉 token 的模态特性,再以独立噪声和异步采样学习双向因果关系;4 步采样约 40Hz,在 RoboCasa、GR-1 和 Franka Research 3 上均超过强基线。
1. 论文概述#
论文名称:《Dual-Stream Diffusion for World-Model Augmented Vision-Language-Action Model》
作者:John Won、Kyungmin Lee、Huiwon Jang、Dongyoung Kim、Jinwoo Shin(KAIST、RLWRLD)
会议 / 期刊:ICML 2026 
论文链接:arXiv:2510.27607 ↗
项目主页:periphanes.github.io/dust ↗
代码:项目页截至本文撰写时标注为 “Code (Coming Soon)”,因此没有可核对的官方实现。

一句话总结#
【Paper】 现有 world-model augmented VLA 要么把动作和视觉强行放进同一扩散流,要么只允许单向条件依赖。DUST(DUal-STream diffusion)保留两条独立 token 流,只在共享 attention 中交换信息,并为两种模态使用独立噪声和不同采样频率。
核心贡献#
【Paper】
- 用 multimodal diffusion transformer(MMDiT)构造 action stream 与 future-vision stream 的双流架构:共享跨模态注意力,其他层保持模态专属路径。
- 提出 decoupled diffusion training:动作和未来图像 embedding 分别采样噪声时间步,以一个解耦 flow-matching loss 联合优化。
- 提出 asynchronous joint sampling:视觉 token 可比动作 token 使用更多 Euler 步数,形成可调节的 test-time scaling。
- 在 RoboCasa、GR-1 和 Franka Research 3 上评测,并验证 action-free video 预训练与 robot-human 混合数据联合训练的迁移能力。
2. 背景与相关工作#
【Paper】 标准 VLA 通过冻结或大规模预训练的 VLM 提供视觉—语言语义,再由 diffusion policy 预测动作;它擅长指令跟随,却没有显式表示“动作将如何改变场景”。world-model augmented VLA 试图同时预测动作和未来观测,使策略学习潜在动力学。
两条已有路线各有代价:
- Unified joint diffusion:把 action token 与视觉 token 拼接后统一去噪。动作是低维、时间平滑的轨迹,视觉 embedding 却高维且有空间结构,单一统计空间会造成 modality gap。
- Causal diffusion:为动作和世界模型使用独立网络,并用预测的未来状态单向条件动作。模态专长更清晰,但信息不能反向流动,难以同时利用 inverse dynamics 与 forward dynamics。
【Analysis】 DUST 的定位不是增加一个额外预测头,而是把“共享知识”和“模态特异性”放在同一 Transformer 的不同路径中:共享 attention 负责对齐,独立 AdaLN、DiT block 负责保留各自的噪声和输出几何。

3. 问题定义#
【Paper】 每条示教轨迹包含任务指令 和序列 。观测 由视觉观测与机器人 proprioceptive state 组成,动作按 chunk 分组:
模型在当前视觉、指令和状态条件下预测动作 chunk,同时预测执行该 chunk 后的未来视觉 embedding:
【Paper】 DUST 不直接重建 RGB。未来目标 来自 VLM 的视觉编码器;实验中每张图先得到 256 个 SigLIP-2 token,再经 average pooling 压到 64 个 token。扩散模块最终处理 1 个 state token、16 个 action token 和 64 个 future-vision token。
4. 方法#
4.1 Overall Architecture#

【Paper】 冻结的 Eagle-2 VLM 从当前图像和指令提取语义特征 ,扩散模型接收 。每个 MMDiT block 将两条流仅在 cross-modal attention 处拼接,之后重新拆开;末端的 modality-specific DiT block 分别完成视觉语义重建和动作精修。
4.2 核心模块#
| 模块 | 输入 | 输出 | 作用 |
|---|---|---|---|
| Frozen VLM(Eagle-2) | 当前 RGB、任务指令 | 提供高层语义条件;论文使用第 12 层特征 | |
| Action stream | 状态 token、16 个加噪动作 token | 学习低维、时序平滑的控制轨迹 | |
| Vision stream | 64 个加噪未来图像 embedding token | 预测动作执行后的语义场景状态 | |
| Shared MMDiT | 两条 token 流 | 更新后的两流表示 | 在 cross-modal attention 中交换信息 |
| AdaLN | 各自的 | 模态条件 | 让两条流感知不同噪声等级 |
| Modality-specific DiT | 各自的共享层输出 | 动作/视觉速度场 | 最后阶段恢复模态专属建模能力 |
【Paper】 扩散主干由 12 个 MMDiT blocks 和每个模态 4 个 DiT blocks 组成;VLM 特征以交错 self-attention / cross-attention 方式注入。
【Analysis】 视觉流并非为了生成可直接观看的 RGB,而是作为动作生成的“可预测后果”表示;这解释了为什么语义 embedding 比像素 latent 更适合控制。
4.3 关键公式#
独立采样 和高斯噪声 :
其中 对应纯噪声, 对应干净目标。网络预测速度场 ,分别用:
联合目标是:
【Paper】 主实验取 ,即动作和 world-modeling 等权。独立噪声使模型看到“干净未来 + 全噪声动作”(偏 inverse dynamics)以及“干净动作 + 噪声未来”(偏 forward dynamics)等组合,从而学习双向因果关系。
4.4 Training#
【Paper】 训练时冻结 Eagle-2 VLM,只从数据中取当前状态、动作 chunk 和执行后的未来图像 embedding;扩散主干随机初始化。RoboCasa 使用每任务 100/300/1000 demos,GR-1 使用 300/1000 demos,Franka Research 3 的 7 个真实任务各收集 60 条 teleoperation 示教。
- 用冻结 VLM 编码当前观测与指令,得到 ,并编码未来观测得到 。
- 独立采样 ,构造 与 。
- 将 state、action 和 vision token 送入双流 MMDiT,得到两个速度场。
- 计算 ,反向传播更新扩散模块。
4.5 Inference#
【Paper】 推理从 和 开始。动作使用 步,视觉使用 步;视觉每个细粒度步都更新,动作每 步更新一次:

- 初始化动作和视觉高斯噪声,计算冻结 VLM 条件 。
- 对 个全局小步,每步更新 vision stream。
- 当步数满足 的间隔时,用更大步长更新 action stream。
- 执行最终动作 chunk;根据延迟预算选择 ,在速度和精度之间折中。
【Analysis】 主实验使用 ,因此与基线公平; 是可选的“精度旋钮”,不是必须的在线控制步骤。
4.6 代码实现对照#
【Code】 官方项目页显示 Code 为 “Coming Soon”,论文也没有给出可下载的 DUST 仓库、配置或 checkpoint。因此本文不能对模型定义、DataLoader、优化器和推理脚本做逐文件核对。论文只说明实现基于 GR00T-N1.5 codebase,并重新实现了没有官方代码的 FLARE baseline;这些信息属于论文附录,而非可运行的 DUST 官方实现。
5. 实验#
5.1 Experimental Setup#

【Paper】
- RoboCasa:24 个单臂厨房任务,覆盖 8 个 pick-and-place、6 个开关门/旋钮 contraption、10 个其他任务。
- GR-1:24 个 humanoid tabletop 任务,含 18 个 pick-and-place 和 6 个 articulated 任务。
- Real world:Franka Research 3,7-DoF,状态和动作由关节位置与二值夹爪组成;7 个任务各 60 条 teleoperation demos。
- 对比方法:GR00T-N1.5、重实现的 FLARE、(pi_0)、(pi_0)-FAST,以及在部分数据规模下的 PAD/VPP。
5.2 Main Results#
【Paper】 关键平均成功率如下(单位:%):
| Benchmark / 数据量 | GR00T-N1.5 | + FLARE | + DUST | DUST 增益 |
|---|---|---|---|---|
| RoboCasa / 100 demos | 41.7 | 44.6 | 50.1 | +8.4 vs GR00T |
| RoboCasa / 300 demos | 45.0 | 55.3 | 58.5 | +13.5 vs GR00T |
| RoboCasa / 1000 demos | 50.8 | 64.6 | 66.3 | +15.5 vs GR00T |
| GR-1 / 300 demos | 20.3 | 33.7 | 36.0 | +15.7 vs GR00T |
| GR-1 / 1000 demos | 30.8 | 36.3 | 42.0 | +11.2 vs GR00T |
| Franka Research 3 / 7 tasks | 46.5 | 49.5 | 59.9 | +13.4 vs GR00T |
【Paper】 RoboCasa 100 demos 下 DUST 的 50.1% 平均成功率超过 FLARE 5.5 个百分点;真实机器人平均 59.9%,比 GR00T-N1.5 高 13.4 个百分点、比 FLARE 高 10.4 个百分点。4 步去噪约 40Hz,32 步仍约 8Hz。
5.3 Ablation Study#
【Paper】 在 RoboCasa 100 demos/task 上:
| 配置 | 平均成功率 |
|---|---|
| DiT + joint noise | 38.0 |
| DiT + decoupled noise | 42.5 |
| MMDiT + joint noise | 38.2 |
| MMDiT + decoupled noise(DUST) | 50.1 |
去掉双流结构下降约 8 个百分点,去掉 decoupled noise 下降约 12 个百分点,说明两者互补。MMDiT 深度在 12 层时最好(50.1%); 在 0.5–2.0 区间较稳定,偏离到 0.2 时降至 34.3%。SigLIP-2、DINOv2、Flux.1 VAE 三种目标的平均成功率分别为 50.1%、51.6%、49.1%,像素重建能力更强的 VAE 并未带来更好的控制。
5.4 Generalization#
【Paper】
- 异构联合训练:在 RoboCasa 300 demos 基础上加入 GR-1 300 demos 和 46k episodes 的 EgoDex(MANO hand pose retarget 到 Fourier hands),DUST 平均成功率从 58.5% 提升到 64.4%;GR00T-N1.5 从 45.0% 到 46.9%,FLARE 从 55.3% 到 57.6%。
- action-free video 预训练:先用 BridgeV2 仅优化 world-modeling loss,再用 RoboCasa 100 demos 微调,DUST 从 50.1% 提升到 58.5%。
- test-time scaling:固定动作 4 步,把视觉步数 (N_o) 提到 16/32/64;RoboCasa 1000 demos 的平均成功率从 66.3% 升到 69.7%,GR-1 1000 demos 在 32 步达到 47.1%,相对 4 步高 5.1 个百分点,但并非单调增加。
6. 方法分析#
6.1 为什么有效?#
【Analysis】 DUST 的收益可以拆成三个机制:
- 未来视觉 embedding 给动作流一个“结果空间”监督,迫使策略表示动作—状态转移,而不是只拟合当前帧到关节轨迹的相关性。
- 双流让视觉的高维空间结构和动作的低维时序结构分别处理,同时通过共享 attention 传递互相需要的信息。
- 独立噪声把 forward dynamics 和 inverse dynamics 训练样本混在同一个目标中;异步采样又把额外算力集中到更需要迭代的视觉流。
6.2 核心创新#
【Paper】 真正的新意是“解耦但可通信”:不是简单地把两个 head 并列,也不是把所有 token 直接拼接,而是在 attention 层共享、在噪声条件和末端去噪层分离。【Analysis】 这使架构设计、训练分布和推理算力分配三者保持一致。
6.3 与已有方法的本质区别#
| 方法 | 模态结构 | 信息流 | 噪声/采样 |
|---|---|---|---|
| Joint diffusion | 单流 | 双向但模态混杂 | 通常同步 |
| Causal diffusion / FLARE | 多模型 | 单向条件 | 模态专属但耦合较弱 |
| DUST | 双流 MMDiT | attention 双向交换 | 训练独立噪声,推理异步步长 |
6.4 关键假设#
【Analysis】 DUST 依赖几个未被完全消除的假设:
- VLM 的语义 embedding 足以表达控制相关的未来状态,且不需要像素级细节。
- 当前 Eagle-2 特征和 SigLIP-2 目标之间存在稳定的可学习对应关系。
- 一个固定的未来时刻 (t+k) 足以提供有用的动力学信号;更长时域的误差传播没有被单独建模。
- 不同机器人和人手数据经过 retarget 后,可以在共享视觉世界模型中对齐。
7. 局限性#
7.1 作者明确提出的局限#
【Paper】 论文指出异步采样的收益存在非单调性:确定性 Euler/ODE 采样虽然减少截断误差,却可能累积梯度近似误差;因此 (N_o=64) 并不总是优于 32。额外视觉步数也会增加延迟,不能无条件用于高频闭环控制。
7.2 自己分析得到的局限#
【Analysis】
- 官方代码和 checkpoint 尚未公开,社区无法复现实验,也无法确认论文中“基于 GR00T codebase”的具体工程改动。
- 未来视觉 embedding 是单个 horizon 的目标,可能遗漏接触瞬间、遮挡和多步不确定性;论文没有报告更长 horizon 或多模态未来分布的系统实验。
- 所有主实验冻结 VLM,DUST 的收益与“更强的联合视觉—语言—动作预训练”之间的关系尚未被隔离。
- 真实实验使用同一 Franka embodiment 的示教和测试;跨硬件零样本迁移仍主要由异构训练实验间接支持。
8. 启发与研究思考#
【Analysis】 DUST 给后续 VLA 研究留下三条可操作的路线:
- 把世界模型当作训练时的结构化正则:不一定要在部署时生成可视化视频,只要预测一个与控制相关的 latent state,就可能获得更好的数据效率。
- 按模态分配 test-time compute:动作、深度、触觉和视觉 token 的最优采样步数不同,统一的 diffusion step budget 并不合理;异步采样可推广到多传感器策略。
- 先学世界、再学动作:action-free video 预训练的 8.4 个百分点增益说明,廉价视频可以先提供场景变化先验,再用少量机器人示教学习 embodiment-specific action decoder。
一个值得继续验证的问题是:如果将未来目标从单一 SigLIP-2 embedding 扩展为“object-centric state + contact event + uncertainty”,双流策略是否能在插入、擦拭等接触丰富任务上继续提升?这会把 DUST 从 latent prediction head 推向真正的可查询 world model。