Hana's Blog
DUST 论文精读:双流扩散增强 World-Model VLABlur image
Arxiv ID 2510.27607
幻觉翻译 2510.27607
publication pending

DUST 用双流 MMDiT 保持动作与未来视觉 token 的模态特性,再以独立噪声和异步采样学习双向因果关系;4 步采样约 40Hz,在 RoboCasa、GR-1 和 Franka Research 3 上均超过强基线。

推荐指数:

1. 论文概述#

论文名称:《Dual-Stream Diffusion for World-Model Augmented Vision-Language-Action Model》
作者:John Won、Kyungmin Lee、Huiwon Jang、Dongyoung Kim、Jinwoo Shin(KAIST、RLWRLD)
会议 / 期刊:ICML 2026 
论文链接arXiv:2510.27607
项目主页periphanes.github.io/dust
代码:项目页截至本文撰写时标注为 “Code (Coming Soon)”,因此没有可核对的官方实现。

统一联合扩散、因果扩散与 DUST 双流扩散的对比(论文 Figure 1)

一句话总结#

【Paper】 现有 world-model augmented VLA 要么把动作和视觉强行放进同一扩散流,要么只允许单向条件依赖。DUST(DUal-STream diffusion)保留两条独立 token 流,只在共享 attention 中交换信息,并为两种模态使用独立噪声和不同采样频率。

核心贡献#

【Paper】

  1. 用 multimodal diffusion transformer(MMDiT)构造 action stream 与 future-vision stream 的双流架构:共享跨模态注意力,其他层保持模态专属路径。
  2. 提出 decoupled diffusion training:动作和未来图像 embedding 分别采样噪声时间步,以一个解耦 flow-matching loss 联合优化。
  3. 提出 asynchronous joint sampling:视觉 token 可比动作 token 使用更多 Euler 步数,形成可调节的 test-time scaling。
  4. 在 RoboCasa、GR-1 和 Franka Research 3 上评测,并验证 action-free video 预训练与 robot-human 混合数据联合训练的迁移能力。

2. 背景与相关工作#

【Paper】 标准 VLA 通过冻结或大规模预训练的 VLM 提供视觉—语言语义,再由 diffusion policy 预测动作;它擅长指令跟随,却没有显式表示“动作将如何改变场景”。world-model augmented VLA 试图同时预测动作和未来观测,使策略学习潜在动力学。

两条已有路线各有代价:

  • Unified joint diffusion:把 action token 与视觉 token 拼接后统一去噪。动作是低维、时间平滑的轨迹,视觉 embedding 却高维且有空间结构,单一统计空间会造成 modality gap。
  • Causal diffusion:为动作和世界模型使用独立网络,并用预测的未来状态单向条件动作。模态专长更清晰,但信息不能反向流动,难以同时利用 inverse dynamics 与 forward dynamics。

【Analysis】 DUST 的定位不是增加一个额外预测头,而是把“共享知识”和“模态特异性”放在同一 Transformer 的不同路径中:共享 attention 负责对齐,独立 AdaLN、DiT block 负责保留各自的噪声和输出几何。

三种 world-model augmented VLA 结构(论文 Figure 1,因模态拆分分别裁切)

3. 问题定义#

【Paper】 每条示教轨迹包含任务指令 II 和序列 {(Ot,At)}t=0L\{(O_t,A_t)\}_{t=0}^{L}。观测 Ot=(otv,ots)O_t=(o_t^v,o_t^s) 由视觉观测与机器人 proprioceptive state 组成,动作按 chunk 分组:

At=(at,,at+k1)A_t=(a_t,\ldots,a_{t+k-1})

模型在当前视觉、指令和状态条件下预测动作 chunk,同时预测执行该 chunk 后的未来视觉 embedding:

πθ(At,o~t+kotv,ots,I).\pi_\theta(A_t,\tilde o_{t+k}\mid o_t^v,o_t^s,I).

【Paper】 DUST 不直接重建 RGB。未来目标 o~t+k\tilde o_{t+k} 来自 VLM 的视觉编码器;实验中每张图先得到 256 个 SigLIP-2 token,再经 2×22\times2 average pooling 压到 64 个 token。扩散模块最终处理 1 个 state token、16 个 action token 和 64 个 future-vision token。

4. 方法#

4.1 Overall Architecture#

DUST 双流 MMDiT 架构:冻结 VLM 条件、共享 attention 与模态专属 DiT(论文 Figure 2)

【Paper】 冻结的 Eagle-2 VLM 从当前图像和指令提取语义特征 Φt\Phi_t,扩散模型接收 (ots,AtτA,o~t+kτo)(o_t^s,A_t^{\tau_A},\tilde o_{t+k}^{\tau_o})。每个 MMDiT block 将两条流仅在 cross-modal attention 处拼接,之后重新拆开;末端的 modality-specific DiT block 分别完成视觉语义重建和动作精修。

4.2 核心模块#

模块输入输出作用
Frozen VLM(Eagle-2)当前 RGB、任务指令Φt\Phi_t提供高层语义条件;论文使用第 12 层特征
Action stream状态 token、16 个加噪动作 tokenVθAV_\theta^A学习低维、时序平滑的控制轨迹
Vision stream64 个加噪未来图像 embedding tokenVθoV_\theta^o预测动作执行后的语义场景状态
Shared MMDiT两条 token 流更新后的两流表示在 cross-modal attention 中交换信息
AdaLN各自的 (τA,τo)(\tau_A,\tau_o)模态条件让两条流感知不同噪声等级
Modality-specific DiT各自的共享层输出动作/视觉速度场最后阶段恢复模态专属建模能力

【Paper】 扩散主干由 12 个 MMDiT blocks 和每个模态 4 个 DiT blocks 组成;VLM 特征以交错 self-attention / cross-attention 方式注入。
【Analysis】 视觉流并非为了生成可直接观看的 RGB,而是作为动作生成的“可预测后果”表示;这解释了为什么语义 embedding 比像素 latent 更适合控制。

4.3 关键公式#

独立采样 (τA,τo[0,1])(\tau_A,\tau_o\in[0,1]) 和高斯噪声 (ϵA,ϵo)(\epsilon_A,\epsilon_o)

AtτA=τAAt+(1τA)ϵA,o~t+kτo=τoo~t+k+(1τo)ϵo.A_t^{\tau_A}=\tau_A A_t+(1-\tau_A)\epsilon_A, \qquad \tilde o_{t+k}^{\tau_o}=\tau_o\tilde o_{t+k}+(1-\tau_o)\epsilon_o.

其中 τ=0\tau=0 对应纯噪声,τ=1\tau=1 对应干净目标。网络预测速度场 Vθ=[VθA,Vθo]V_\theta=[V_\theta^A,V_\theta^o],分别用:

LA=E[VθA(AtϵA)2],\mathcal L_A=\mathbb E\left[\left\|V_\theta^A-(A_t-\epsilon_A)\right\|^2\right], LWM=E[Vθo(o~t+kϵo)2].\mathcal L_{WM}=\mathbb E\left[\left\|V_\theta^o-(\tilde o_{t+k}-\epsilon_o)\right\|^2\right].

联合目标是:

LJoint=LA+λWMLWM.\mathcal L_{Joint}=\mathcal L_A+\lambda_{WM}\mathcal L_{WM}.

【Paper】 主实验取 λWM=1.0\lambda_{WM}=1.0,即动作和 world-modeling 等权。独立噪声使模型看到“干净未来 + 全噪声动作”(偏 inverse dynamics)以及“干净动作 + 噪声未来”(偏 forward dynamics)等组合,从而学习双向因果关系。

4.4 Training#

【Paper】 训练时冻结 Eagle-2 VLM,只从数据中取当前状态、动作 chunk 和执行后的未来图像 embedding;扩散主干随机初始化。RoboCasa 使用每任务 100/300/1000 demos,GR-1 使用 300/1000 demos,Franka Research 3 的 7 个真实任务各收集 60 条 teleoperation 示教。

Algorithm 1 Decoupled joint diffusion training
输入:
示教批次 (I,otv,ots,At,ot+kv)(I,o_t^v,o_t^s,A_t,o_{t+k}^v)
输出:
训练后的 DUST diffusion policy
  1. 用冻结 VLM 编码当前观测与指令,得到 Φt\Phi_t,并编码未来观测得到 o~t+k\tilde o_{t+k}
  2. 独立采样 (τA,τo,ϵA,ϵo)(\tau_A,\tau_o,\epsilon_A,\epsilon_o),构造 AtτAA_t^{\tau_A}o~t+kτo\tilde o_{t+k}^{\tau_o}
  3. 将 state、action 和 vision token 送入双流 MMDiT,得到两个速度场。
  4. 计算 LA+λWMLWM\mathcal L_A+\lambda_{WM}\mathcal L_{WM},反向传播更新扩散模块。

4.5 Inference#

【Paper】 推理从 At0N(0,IA)A_t^0\sim\mathcal N(0,I_A)o~t+k0N(0,Iv)\tilde o_{t+k}^0\sim\mathcal N(0,I_v) 开始。动作使用 NAN_A 步,视觉使用 No=qNAN_o=qN_A 步;视觉每个细粒度步都更新,动作每 qq 步更新一次:

o~τo+Δτo=o~τo+VθoΔτo,\tilde o^{\tau_o+\Delta\tau_o}=\tilde o^{\tau_o}+V_\theta^o\Delta\tau_o, AτA+ΔτA=AτA+VθAΔτA(每 q 个视觉步执行一次).A^{\tau_A+\Delta\tau_A}=A^{\tau_A}+V_\theta^A\Delta\tau_A \quad\text{(每 $q$ 个视觉步执行一次)}.

异步 vision-action joint sampling:视觉步数可多于动作步数(论文 Figure 3)

Algorithm 2 Asynchronous vision-action sampling
输入:
当前图像、指令、状态,动作步数 NAN_A,视觉倍率 qq
输出:
动作 chunk AtA_t 与未来视觉 embedding 预测
  1. 初始化动作和视觉高斯噪声,计算冻结 VLM 条件 Φt\Phi_t
  2. No=qNAN_o=qN_A 个全局小步,每步更新 vision stream。
  3. 当步数满足 qq 的间隔时,用更大步长更新 action stream。
  4. 执行最终动作 chunk;根据延迟预算选择 qq,在速度和精度之间折中。

【Analysis】 主实验使用 q=1,NA=No=4q=1,N_A=N_o=4,因此与基线公平;q>1q>1 是可选的“精度旋钮”,不是必须的在线控制步骤。

4.6 代码实现对照#

【Code】 官方项目页显示 Code 为 “Coming Soon”,论文也没有给出可下载的 DUST 仓库、配置或 checkpoint。因此本文不能对模型定义、DataLoader、优化器和推理脚本做逐文件核对。论文只说明实现基于 GR00T-N1.5 codebase,并重新实现了没有官方代码的 FLARE baseline;这些信息属于论文附录,而非可运行的 DUST 官方实现。

5. 实验#

5.1 Experimental Setup#

Franka Research 3 真实任务:4 个 pick-and-place、1 个 insertion、2 个 tool-use(论文 Figure 4)

【Paper】

  • RoboCasa:24 个单臂厨房任务,覆盖 8 个 pick-and-place、6 个开关门/旋钮 contraption、10 个其他任务。
  • GR-1:24 个 humanoid tabletop 任务,含 18 个 pick-and-place 和 6 个 articulated 任务。
  • Real world:Franka Research 3,7-DoF,状态和动作由关节位置与二值夹爪组成;7 个任务各 60 条 teleoperation demos。
  • 对比方法:GR00T-N1.5、重实现的 FLARE、(pi_0)、(pi_0)-FAST,以及在部分数据规模下的 PAD/VPP。

5.2 Main Results#

【Paper】 关键平均成功率如下(单位:%):

Benchmark / 数据量GR00T-N1.5+ FLARE+ DUSTDUST 增益
RoboCasa / 100 demos41.744.650.1+8.4 vs GR00T
RoboCasa / 300 demos45.055.358.5+13.5 vs GR00T
RoboCasa / 1000 demos50.864.666.3+15.5 vs GR00T
GR-1 / 300 demos20.333.736.0+15.7 vs GR00T
GR-1 / 1000 demos30.836.342.0+11.2 vs GR00T
Franka Research 3 / 7 tasks46.549.559.9+13.4 vs GR00T

【Paper】 RoboCasa 100 demos 下 DUST 的 50.1% 平均成功率超过 FLARE 5.5 个百分点;真实机器人平均 59.9%,比 GR00T-N1.5 高 13.4 个百分点、比 FLARE 高 10.4 个百分点。4 步去噪约 40Hz,32 步仍约 8Hz。

5.3 Ablation Study#

【Paper】 在 RoboCasa 100 demos/task 上:

配置平均成功率
DiT + joint noise38.0
DiT + decoupled noise42.5
MMDiT + joint noise38.2
MMDiT + decoupled noise(DUST)50.1

去掉双流结构下降约 8 个百分点,去掉 decoupled noise 下降约 12 个百分点,说明两者互补。MMDiT 深度在 12 层时最好(50.1%);λWM\lambda_{WM} 在 0.5–2.0 区间较稳定,偏离到 0.2 时降至 34.3%。SigLIP-2、DINOv2、Flux.1 VAE 三种目标的平均成功率分别为 50.1%、51.6%、49.1%,像素重建能力更强的 VAE 并未带来更好的控制。

5.4 Generalization#

【Paper】

  • 异构联合训练:在 RoboCasa 300 demos 基础上加入 GR-1 300 demos 和 46k episodes 的 EgoDex(MANO hand pose retarget 到 Fourier hands),DUST 平均成功率从 58.5% 提升到 64.4%;GR00T-N1.5 从 45.0% 到 46.9%,FLARE 从 55.3% 到 57.6%。
  • action-free video 预训练:先用 BridgeV2 仅优化 world-modeling loss,再用 RoboCasa 100 demos 微调,DUST 从 50.1% 提升到 58.5%。
  • test-time scaling:固定动作 4 步,把视觉步数 (N_o) 提到 16/32/64;RoboCasa 1000 demos 的平均成功率从 66.3% 升到 69.7%,GR-1 1000 demos 在 32 步达到 47.1%,相对 4 步高 5.1 个百分点,但并非单调增加。

6. 方法分析#

6.1 为什么有效?#

【Analysis】 DUST 的收益可以拆成三个机制:

  1. 未来视觉 embedding 给动作流一个“结果空间”监督,迫使策略表示动作—状态转移,而不是只拟合当前帧到关节轨迹的相关性。
  2. 双流让视觉的高维空间结构和动作的低维时序结构分别处理,同时通过共享 attention 传递互相需要的信息。
  3. 独立噪声把 forward dynamics 和 inverse dynamics 训练样本混在同一个目标中;异步采样又把额外算力集中到更需要迭代的视觉流。

6.2 核心创新#

【Paper】 真正的新意是“解耦但可通信”:不是简单地把两个 head 并列,也不是把所有 token 直接拼接,而是在 attention 层共享、在噪声条件和末端去噪层分离。【Analysis】 这使架构设计、训练分布和推理算力分配三者保持一致。

6.3 与已有方法的本质区别#

方法模态结构信息流噪声/采样
Joint diffusion单流双向但模态混杂通常同步
Causal diffusion / FLARE多模型单向条件模态专属但耦合较弱
DUST双流 MMDiTattention 双向交换训练独立噪声,推理异步步长

6.4 关键假设#

【Analysis】 DUST 依赖几个未被完全消除的假设:

  • VLM 的语义 embedding 足以表达控制相关的未来状态,且不需要像素级细节。
  • 当前 Eagle-2 特征和 SigLIP-2 目标之间存在稳定的可学习对应关系。
  • 一个固定的未来时刻 (t+k) 足以提供有用的动力学信号;更长时域的误差传播没有被单独建模。
  • 不同机器人和人手数据经过 retarget 后,可以在共享视觉世界模型中对齐。

7. 局限性#

7.1 作者明确提出的局限#

【Paper】 论文指出异步采样的收益存在非单调性:确定性 Euler/ODE 采样虽然减少截断误差,却可能累积梯度近似误差;因此 (N_o=64) 并不总是优于 32。额外视觉步数也会增加延迟,不能无条件用于高频闭环控制。

7.2 自己分析得到的局限#

【Analysis】

  1. 官方代码和 checkpoint 尚未公开,社区无法复现实验,也无法确认论文中“基于 GR00T codebase”的具体工程改动。
  2. 未来视觉 embedding 是单个 horizon 的目标,可能遗漏接触瞬间、遮挡和多步不确定性;论文没有报告更长 horizon 或多模态未来分布的系统实验。
  3. 所有主实验冻结 VLM,DUST 的收益与“更强的联合视觉—语言—动作预训练”之间的关系尚未被隔离。
  4. 真实实验使用同一 Franka embodiment 的示教和测试;跨硬件零样本迁移仍主要由异构训练实验间接支持。

8. 启发与研究思考#

【Analysis】 DUST 给后续 VLA 研究留下三条可操作的路线:

  • 把世界模型当作训练时的结构化正则:不一定要在部署时生成可视化视频,只要预测一个与控制相关的 latent state,就可能获得更好的数据效率。
  • 按模态分配 test-time compute:动作、深度、触觉和视觉 token 的最优采样步数不同,统一的 diffusion step budget 并不合理;异步采样可推广到多传感器策略。
  • 先学世界、再学动作:action-free video 预训练的 8.4 个百分点增益说明,廉价视频可以先提供场景变化先验,再用少量机器人示教学习 embodiment-specific action decoder。

一个值得继续验证的问题是:如果将未来目标从单一 SigLIP-2 embedding 扩展为“object-centric state + contact event + uncertainty”,双流策略是否能在插入、擦拭等接触丰富任务上继续提升?这会把 DUST 从 latent prediction head 推向真正的可查询 world model。

DUST 论文精读:双流扩散增强 World-Model VLA
https://agusexp25.top/en/blog/paper-deep-dive-dust
Author 菊花花
Published at August 26, 2026