Hana's Blog
MWM 论文精读:让世界模型预测真正影响机器人决策的东西Blur image
Arxiv ID 2604.19683
幻觉翻译 2604.19683
publication pending

MWM 不再要求世界模型逼真地预测未来 RGB,而是只预测与操控有关的语义几何结构;训练用 mask,部署仍只看 RGB。

推荐指数:

1. 论文概述#

论文名称:《Mask World Model: Predicting What Matters for Robust Robot Policy Learning》

论文链接arXiv · 代码LYFCLOUDFAN/mask-world-model

MWM 概览:从 RGB 记忆帧预测未来语义 mask,并由预测特征生成动作(论文 Figure 1)

一句话总结#

【Paper】 MWM(Mask World Model)把机器人世界模型的预测目标从未来 RGB 视频改为未来语义 mask:训练时从 mask 学习物体身份、空间布局和接触变化,测试时却只接收多视角 RGB。扩散式 action head 读取世界模型的预测特征并产生闭环动作。

核心贡献#

【Paper】

  1. 提出几何信息瓶颈(geometric information bottleneck):以语义 mask 保留对象、布局与交互关系,舍弃纹理、反光、背景和照明等控制无关因素。
  2. 以条件 flow matching 预训练 mask dynamics backbone,再以扩散策略的动作损失对齐预测特征与控制需求;部署阶段不需要外部分割器。
  3. 在 LIBERO 上得到 98.3% 平均成功率、RLBench 六任务上得到 68.3%,并在 Franka 实机与外观扰动测试中优于 RGB 世界模型基线。

2. 背景与相关工作#

【Paper】 视频世界模型常以未来 RGB 重建为目标。它适合视觉生成,却未必适合控制:桌布纹理、光照或反光改变了大量像素,却不改变“夹爪是否接触瓶子”这类决策变量。若模型把容量分给这些外观细节,闭环中的 appearance-driven 误差会不断累积。

【Paper】 MWM 不同于把当前帧的 grounding mask 作为线上输入的路线。它在内部预测未来的语义结构,让策略读取预测过程的 hidden states;mask 只是离线监督信号,不把在线分割质量、延迟或额外模型依赖带入控制回路。

【Analysis】 真正变化的是世界模型必须预测什么,而不只是给 RGB world model 加一项 segmentation auxiliary loss。这一归纳偏置直接针对背景、颜色和照明变化。

3. 问题定义#

【Paper】 时刻 tt 的输入是多视角 RGB ot={ot(v)}v=1Vo_t=\{o_t^{(v)}\}_{v=1}^{V}、语言指令 pp 与低维 state;输出为连续末端执行器动作。训练数据另有机械臂、夹爪和任务物体的像素级 mask mtm_t,但只用于训练。目标是在外观分布改变后仍可靠操控。

项目MWM 的设定
观测第三人称 + wrist 多视角 RGB、语言;动作阶段使用低维 state
预测结构4 个 RGB memory frames 条件下预测 5 个未来 mask latent
动作表示36-step chunk;15 维为 7-DoF pose、1-DoF gripper、7-DoF state
部署Receding-horizon control,每轮只执行 chunk 的第一步

4. 方法#

4.1 Overall Architecture#

MWM 的 VAE、28 层 DiT、mask decoder 与 action decoder 架构(论文 Figure 2)

【Paper】 多视角 RGB memory 经共享 video VAE 编码、归一化、时间插值和跨视角堆叠后输入 DiT;DiT 在文本 cross-attention 与 diffusion timestep 条件下预测未来 mask latent,并将各层 hidden states 缓存成 predictive feature bank,供 action diffusion head cross-attend。

4.2 核心模块#

共享 VAE 与彩色 mask latent#

【Paper】 mask 是离散类别图,视频扩散器却处理连续 latent。MWM 用固定调色板把语义区域渲染为 RGB-compatible 图像 m~t\tilde m_t,RGB 与 mask 共用预训练 VAE 编码器 EE

zto=E(ot),ztm=E(m~t)z_t^o=E(o_t), \qquad z_t^m=E(\tilde m_t)

这避免另训 mask VAE,并使 RGB 条件和 mask target 落在同一 latent 接口。Normalize / Interpolate / Stack 随后统一时间采样率并融合多视角 token。

Mask dynamics DiT#

【Paper】 28 层 DiT 接收干净的 memory RGB latent 与被加噪的未来 mask latent。memory slots 固定在零噪声时间步,损失只施加于 future slots,因此模型必须建模条件未来。3D RoPE 编码时间、高、宽位置;AdaIN-style 的尺度和偏移注入 timestep。

Predictive feature bank 与 action expert#

【Paper】 MWM 不先把 mask 解码成图、再由另一网络看图选动作。它缓存 mask forecasting 中所有 block 的 hidden states Ht={ht(1),,ht(L)}H_t=\{h_t^{(1)},\ldots,h_t^{(L)}\},让 action transformer 直接对这些时空特征做 cross-attention。

【Analysis】 这可能是 MWM-C2 强于“显式 mask rollout + inverse dynamics”的关键:策略读取连续、层级化的未来表征,免去一次 mask 解码和二次解释带来的误差传播。

4.3 关键公式#

【Paper】 对干净未来 mask latent z0z_0 与高斯噪声 z1N(0,I)z_1\sim\mathcal N(0,I),flow matching 使用:

zs=(1s)z0+sz1,Lmask=E[w(s)vθ(zs,s,ct)(z1z0)22]z_s=(1-s)z_0+sz_1, \qquad \mathcal L_{\text{mask}}=\mathbb E\left[w(s)\left\|v_\theta(z_s,s,c_t)-(z_1-z_0)\right\|_2^2\right]

ctc_t 是 RGB memory 与文本条件,w(s)w(s) 是时间步权重,z1z0z_1-z_0 为路径真实速度。动作头对 action-state chunk uu 加噪 u~=u+σϵ\tilde u=u+\sigma\epsilon,以 score matching 优化:

Lact=E[λ(σ)ϕξ(u~,σ,Ht)+ϵ/σ22]\mathcal L_{\text{act}}=\mathbb E\left[\lambda(\sigma)\left\|\phi_\xi(\tilde u,\sigma,H_t)+\epsilon/\sigma\right\|_2^2\right]

其中 ϕξ\phi_\xi 是动作去噪器,HtH_t 为预测特征库,λ(σ)\lambda(\sigma) 调整不同噪声尺度的权重。

4.4 Training#

【Paper】 Stage 1 以 Lmask\mathcal L_{\text{mask}} 训练 mask dynamics:4 帧 RGB 预测 5 个未来 latent,总共覆盖 9 帧;caption dropout 为 0.06,条件帧加幅度 0.1 的轻微噪声。Stage 2 从 Stage-1 checkpoint 开始,只优化 Lact\mathcal L_{\text{act}};VAE 冻结,DiT backbone 与 action expert 由动作梯度共同更新,不再加入 mask/video reconstruction loss。

【Paper】 附录报告两阶段均用 AdamW、全局 batch 128、weight decay 10510^{-5}、warmup 1000 steps、bf16、gradient clip 1.0;学习率分别为 3×1043\times10^{-4} / 5×1055\times10^{-5}。每 suite 训练约需 8×A100 80GB:约 3.5 天(30k steps)加 1.5 天(18k steps)。

Algorithm 1 MWM 两阶段训练
输入:
带 RGB、语言、动作与离线语义 mask 的演示数据。
输出:
RGB-only 的 mask-centric backbone 与动作扩散策略。
  1. 用共享 VAE 编码 RGB memory 与调色板渲染的未来 mask。
  2. 固定干净 memory slots、对 future mask slots 加噪,以条件 flow matching 最小化 L_mask。

  3. 从 Stage-1 checkpoint 初始化;冻结 VAE,并保留 DiT hidden states 为 predictive feature bank。

  4. 对 action-state chunks 加噪,经 action expert cross-attend H_t,以 L_act 更新 backbone 与动作头。

4.5 Inference#

【Paper】 测试时没有语义 mask 与外部分割器。系统输入最新 RGB、state 和指令,由 world model 得到预测特征;动作扩散器使用 10-step Euler sampling 产生 36-step chunk。控制器执行第一步,读入新观测后重新规划。

Algorithm 2 RGB-only 闭环推理
输入:
最新 RGB memory、语言指令与机器人 state。
输出:
本轮实际执行的一个连续动作。
  1. 编码 RGB memory,输入带文本条件的 DiT;不提供 mask。
  2. 读取 mask-centric predictive feature bank H_t。
  3. 以 10 步 Euler 去噪采样 36-step action chunk。
  4. 执行 chunk 第一项,获得下一轮观测后重复。

4.6 代码实现对照#

【Code】 官方实现是基于 Genie Envisioner / LTX-Video 的精简 fork。configs/ltx_model/libero/video_model_libero.yaml 对应 Stage 1:return_video: truetrain_mode: video_onlyaction_expert: falseaction_model_libero.yaml 对应 Stage 2:return_action: truetrain_mode: action_fullaction_expert: true

【Code】 配置与论文关键数字一致:n_previous: 4chunk: 9action_chunk: 36、两路 valid_cam: ['image', 'wrist_image'],以及 Stage 1 / 2 的学习率 3e43e{-4} / 5e55e{-5}data/libero_dataset.py 默认将 RGB key 后缀改为 _mask;README 指出 scripts/convert_libero_hdf5_to_lerobot.py 将实例分割映射为固定颜色的语义 mask。

【Code】 仓库没有随附完整数据和 checkpoint。复现实验还需 GE-Base 风格权重、LTX tokenizer/text encoder/VAE,以及包含 RGB 与 mask 字段的 LeRobot 数据集。

5. 实验#

5.1 Experimental Setup#

【Paper】 仿真使用 LIBERO 四个 suite(每 suite 500 个评估 episode)和 RLBench 六任务(每任务 20 episodes)。真实系统为 Franka Emika Panda + 第三人称与 wrist 两台 Intel RealSense D435i;每个方法、每项任务均用 50 条示范 post-training。

Franka 实机上的 MWM 任务 rollout,包括放置、开抽屉、倒水和上架(论文 Figure 3)

【Paper】 四项实机任务是放置食物、开抽屉并放笔、倒水、把书放上架。其语义监督由 RoboEngine 离线标注,覆盖机械臂(含夹爪)及任务相关物体;推理依旧只看原始 RGB。

5.2 Main Results#

【Paper】 LIBERO 平均成功率为 0.983,较 GE-ACT 的 0.965 提升 1.8 个百分点;在 long-horizon 的 LIBERO-10 为 0.960 vs. 0.944。

方法SpatialObjectGoalLIBERO-10平均
Cosmos + IDM0.7680.7500.6940.4880.675
Cosmos + Latent IDM0.9480.9920.8920.8420.919
π00.9680.9880.9580.8520.942
GE-ACT0.9820.9760.9580.9440.965
MWM0.9881.0000.9820.9600.983

【Paper】 RLBench 六任务中 MWM 平均 68.3%,高于 FiS-VLA 的 50.0% 和 GE-ACT 的 30.8%;Umbrella Out、Frame off Hanger、Wine at Rack 分别达到 85%、75%、90%。Franka 四任务平均 67.5%,而 π0 与 GE-ACT 分别为 38.8%、23.8%;倒水任务中 MWM 为 60%,两个 RGB 基线为 5% / 10%。

5.3 Ablation Study#

【Paper】 三种 mask 设计区分了收益来源:MWM-C1(显式未来 mask + IDM)平均 0.810;MWM-C2(直接接 predictive latent features 的 action diffusion)为 0.918;完整双视角 MWM 达 0.983。C1 相对 Cosmos + IDM 从 0.675 提升到 0.810。

【Paper】 正文将 C2 的 RGB 对照写作 0.873→0.918,Table 1 的 Cosmos + Latent IDM 精确条目为 0.919;两者有 0.001 不一致,宜以表格为准。

【Analysis】 消融的要点不是“mask 必然最好”,而是仅改变预测表征已产生收益;直接让策略使用连续 feature bank 比“先生成 mask 图、再反推动作”更自然。C2 与 RGB latent baseline 的极小差异也说明相机设置和训练细节不可忽略。

5.4 Generalization#

背景、光照和物体颜色变化下的实机视觉泛化测试(论文 Figure 7)

【Paper】 背景纹理、照明和物体颜色 shift 下,MWM OOD-SR 为 42.1%,优于 π0 的 19.2% 和 GE-ACT 的 12.5%;in-distribution SR 为 67.5%,保留率 Retain=OOD-SR/SRID\mathrm{Retain}=\mathrm{OOD\text{-}SR}/\mathrm{SR}_{\mathrm{ID}} 为 0.62。随机视觉 token pruning 下,MWM nPAUC 为 0.648,略高于 GE-ACT 的 0.629。

【Analysis】 OOD-SR 的绝对值仍不高,背景扰动下 MWM 仅为 27.5%;token-pruning 的 0.019 nPAUC 优势也是温和证据。因此结论是“相对更鲁棒”,不是“已解决外观泛化”。

6. 方法分析#

6.1 为什么有效?#

【Analysis】 操控主要取决于物体身份、相对布局与接触,而 RGB loss 对桌布花纹和高光同样敏感。预测语义 mask 强制 world model 做 task-relevant compression,把容量留给运动与交互;再让动作头读出该过程的 hidden states,使这个 bottleneck 能端到端适应控制。

6.2 核心创新#

【Analysis】 三个设计缺一不可:未来 mask 是预测 target;mask 不是线上输入;动作头读取预测过程的多层 features。前两点把语义知识蒸馏进 RGB-only policy,第三点避免把未来表征压成可能出错的显式图再二次处理。

6.3 与已有方法的本质区别#

路线世界模型预测空间部署是否需语义模型控制使用什么
RGB video world modelRGB / photometric latentRGB 预测特征或视频
当前帧 grounding mask当前图像的显式 mask通常需要mask 感知提示
MWM未来 semantic-mask latent未来 mask dynamics 的 hidden features

6.4 关键假设#

【Analysis】 方法假定语义分区覆盖了任务决定因素。若成功取决于未标注的液体量、柔性形变、透明物边界、受力,或语言指令要求识别纹理文字,过强的几何 bottleneck 可能丢失必要信息。

7. 局限性#

7.1 作者明确提出的局限#

【Paper】 论文未单列 Limitations 章节。其明确边界是:mask 监督离线产生;实机只覆盖四项桌面任务、每项 50 条示范;visual shift 集中于背景、照明与物体颜色;随机 token pruning 是评估压力测试而非方法贡献。

7.2 自己分析得到的局限#

【Analysis】

  1. 离线 mask 的获得仍有成本。仿真可直接渲染,实机依赖 RoboEngine;类别定义变化或标注遗漏会限制扩展。
  2. 去外观化存在任务依赖性;材质、文字、液面、可变形物或透明反光物的外观可能正是行动所需信息。
  3. 实机对比规模较小且未报告误差条;RLBench 只覆盖六个任务,不能直接外推为开放世界通用能力。
  4. 成本较高:论文报告每 suite 需 8×A100 80GB 约五天的两阶段训练。

8. 启发与研究思考#

【Analysis】 MWM 把问题指向一个更普适的方向:robot world model 不一定要模拟全部可见细节,更应预测 action-sufficient future representation。下一步可以自动发现而非人工指定这种表征;在任务需要时保留材质/文字等 appearance;并把预测不确定性显式交给规划器,让“看不清、预测不稳”触发更保守的动作。

MWM 论文精读:让世界模型预测真正影响机器人决策的东西
https://agusexp25.top/blog/paper-deep-dive-mask-world-model
Author 菊花花
Published at August 26, 2026