

LaWAM 论文精读:用潜空间世界模型预测机器人动作的视觉子目标
精读 LaWAM:把 Latent Action Model 的前向解码器复用为 Latent World Model,在 DINOv3 特征空间预测动作相关的未来视觉子目标,兼顾动力学预见与低延迟控制。
LaWAM 将 latent action 通过一个单次前向的 Latent World Model 展开成未来视觉子目标,再让 VLA action expert 依据该子目标生成动作 chunk。
1. 论文概述#
论文名称:《LaWAM: Latent World Action Models for Efficient Dynamics-Aware Robot Policies》
作者:Jialei Chen 等 12 位作者
时间:arXiv 预印本,2026 年 6 月
论文链接:arXiv ↗

一句话总结#
【Paper】 LaWAM 不生成未来像素视频,而是在冻结的 DINOv3 特征空间中,把策略预测的 latent action 解码成与当前场景和机器人 embodiment 对齐的 latent visual subgoal,再用这个子目标指导动作 chunk 生成。
核心贡献#
【Paper】
- 提出 Latent World Model(LaWM):把 Latent Action Model 的 forward decoder 保留下来,直接预测未来 observation feature。
- 提出 Latent World Action Model(LaWAM):将预测的 latent visual subgoal 接入 VLA 的 Alternate-DiT action expert。
- 用 latent-action distillation 训练策略先验,并用 Knowledge Insulation 防止动作专家破坏已经学到的动力学。
- 在 LIBERO、RoboTwin 和真实机器人任务上同时取得高成功率与低延迟:LIBERO 平均成功率 98.6%,单个 action chunk 预测约 187 ms。
【Analysis】 论文的真正转折点不是“再加一个 world model”,而是改变了 policy-facing future 的接口:未来只保留对下一个动作 chunk 有用的结构化特征,不承担像素重建的负担。
2. 背景与相关工作#
【Paper】 传统 VLA 主要学习 :根据当前 observation 和语言指令 直接输出动作序列。它能利用大规模 vision-language pretraining 理解“要做什么”,但没有显式建模“执行动作之后场景会怎样变化”。
World-Action Model(WAM)通过预测未来 observation 或 video,让 policy 在动作生成时获得动力学预见。问题在于:
- 像素空间视频包含大量与控制无关的纹理和外观冗余;
- 迭代式视频生成带来很高的推理延迟,论文对比的 LingBot-VA 为 4482 ms,而普通 VLA 为 220 ms;
- manipulation 往往只需要“下一段动作会把机械臂和物体带到哪里”的紧凑描述。
【Paper】 既有 Latent Action Model 通常用 inverse dynamics 从视觉转移中抽取 embodiment-agnostic 的 latent action,但预训练后会丢弃 forward decoder。LaWAM 的观察是:这个 decoder 本身已经是一个 action-conditioned world model,只是过去没有被当作 policy 的输入接口。
3. 问题定义#
【Paper】 给定当前观测 、指令 和固定物理时间跨度 内的动作 chunk ,标准 VLA 直接建模:
LaWAM 先用冻结视觉编码器 得到当前和未来特征:、。第一阶段学习 posterior 和 forward decoder;部署时未来特征不可见,因此策略要从 预测 latent action ,再得到未来子目标 。
- 输入:RGB observation、自然语言任务指令;论文实验使用 256×256 RGB 图像,不输入 proprioception。
- 输出:固定物理时间跨度对应的 end-effector action chunk。
- 中间变量:latent action 、当前 latent feature 、预测子目标 。
- 数据:约 3000 小时机器人视频和 1500 小时 egocentric human 视频用于 LaWM;第二阶段 policy integration 只使用带语言指令的机器人轨迹。
- 机器人:LIBERO、RoboTwin,以及 Franka Emika Panda 和 Quanta X1 双臂平台。
4. 方法#
4.1 Overall Architecture#
【Paper】 LaWAM 有两个阶段。Stage 1 从视觉转移中训练 latent action posterior 与 forward decoder,并将 decoder 命名为 LaWM;Stage 2 让 VLA 从当前 observation 和指令预测 latent action,经 LaWM 得到 latent visual subgoal,最后由 Alternate-DiT action expert 生成动作 chunk。
数据流可概括为:(o, l) → policy prior → ẑ → LaWM(u, ẑ) → ûT → action expert → a1:T。
4.2 核心模块#
冻结视觉编码器与 latent action posterior#
- 输入:当前特征 与物理时间间隔 后的未来特征 。
- 输出:连续 latent action 的后验分布 。
- 模块:DINOv3 ViT-B/16 提供空间结构化 dense feature;24 层 Transformer inverse-dynamics encoder 联合处理当前和 horizon observation。
- 作用:将“从当前状态到未来状态的变化”压缩成低维、可跨 embodiment 迁移的动作变量。
【Analysis】 不是最终要执行的关节动作,而是“需要发生哪类转移”的中间坐标。它本身缺少当前场景的空间落点,所以不能直接替代视觉子目标。
LaWM forward decoder#
- 输入:当前 latent feature 和 latent action 。
- 输出:未来特征预测 。
- 实现:24 层 Transformer decoder,通过 adaptive layer normalization 注入 ;论文指出这种方式比 additive token injection 在 cross-embodiment 训练中更稳定。
- 辅助信号:轻量 MLP 以当前 end-effector state 与 预测 ,鼓励 编码真实运动而非纯外观变化;预训练后丢弃该 head。
Policy prior 与 Alternate-DiT action expert#
策略先验 从当前视觉和指令预测部署时的 latent action。LaWM 将其展开为 。动作专家采用 Alternate-DiT:一条流承载 VLM 的语义上下文,另一条流承载 的动力学上下文,两条流交替交互后对 action chunk 做 flow matching 去噪。
【Code】 论文没有给出可核验的官方代码仓库或项目页面,因此这里不推断具体文件、DataLoader 或 checkpoint 行为;本节只记录论文明确的架构。

4.3 关键公式#
LaWM 接口#
是只在训练阶段可用的 latent inverse-dynamics posterior; 是 decoder 重建的 horizon feature。 与 都对应固定物理时间 ,因此子目标表示的是一致的实际运动时长,而不是某个数据集的固定帧偏移。
LaWAM 分解#
- :policy prior,预测 latent action;
- :LaWM,单次前向得到 latent visual subgoal;
- :action expert,在语义和动力学上下文下生成 action chunk。
两阶段损失#
第一阶段:
第二阶段:
是以 为条件的 action flow-matching loss;论文在所有实验中设置 。
4.4 Training#
【Paper】 LaWM 训练使用连续 latent action、AdamW、16 张 H100、100k steps、全局 batch size 1024、学习率 、weight decay ,KL 权重 。机器人 teleoperation 的物理 horizon 为 1.2 s,egocentric human 视频为 0.4 s。第二阶段在 64 张 H100 上进行 200k steps 的 policy-integration pretraining,action expert 学习率 ,其他模块为 。
混合控制频率数据不按 token index 粗暴对齐,而是固定物理时间 。频率为 的分支使用:
并把正弦时间编码 加到 action-query embedding,使 5/10/20 Hz 的同一物理时刻拥有一致坐标。
- 用冻结 DINOv3 编码 o 和 oT,得到 (u, uT)。
-
由 inverse-dynamics encoder 采样 z,训练 LaWM 重建 uT,并用 sT 辅助约束 z。
- 丢弃辅助 state head,保留 forward decoder 作为 LaWM。
-
用 robot-language trajectory 训练 policy prior 预测 ẑ,并加入 latent-action distillation。
-
用 LaWM 产生 ûT,训练 Alternate-DiT action expert;Knowledge Insulation 保护 LaWM 动力学。
4.5 Inference#
推理时不再使用需要未来帧的 posterior encoder。LaWAM 只需一次 LaWM forward,就可以把策略的 latent action 变成视觉子目标;action expert 在 10 个 denoising steps 下输出一段 end-effector action chunk,执行后重新观测并滚动闭环。
- 用 VLM backbone 编码 observation 和指令,policy prior 预测 ẑ。
- 编码当前视觉特征 u,并计算 ûT = LaWM(u, ẑ)。
- 将语义流和 (u, ûT) 动力学流交替送入 action expert。
-
执行生成的 action chunk,到达 chunk 末端后获取新 observation 并重复。
5. 实验#
5.1 Experimental Setup#
【Paper】 实验覆盖四个 LIBERO suite、RoboTwin 2.0 的 50 个双臂任务,以及真实世界的 pick-and-place、drawer opening 和 towel folding。LIBERO 报告 40 个任务、每任务 50 次试验;RoboTwin 每任务 100 次;真实任务各 30 次。延迟在 A100 上重复 1000 次 action-chunk prediction 后取平均。

5.2 Main Results#
【Paper】 LIBERO 的 LaWAM 平均成功率为 98.6%,Long / Goal / Object / Spatial 分别为 97.0 / 98.4 / 99.6 / 99.4;模型规模 2.3B,单 chunk 延迟 187 ms。相比像素空间 WAM,LaWAM 的 world-modeling 模块仅 230M 参数,论文称比 5B WAN backbone 少约 95%,墙钟延迟最高可降低 24×。
| 方法 | 模型规模 | 延迟 | LIBERO 平均 |
|---|---|---|---|
| π0.5 | 3.5B | 220 ms | 96.9% |
| Cosmos-Policy | 2.1B | 1413 ms | 98.5% |
| LingBot-VA | 5.5B | 4482 ms | 98.5% |
| Fast-WAM | 6B | 486 ms | 97.6% |
| LaWAM | 2.3B | 187 ms | 98.6% |
RoboTwin 的 clean-scene / randomized-scene 平均成功率为 92.64% / 89.80%,两者平均为 91.22%。真实世界 LaWAM 在 pick-and-place、drawer opening、towel folding 上分别达到 93.3%、86.7%、90.0%,平均 90.0%,高于对比方法的平均 83.3%(π0.5)。

5.3 Ablation Study#

【Paper】 LIBERO 消融显示,移除 LaWM 的性能下降最大,尤其是 LIBERO-Long;移除 latent-action distillation 也会明显变差;同时移除 KI 与 distillation 进一步退化。说明最终收益来自一条完整接口:策略要能稳定驱动 LaWM,且动作专家不能反向改写其动力学。
混合频率实验还表明,不加 physical-time encoding 时联合训练 5/10/20 Hz 数据会明显下降;加入时间编码后,性能大幅恢复到 20 Hz reference 附近。

5.4 Generalization#
【Paper】 LaWM 的 open-loop rollout 在未见环境和未见 embodiment 上使用同一 latent-action trajectory 时,仍产生上下文相关且连贯的 latent 变化。真实测试还包含超出部分示教空间的物体、碗和抽屉初始位置;LaWAM 在这些配置下保持较高成功率。

6. 方法分析#
6.1 为什么有效?#
【Analysis】 LaWAM 同时解决了两个互补问题:latent action 提供“要发生哪种变化”的抽象,当前 DINOv3 feature 提供“变化应该落在当前场景哪里”的空间锚点。LaWM 把两者组合成 embodiment-grounded subgoal,action expert 因而不必从零猜测中间状态。
此外,预测一个 feature map 比生成多帧 RGB 视频更接近控制所需的信息瓶颈;单次 forward 又避免了视频扩散的迭代延迟。
6.2 核心创新#
- 接口创新:将 LAM decoder 从训练辅助组件变成 policy-facing world model。
- 表示创新:未来由 action-conditioned latent visual subgoal 表示,而不是单个 latent token 或像素视频。
- 训练创新:latent-action distillation 让 policy prior 学会驱动 LaWM,KI 保持动力学模块稳定。
- 时间创新:用 physical-time encoding 对齐不同控制频率的 action chunk。
6.3 与已有方法的本质区别#
| 路线 | 未来表示 | 推理方式 | 主要代价 |
|---|---|---|---|
| 普通 VLA | 无显式未来 | 直接生成动作 | 缺少动力学预见 |
| 像素空间 WAM | 未来图像 / 视频 | 迭代生成 | 延迟和像素冗余高 |
| Latent Action VLA | latent action | 直接用 action token | 空间落点不显式 |
| LaWAM | action-conditioned latent visual subgoal | 单次 latent forward | 依赖视觉 latent 的动力学质量 |
6.4 关键假设#
【Analysis】 方法隐含三个假设:DINOv3 特征保留了对控制有用的空间结构;固定物理时间 足以定义稳定的 chunk-level subgoal;连续 latent action 可以被当前 observation 与 language 预测。若相机剧烈运动、特征空间对细粒度接触不敏感,或任务需要比一个 chunk 更长的多步规划,这些假设都会变弱。
7. 局限性#
7.1 作者明确提出的局限#
【Paper】 LaWAM 目前更适合相机相对稳定的 manipulation。当 egocentric 视频存在剧烈抖动或大幅视角变化时,latent action space 可能无法学习一致转移,因此对 humanoid 或 mobile robot 的自运动场景仍有限制。另一个问题是训练混合数据中细粒度 deformable-object dynamics 较少,细微布料形变仍难以可靠建模。
7.2 自己分析得到的局限#
【Analysis】 论文把未来压缩到单个 horizon feature,效率很高,但也牺牲了多模态未来的显式表达:同一 只给出一个确定性子目标。对于需要分支规划、碰撞规避或长时域反事实比较的任务,单次解码可能不足。其次,DINOv3 feature 的语义和空间相似度并不等同于接触力、摩擦和可执行性;高成功率主要在当前 benchmark 与任务分布内得到验证。
8. 启发与研究思考#
【Analysis】 LaWAM 给出的更一般结论是:world model 不一定要成为“可观看的视频生成器”,也可以成为连接 semantic policy 与 low-level control 的中间接口。值得继续追问:
- 能否让 LaWM 预测一组多模态 subgoals,再由 action expert 或 value model 选择?
- 能否把 contact state、力觉或几何约束加入 latent feature,使子目标不仅“看起来正确”,还更可执行?
- 对移动机器人和 humanoid,是否需要把 camera ego-motion 单独因子化,而不是让 latent action 同时解释物体运动和相机运动?
- 物理时间对齐或许可以推广到 variable-horizon policy,把动作 chunk 的长度也作为可学习接口。