

LingBot-VA 论文精读:用因果世界模型驱动机器人控制
精读 LingBot-VA:将视频世界建模与逆动力学动作生成交织为因果自回归序列,并以 MoT、KV Cache、部分去噪和 FDM 校正实现长时程闭环操控。
LingBot-VA 将未来视频预测与动作逆动力学编入同一条因果自回归序列:视频预训练学习物理先验,动作流匹配输出控制,并以真实观测持续校正想象。
1. 论文概述#
论文名称:《Causal World Modeling for Robot Control》
作者:Lin Li、Qihang Zhang、Yiming Luo、Shuai Yang、Ruilin Wang、Fei Han、Mingrui Yu、Zelin Gao、Nan Xue、Xing Zhu、Yujun Shen、Yinghao Xu
会议 / 期刊:arXiv 预印本(v2,2026)
论文链接:arXiv ↗
项目主页:LingBot-VA ↗

一句话总结#
【Paper】 LingBot-VA 不把策略视为“当前图像直接映射当前动作”的反应式函数。它先在 latent space 预测未来视觉状态,再根据这段视觉转变反推出动作;video token 和 action token 交错进入同一条因果自回归序列,用 autoregressive diffusion 联合生成。
核心贡献#
【Paper】
- 提出 video-action world model:以因果自回归方式联合建模未来视频 latent 与动作,不把长轨迹拆成彼此失忆的独立 chunk。
- 设计非对称 Mixture-of-Transformers(MoT):大视频流继承 Wan2.2-5B 的视觉生成先验,小动作流专门处理低维控制,同时用 attention 交互。
- 用 Noisy History Augmentation 支持视频 latent 的部分去噪,并以 KV cache 和 FDM-grounded asynchronous inference 降低部署延迟、回接真实反馈。
- 在 RoboTwin 2.0、LIBERO 与六项真实任务上评估长时程、精确、柔性物体操作、低样本适应和新配置泛化。
【Analysis】 创新不只是给 VLA 加一个视频 auxiliary loss,而是把动作定义成“预测视觉转变的 inverse dynamics 输出”。视频预训练获得的物理先验因此是动作生成的条件,而不是训练后可有可无的旁路特征。
2. 背景与相关工作#
【Paper】 常规 VLA 往往学习 ,让一个网络用机器人示范同时掌握视觉语义、物理动态和控制。论文将这一瓶颈称为 representation entanglement:动作监督相对稀疏,很难独自支撑高维视觉动态的学习。
已有 world-model 路线包括交互式 neural simulator、按 chunk 生成视频—动作片段的 diffusion policy、以及先生成视觉子目标再由 policy 执行的两阶段方法。【Paper】 作者认为前两类在闭环控制中会遭遇 reactivity gap、跨 chunk 的有限记忆,以及 chunk 内双向 attention 的因果不一致。
【Analysis】 这篇工作的主张不是“画面越逼真,机器人越强”,而是需要对 action 有用、可由真实反馈反复修正的 future latent。由此也能理解:推理可让视频仅部分去噪,但动作仍需完整 flow integration。
3. 问题定义#
【Paper】 在部分可观测操作中,机器人接收视觉观测 、执行 ,并得到 。作者将直接策略改写为 visual dynamics 与 inverse dynamics:
模型实际使用带历史的版本:
其中 为 causal video VAE latent, 是想象的未来, 是一次预测的视觉 chunk。【Paper】 论文将动作历史也作为 world dynamics 的输入,因为绝对 EEF pose 等动作包含 embodiment 过往构型和交互轨迹。
| 输入 / 输出 | 内容 | 用途 |
|---|---|---|
| 多视角观测的 video latent | 表达视觉状态与环境动态 | |
| 机器人动作 / action token | 表达执行器运动和控制结果 | |
| T5 编码的指令 | 通过 cross-attention 规定任务 | |
| 预测的未来视觉状态 | 为 inverse dynamics 提供目标转变 |
4. 方法#
4.1 Overall Architecture#

【Paper】 prompt 经语言编码器进入 transformer;图像经 Wan2.2 causal VAE 变为 video latent,连续动作经轻量 MLP 变为 action embedding。二者按时间交错后进入 MoT:video stream 用 flow matching 预测未来 latent,action stream 则根据该视觉转变、历史和指令生成动作;每轮执行后,真实观测重新进入上下文。
【Paper】 视频以 进行时间稀疏化,每个视频帧关联 个连续动作,序列是 。预测 个视觉帧因此对应 个高频动作,而不等价于用低帧率视频控制机器人。
4.2 核心模块#
Causal video latent 与统一动作表示#
【Paper】 Wan2.2 causal VAE 使用 时空压缩,再经过 patchify;拼接多路视角后,每帧有 个空间 token。动作统一为每臂的 7 维 EEF pose、最多 7 维 joint 与 1 维 gripper,总计 30 维;缺失关节补零,并按训练集做逐维 quantile normalization。
【Code】 wan_va/dataset/lerobot_latent_dataset.py 读取 LeRobot episode 中预提取的 latents/,将相机 latent 拼接;_action_post_process 对动作按 latent frame 对齐、填充并依据 inverse_used_action_channel_ids 保留当前 embodiment 的有效维度。RoboTwin 配置使用三路相机,LIBERO 使用两路。
非对称 MoT#
【Paper】 video stream 从 Wan2.2-5B 初始化,宽度 、30 层;action stream 层数相同但宽度 ,总模型约 5.3B。每一层为两种 token 使用不同 QKV 投影;action 表示先投到视频维度参加联合 self-attention,再残差投回动作维度,最后线性映射回低维动作。
【Code】 wan_va/modules/model.py 的 WanTransformer3DModel 默认 action_dim=30,具有 action_embedder、独立 condition_embedder_action 与 action_proj_out。其 forward_train 把 noisy / condition 的 video 和 action token 拼接后共同前向,并返回两种预测。
动作流初始化#
【Paper】 随机初始化动作网络时,动作和视频输出分布不匹配,会破坏联合 attention。论文将预训练视频权重插值到动作宽度,再乘以
以保持输出方差。【Analysis】 该操作没有增加表达能力,却是把大 video backbone 的先验稳定转交给新 action branch 的必要分布对齐。
Causal teacher forcing 与 Noisy History Augmentation#

【Paper】 训练时将真实交错 trajectory 用作 teacher-forcing context,每个 token 只能 attend 到时间更早的 token,因此可在一次前向中并行优化所有时间步。以 ,视觉历史还会被扰动为:
这使 action decoder 能从部分带噪的视频表示提取控制信息,测试时不必先将 video token 完全去噪。
4.3 关键公式#
【Paper】 Flow Matching 对数据 与噪声 采用路径 ,目标速度是 :
视频 dynamics 与 action inverse dynamics 分别遵循此目标,联合目标为:
这里 、 为视频 / 动作 vector field; 是指令; 是可带噪的历史;论文取 。【Code】 wan_va/train.py 用两套 FlowMatchScheduler 对 latent 与 action 分别加噪,compute_loss 对两项做 SNR-weighted MSE;action loss 额外受有效动作维度 mask 约束,最后直接相加反向传播。
4.4 Training#
【Paper】 预训练汇集 Agibot、RoboMind、InternData-A1、OXE 的 OpenVLA 子集、UMI(不含 DexUMI)、RoboCOIN 及内部数据,约 16K 小时;每个来源按 90/10 切分训练 / 验证。设置为 1.4T token、AdamW 峰值学习率 、weight decay 0.01、cosine schedule、bf16、gradient clipping 2.0,文字 classifier-free dropout 为 0.1。
【Paper】 训练随机采样 ;报告的部署用 ,视频以 3 次 Euler step 积分至 ,动作以 10 次 step 积分至 ,video / action CFG 是 5.0 / 1.0。
【Code】 当前公开仓库提供 post-training 与 inference。va_robotwin_train_cfg.py 默认 、50K steps、batch size 1;va_libero_train_cfg.py 默认 5K steps、10 次 gradient accumulation。README 要求训练 checkpoint 的 attn_mode 为 flex,推理时改为 torch 或 flashattn。
- Encode 编码观测为 ,归一化动作并投影为 action token,按时间交错两种 token
- Sample 采样 chunk size、flow time 与高斯噪声;以概率 0.5 扰动视觉历史
- Mask 施加因果 attention mask,以真实历史 token 做 teacher forcing
- Predict MoT 同时预测 video velocity 与 action velocity
- Optimize 最小化 并更新参数
- return 训练后的联合 world model 与 inverse-dynamics policy
4.5 Inference#

【Paper】 基础推理缓存历史 token 的 key / value。每轮从噪声生成 个未来视频 latent(仅部分去噪),再生成对应动作(完整积分);机器人执行动作、接收真实图像并编码为新 ,再更新 cache。KV cache 避免重复计算,也保留了跨 chunk 的历史。
【Paper】 异步控制中,机器人执行 时后台生成下一 chunk。若直接基于旧视觉预测 续写 ,会放大 stale forecast。FDM-grounded 方案使用最近真实反馈 和当前执行动作 前向预测 ,以反馈对齐的 latent 替代旧预测后再生成下一段;post-training 还加入 。
【Code】 仓库实现为 server-client inference。RoboTwin 的 eval_polict_client_openpi.py 获取 action、按 action_per_frame 执行,得到关键帧后调用 infer(..., compute_kv_cache=True, imagine=False, state=action) 更新 cache。配置与论文报告不同:RoboTwin 默认 frame_chunk_size=2、video / action steps 25 / 50;LIBERO 为 4、20 / 50。应按模型 checkpoint 的实际 config 部署,不能把论文 3 / 10 step 直接视为仓库默认。
- Warm start
编码 ,预测首段部分去噪视频与完整动作 chunk
- Parallel 执行当前动作,同时在后台准备下一段预测
- Observe 读取新真实观测并编码为最新
- Ground 由 FDM 使用真实状态与已执行动作重建当前视觉 latent
- Predict
更新 KV cache,生成下一 video / action chunk,进入下一轮
4.6 代码实现对照#
| 论文概念 | 官方实现 | 核对结果 |
|---|---|---|
| 统一 video-action MoT | wan_va/modules/model.py 的 WanTransformer3DModel | 【Code】视频和动作有独立 embedding / output head,但在统一 transformer 前向内共同处理。 |
| LeRobot latent 管线 | wan_va/dataset/lerobot_latent_dataset.py | 【Code】训练前须离线从视频抽取 latents/,loader 再做多视角拼接、动作对齐、归一化与通道映射。 |
| 联合 flow matching | wan_va/train.py 的 _add_noise、compute_loss | 【Code】视频与动作各用 scheduler、SNR 权重 MSE,动作还使用 mask。 |
| 分布式训练 / checkpoint | wan_va/train.py、wan_va/distributed/fsdp.py | 【Code】采用 FSDP;rank 0 以 diffusers 格式保存 transformer。 |
| 部署 / 评测 | wan_va/wan_va_server.py、evaluation/robotwin/、evaluation/libero/ | 【Code】模型服务器与仿真 client 分离;README 估计 RoboTwin 单卡 offload 评测约需 24GB VRAM。 |
5. 实验#
5.1 Experimental Setup#
【Paper】 RoboTwin 2.0 覆盖 50 项双臂任务,Easy 使用固定初始状态,Hard 随机化物体姿态与布局。训练使用每任务 50 条 clean 加每任务 500 条随机场景示范,合计 27,500 条;视频从 50 Hz 降至 12.5 Hz,动作维持 50 Hz,训练 50K steps、学习率 。
【Paper】 LIBERO 的 Spatial、Object、Goal、Long 四个 suite 各含 10 个任务、每任务训练 50 条示范;每个 suite 以 3 个随机 seed、每 seed 500 次试验评测。真实部署评测 Make Breakfast、Pick Screws、Insert Tubes、Unpack Delivery、Fold Clothes、Fold Pants,每项以 50 条真实示范、500 steps、学习率 微调。

5.2 Main Results#
【Paper】 RoboTwin 50 任务平均成功率为 Easy 92.93%、Hard 91.55%,相对次优 Motus 高 4.2、4.6 个百分点;Horizon=3 时达到 93.22% / 93.28%,增益增至 8.2 / 9.1 个百分点。
| 方法 | RoboTwin Easy | RoboTwin Hard | LIBERO Avg |
|---|---|---|---|
| 65.9 | 58.4 | 94.1 | |
| 82.7 | 76.8 | — | |
| Motus | 88.7 | 87.0 | — |
| X-VLA | 72.9 | 72.8 | 98.1 |
| LingBot-VA | 92.93 | 91.55 | 98.5 |
【Paper】 LIBERO 分项是 Spatial 、Object 、Goal 、Long 。论文的 SOTA 表述应在其选取的基线与协议下理解;其表中 Goal 的最高值实际是 OpenVLA-OFT 的 97.9。
【Analysis】 长 horizon 上的更大增益与“因果 cache + 真实回灌”叙事相一致,但不能仅据主结果断言收益完全来自记忆机制;数据规模、视频预训练和系统实现也共同变化。
5.3 Ablation Study#

【Paper】 RoboTwin Easy 的完整模型为 92.9;FDM-grounded async 为 90.4,而 naive async 为 74.3,Horizon=3 更降至 32.9。结论是并行化本身不足,必须用真实反馈对齐异步视觉预测。使用原始 Wan2.2-5B 直接 fine-tune 的基线为 80.6;随机初始化 action stream 的曲线梯度波动更大、收敛更慢,插值加缩放初始化最平稳。
5.4 Generalization#

【Paper】 作者在“训练时仅见单一物体、测试换形状与纹理”和“训练时位置局部固定、测试随机特别是 OOD 区域”两个轴评估泛化,报告方法均优于比较对象。低数据分析中,10 条示范时该方法在 Make Breakfast progress score 比 高 15.6 个百分点,在 RoboTwin Easy 高 10.3 个百分点。
6. 方法分析#
6.1 为什么有效?#
【Analysis】 它同时解决了三个层次的问题:视频预训练提供物体与接触变化的表示;因果 attention 与 KV cache 让完整执行历史持续可用;部分去噪、异步执行、FDM 回锚共同把昂贵的生成过程变成可闭环使用的控制系统。缺少其中任一项,另两项也难以直接转化为实时机器人能力。
6.2 核心创新#
【Analysis】 最重要的组合是“video 先生成、action 由视觉转变反推,但两者不分离”。离线 video planner 会把误差单向传给 controller;普通 auxiliary video loss 则不能保证 action 真正以未来状态为条件。交错 token 和共享因果上下文让两条生成支路有共同的时间责任。
6.3 与已有方法的本质区别#
| 路线 | 未来状态的角色 | 历史记忆 | 闭环校正 |
|---|---|---|---|
| 反应式 VLA | 通常不显式预测 | 有限 observation window | 读取当前图像 |
| chunk diffusion | 生成局部片段 | chunk 边界易丢失 | 多在下一 chunk 回接 |
| video subgoal + controller | 外部中间目标 | 两模块各自维护 | 依赖重规划频率 |
| LingBot-VA | action inverse dynamics 的条件 | 因果 KV cache | 每轮真实观测回灌,异步时 FDM 对齐 |
6.4 关键假设#
【Analysis】 方法假设 video latent 含有足够的 action-relevant information,视觉与动作历史能近似恢复关键隐状态。若力觉、触觉、遮挡物体状态或精确 proprioception 是决定性信息,inverse dynamics 仍会多解;也假设 VAE 压缩和部分去噪不会删掉精密插装所需细节。
7. 局限性#
7.1 作者明确提出的局限#
【Paper】 论文明确将大规模自回归 video-action 模型的 inference latency 视为部署障碍,即使有 KV cache 与部分去噪也需要异步预测 / 执行。作者还指出新平台需要少量 task-specific post-training 数据,示例是 50 demonstrations。
7.2 自己分析得到的局限#
【Analysis】
- 成本高:5.3B 模型、VAE 与多次 flow integration 仍然昂贵;官方 README 估计 RoboTwin 单卡 offload 评测约需 24GB VRAM。
- 视觉盲区:触觉、力觉和不可见状态未被显式建模,精细接触任务可能受限。
- 异步仍依赖模型:FDM 能修正 stale forecast,但面对执行器延迟、环境突变或模型外移动物体时,前向预测本身也可能出错。
- 可复现边界:官方仓库公开后训练、权重和部署代码,但默认 chunk / sampling steps 与论文报告不同;完整预训练数据与真实实验细节不能只靠当前仓库完全复现。
8. 启发与研究思考#
【Analysis】 LingBot-VA 提出一个直接的设计准则:world model 不必独立充当 planner;把预测状态变化作为 action model 的条件,可让 imagination 对控制拥有明确的学习责任。值得继续检验的方向包括:加入 tactile / force / proprioception 来增强 FDM 的反馈锚点;让模型估计未来 latent 的不确定性,并在不确定时动态缩短 chunk;以及探索统一动作接口在灵巧手、移动底盘和更多 embodiment 间的边界。