Hana's Blog
LingBot-VA 2.0 论文精读:原生视频-动作预训练如何服务通用机器人控制Blur image
Arxiv ID 2607.08639
幻觉翻译 2607.08639
publication pending

LingBot-VA 2.0 从 tokenizer、因果 DiT 到推理系统均按控制需求原生设计,以稀疏 MoE、Multi-Chunk Prediction 和可重落地的异步推理,完成少样本、实时的机器人闭环控制。

推荐指数:

1. 论文概述#

LingBot-VA 2.0 overview from paper Figure 2

一句话总结#

【Paper】 LingBot-VA 2.0 不把通用视频生成器事后“改成”策略,而是原生预训练 video-action foundation model:语义视觉-动作 tokenizer 将状态与动作对齐到共享 latent,因果 DiT 同时预测未来视觉与动作,部署时又用 Foresight Reasoning 将预测计算与真实执行重叠。

核心贡献#

【Paper】

  1. 提出 native video-action pretraining:因果地从零训练完整 stack,避免双向 video backbone 改成因果控制器时的灾难性遗忘。
  2. 用 semantic visual-action tokenizer 同时做视觉语义对齐和无动作标注视频的 latent-action 学习。
  3. 在 video stream 使用 sparse MoE,并用 Multi-Chunk Prediction(MCP)迫使表示预测更远未来的动力学。
  4. 以人类视频作 in-context demonstration,以 human-robot co-training 增加可扩展的 embodiment 数据。
  5. 结合 Foresight Reasoning、consistency distillation 与部署优化,把异步控制频率由 35 Hz 提升至 225 Hz。

2. 背景与相关工作#

【Paper】 VLA 往往直接学 ot,cato_t,c\mapsto a_t;video-action model 则联合学习“未来会看见什么”及“什么动作导致这个未来”。前者从图文预训练继承语义,后者能把连续时间、几何和接触的视觉动力学变成密集监督。

现有 video-action 方法常从面向数字内容生成的 VAE 和双向 video diffusion backbone 出发,再加动作分支。论文指出三种错配:重建 VAE 优化外观而非物理语义;高维 latent 和多步 diffusion 推理难以高频闭环;web video 的通用生成目标没有显式编码动作导致的状态变化。

【Analysis】 本文的主张不只是“视频先验有用”,而是要求表示、时间因果性、计算容量和运行时调度都与控制一致。因此 tokenizer 与异步执行并非外围工程,而被纳入 policy 的设计边界。

3. 问题定义#

【Paper】 将时间压缩后的视觉表示记为 z0:Nz_{0:N},低层控制按相邻 visual latent 的转移聚成 action chunk:

at=utft:(t+1)ft1,t=0,,N1,a_t=u_{tf_t:(t+1)f_t-1},\qquad t=0,\ldots,N-1,

其中 ftf_t 是 tokenizer 时间下采样率。模型的因果分解是:

pθ(z1:N,a0:N1z0)=t=0N1pθ(zt+1zt,a<t)pθ(atzt,a<t,zt+1).p_\theta(z_{1:N},a_{0:N-1}\mid z_0)=\prod_{t=0}^{N-1} p_\theta(z_{t+1}\mid z_{\le t},a_{<t}) p_\theta(a_t\mid z_{\le t},a_{<t},z_{t+1}).

前一项以历史和过去动作预测下一状态;后一项是 inverse dynamics,在给定状态转移后解码本 chunk 动作。ata_t 不是单个电机命令,而是一段与一个 visual transition 对齐的动作块。

4. 方法#

4.1 Overall Architecture#

【Paper】 高层 VLM planner 把长目标变为结构化子任务;semantic tokenizer 将图像、机器人视频和 human-video prompt 映射为 visual/action latent;因果 Mixture-of-Transformers(MoT)共享 attention、分别预测视觉与动作。MCP 在训练时增加远期监督,Foresight Reasoning 在部署时将其接入真实闭环。

4.2 核心模块#

LingBot-VA 2.0 semantic visual-action tokenizer from paper Figure 3

Semantic visual-action tokenizer#

【Paper】 ViT autoencoder 对视频 o1:To_{1:T} 将首帧按 16×1616\times16 patch、后续帧按 4×16×164\times16\times16 tubelet 编码;帧内是 full attention,跨帧是 causal attention。除重建外,冻结的 Perception Encoder GG 提供 clip-level semantic alignment。

冻结 visual tokenizer 后,inverse dynamics model(IDM)从连续 zt,zt+1z_t,z_{t+1} 压缩出 latent action t\ell_t;forward dynamics model(FDM)以 transport map 与 residual 重建下一 latent。因此没有动作标签的 web video 也会成为 action-relevant 表示学习数据。

Causal MoT、MoE 和层次上下文#

【Paper】 video 与 action 分别有前馈 expert,却共享 causal self-attention;video expert 使用 sparse MoE,action expert 保持 dense。主模型有 30 个 blocks、2048 维 video hidden state、768 维 action hidden state、128 个 routed SwiGLU experts 和 top-8 routing;二者在 3072 维 joint attention space 交互。

planner 约以 2 Hz 后台运行,将 doneinstructiongeneration_instructionlocal_scene_description 写入共享 buffer。低层 policy 在 action-chunk 边界读取后三个字段,故 planner 的低频和 latency 不会阻塞控制。

【Analysis】 容量被非对称地分配给承载复杂动力学的 video stream,而共享 attention 保留“动作是视觉转移解释”的耦合;这样比把两个完全独立的预测器拼接更易共同受益于长视频表征。

MCP、ICL 和 human-robot co-training#

LingBot-VA 2.0 Multi-Chunk Prediction from paper Figure 4

【Paper】 MCP 从 main DiT 的特征同时预测后面 1—3 个视觉 chunks,loss 权重为 (0.5,0.2,0.1)(0.5,0.2,0.1)。它只在训练时使用,通常可在部署时删除。

human-video ICL 将语义一致、但场景/视角/对象实例可不同的演示编码为 ziclz_{\mathrm{icl}},将其作为每个 robot chunk 可见的 task prompt。human-robot co-training 则把手的 6-DoF pose 和从手指关节导出的夹爪开度重定向为统一动作布局;world model 共享,动作 encoder/decoder 由人类或机器人本体分别拥有。

4.3 关键公式#

视觉 tokenizer 的联合目标为:

Lvis=λ1oo^1+λpercLperc+λganLganLrec+λalignavg(Walignz)avg(G(o))22.\mathcal L_{\mathrm{vis}}= \underbrace{\lambda_1\lVert o-\hat o\rVert_1+ \lambda_{\mathrm{perc}}\mathcal L_{\mathrm{perc}}+ \lambda_{\mathrm{gan}}\mathcal L_{\mathrm{gan}}}_{\mathcal L_{\mathrm{rec}}} +\lambda_{\mathrm{align}} \left\lVert\operatorname{avg}(W_{\mathrm{align}}z)-\operatorname{avg}(G(o))\right\rVert_2^2.

这里 WalignW_{\mathrm{align}} 将 latent 投影到教师特征空间,avg\operatorname{avg} 是 temporal average pooling。它在保持视觉细节的同时将 latent 拉向 foundation model 的语义。

latent action 与其前后向一致性为:

t=qϕ(zt,zt+1),z^t+1=fψ(zt,t)=Ktzt+δt,\ell_t=q_\phi(z_t,z_{t+1}),\qquad \hat z_{t+1}=f_\psi(z_t,\ell_t)=K_tz_t+\delta_t, L=tz^t+1zt+122+z^tzt22.\mathcal L_\ell=\sum_t\left\lVert\hat z_{t+1}-z_{t+1}\right\rVert_2^2+ \left\lVert\hat z_t-z_t\right\rVert_2^2.

【Paper】 ddim(zt)d_\ell\ll\dim(z_t) 的瓶颈避免 t\ell_t 复制完整状态;KtK_t 负责 token 间的信息搬运,δt\delta_t 解释纯 transport 无法表达的变化。

对 hidden token hh,MoE 的输出为:

MoE(h)=Eshared(h)+iR(h)αi(h)Ei(h),αi(h)=γri(h)jR(h)rj(h).\operatorname{MoE}(h)=E_{\mathrm{shared}}(h)+ \sum_{i\in\mathcal R(h)}\alpha_i(h)E_i(h),\qquad \alpha_i(h)=\gamma\frac{r_i(h)}{\sum_{j\in\mathcal R(h)}r_j(h)}.

其中 ri(h)=σ(gih)r_i(h)=\sigma(g_i^\top h) 为 router score,R(h)\mathcal R(h) 是 group-limited top-kk expert 集合,γ\gamma 为缩放系数。论文用 auxiliary-loss-free balancing 根据实际 token load 更新 selection bias,而不是给主 diffusion loss 添加额外均衡梯度。

4.4 Training#

【Paper】 先训练 tokenizer,后在共享 latent 空间预训练 causal video-action model。后阶段并非严格串行 curriculum:T2I、T2V、TI2VA、ICL、HCT 五个任务持续共同优化,只改变采样比例;早期偏 T2I、中期偏 T2V、后期偏 video-action,保留较小的早期任务比例防止遗忘。

主目标采用 rectified-flow / flow-matching MSE。chunk size 每步在 1—4 latent frames 之间重采样,attention window 在 1—64 chunks 间变化;以 0.5 概率为历史加小噪声,缓解 autoregressive exposure bias。优化器为 Muon(Transformer block 内二维权重,lr 2×1032\times10^{-3})和 AdamW(其余参数,lr 10410^{-4})的混合,warm-up 2000 steps,global gradient norm clip 为 1。

Algorithm 1 LingBot-VA 2.0 原生预训练
输入:
图像/视频、机器人轨迹、可选 human-video ICL 对、语言与本体标签
输出:
语义 tokenizer 与因果视频-动作 policy θ\theta
  1. 训练 visual tokenizer 的重建与语义对齐;冻结它后,以 IDM/FDM 学习相邻 latent 的 \ell

  2. 按训练进度采样 T2I、T2V、TI2VA、ICL 或 HCT batch,编码成共享 visual-action latent。

  3. 对未来视觉与动作 target 加噪,用 causal MoT 的 teacher-forced history 预测 velocity。

  4. 联合最小化视觉/动作 flow-matching 与 MCP 多 horizon loss;人机数据选择相应动作 I/O head。

  5. 使用 Muon + AdamW 更新,并保留早期任务的非零采样比例。

4.5 Inference#

LingBot-VA 2.0 Foresight Reasoning from paper Figure 5

【Paper】 Foresight Reasoning 同步维持 execution stream 与 prediction stream。机器人执行 ata_t 时,模型从真实观测已校正的 cache CtC_t 出发,先基于当前动作预测 z^t+1\hat z_{t+1},再以它预取 at+1a_{t+1};真实 ot+1o_{t+1} 到达后会被编码为 zt+1z_{t+1} 并覆盖 cache 中的 imagined latent。即在隐藏预测延迟的同时避免持续自回归变为 open loop。

Algorithm 2 Foresight Reasoning 闭环控制
输入:
观测编码、当前 action chunk、语言/子任务上下文、KV cache
输出:
执行中的 ata_t、预取的 at+1a_{t+1} 与重落地 cache
  1. 冷启动:将真实 observation 写入 cache,生成并执行首个 action chunk。
  2. 执行 ata_t 时,将其附加到反馈校正的 CtC_t,以 video expert 预测 z^t+1\hat z_{t+1}
  3. Ct{at,z^t+1}C_t\cup\{a_t,\hat z_{t+1}\} 上解码 at+1a_{t+1},使其在本 chunk 结束前就绪。
  4. 收到真实 ot+1o_{t+1} 后,以其 latent 覆盖 z^t+1\hat z_{t+1},再开始下一轮。

【Paper】 post-training 把 video 5-step、action 10-step 的 PF-ODE sampler distill 到各 2 steps,并结合 FP8 TensorRT、paged/ragged KV cache、FlashInfer attention plugin 和 runtime caching。论文报告异步 chunk latency 从 BF16 PyTorch baseline 的 927 ms 下降至 142 ms;每个 chunk 含 32 个低层控制步。

4.6 代码实现对照#

【Code】 官方项目页为 LingBot-VA 2.0。截至本文撰写时,论文 arXiv 页面、论文源码和项目页均未提供 LingBot-VA 2.0 的训练/推理公开仓库。因此不能将文中的 TensorRT、FlashInfer、FSDP、Muon 或 planner 写成可核验的具体文件和配置。

【Analysis】 本文对架构和超参数只以论文为据。特别是 225 Hz 依赖专门的 FP8 编译与运行时优化,不能由模型参数规模推断为任意 PyTorch 环境可复现的吞吐。

5. 实验#

5.1 Experimental Setup#

【Paper】 RoboTwin 2.0 双臂 benchmark 使用 2,500 条 clean demonstrations(50/task)和 25,000 条 domain-randomized demonstrations(500/task)进行多任务训练,比较 X-VLA、π0.5\pi_{0.5}、Motus 与 LingBot-VA。

real-world benchmark 包括 Fruit Sorting、Pen Collection、Drawer Tidying、Plate Handover;每任务 20 条 teleoperated demonstrations,训练的是一个跨任务 generalist policy。ICL 实验以四个已见盘子放置任务、每任务 15 条 demonstrations 微调,再测试人类 reference video 对未见对象—目标组合的迁移。

5.2 Main Results#

LingBot-VA 2.0 real-world results from paper Figure 7

【Paper】 RoboTwin success rate(%)为:

方法CleanRandomizedAvg.
X-VLA72.972.872.9
π0.5\pi_{0.5}82.776.879.8
Motus88.787.087.9
LingBot-VA92.991.692.2
LingBot-VA 2.093.893.493.6

相对 π0.5\pi_{0.5} 的平均提升为 13.8 points,相对上一代 LingBot-VA 为 1.4 points(均按表中四舍五入值计算)。真实机器人柱状图中,LingBot-VA 2.0 在四个任务的 success rate 与 progress rate 都高于图示的 LingBot-VA 1.0、π0.5\pi_{0.5};正文未提供柱状图的原始精确数值,故不将视觉读数写成精确百分比。

5.3 Ablation Study#

【Paper】 在相同 1.3B video-action architecture 与 token budget 下,语义 tokenizer 相比 WAN2.2 VAE 的 RoboTwin 结果为:

指标WAN2.2 VAE Easy / Hard本文 tokenizer Easy / Hard
Horizon 1 average81.1 / 78.486.2 / 83.1
Horizon 2 average75.5 / 73.985.7 / 84.0
Horizon 3 average67.2 / 68.092.0 / 85.4
50 tasks average78.0 / 76.086.6 / 83.1

MCP 消融在 12 fps 和 50 fps 都更快收敛、最终更高。在 50 fps randomized setting,MCP 5k steps 时领先 29.7 points,且用 20k steps 达到 baseline 45k steps 的精度,即约 2.3×2.3\times 训练加速。

推理优化的累积结果为:927 ms / 35 Hz(BF16 PyTorch),466 ms / 69 Hz(+ consistency distillation),369 ms / 87 Hz(+ compiled low precision),272 ms / 118 Hz(+ long-horizon attention),最终 142 ms / 225 Hz(+ runtime overhead reduction)。

5.4 Generalization#

【Paper】 ICL 只训练四个见过的物体—盘子任务后,给定 human reference video 和当前机器人观察,可展示把 calabash 放到 green plate、把 white paper cup 放到 silver plate 等未见组合;论文将其作为定性 rollout 展示,未报告该设置的汇总成功率。

【Analysis】 它泛化的是 procedure 和组合关系,并非无条件解决所有物理差异。human video 给出比语言更细的时序提示,但落地仍要依赖当前 robot observation 及本体专属动作接口。

6. 方法分析#

6.1 为什么有效?#

【Analysis】 tokenizer 将“可重建”扩展为“语义对齐、可由状态转移解释”;因果训练使 offline pretraining 的依赖结构与 online control 对齐;MCP 使当前表示必须容纳更远的因果后果,而非靠局部外观复制下一帧。Foresight 的价值则不只是并行,而是用真实 observation 周期性切断预测误差链。

6.2 核心创新#

【Paper】 语义视觉-动作 tokenizer、从头 causal video-action DiT、sparse MoE video stream、MCP、human-video ICL/human-robot co-training 与 Foresight Reasoning 构成完整的 native stack;作者的贡献在于把这些围绕 embodied control 的需求一起设计。

6.3 与已有方法的本质区别#

维度通用视频生成器再适配LingBot-VA 2.0
tokenizer像素/感知重建重建 + 语义对齐 + latent action
时间结构常见先双向预训练、再改因果从头因果预训练
可扩展监督主要依赖 robot action dataweb image/video、latent action、robot/human data
长程信号next chunk 易被外观连续性解决MCP 监督 1—3 个未来 chunks
实时闭环串行生成或持续 imagined rollout预测/执行重叠,真实观察重落地

6.4 关键假设#

【Analysis】 它假设被动视频中由 IDM/FDM 提取的 latent transition 接近控制相关 action,semantic alignment 不会丢失触觉或力控关键信息,手到夹爪的重定向保留跨本体语义,且真实 observation 足够及时地修正 cache。面对强接触、不可观测状态、视觉遮挡或高系统延迟,这些假设会更脆弱。

7. 局限性#

7.1 作者明确提出的局限#

【Paper】 planner 和 policy 仍是分开训练、通过固定接口耦合;latent action 来自被动视频,交互或 reinforcement signal 可能更贴近控制;还需扩展预训练数据、sparse backbone 与本体种类,当前重点是双臂操作。

7.2 自己分析得到的局限#

【Analysis】 15.3B 总参数模型的 225 Hz 来自重型硬件/编译栈,且本版尚无官方公开代码,外部复核较困难。相对上一代 1.4 points 的 RoboTwin 增益也应与新增系统复杂度一同看待。最后,重落地能纠正可见的状态误差,却无法观测抓取滑移、力或被遮挡物体的内部状态。

8. 启发与研究思考#

【Analysis】 这篇论文的启发不是单纯“给 policy 加 MoE”,而是将 action representation、world modeling 与运行时调度放进同一训练—部署闭环。值得检验的下一步包括:把 tactile/force 也做成可预测、可重落地的 latent;让 planner boundary 与 MCP horizon 联合优化;在多本体、latency-matched 的公开 benchmark 上同时报告 active parameters、端到端延迟、能耗和成功率。

LingBot-VA 2.0 论文精读:原生视频-动作预训练如何服务通用机器人控制
https://agusexp25.top/en/blog/paper-deep-dive-lingbot-va-2
Author 菊花花
Published at August 26, 2026