

OmniVTA 论文精读:视觉-触觉世界模型驱动的接触丰富操作
精读 OmniVTA:从 21,879 条视觉-触觉-动作轨迹出发,用 TactileVAE、双流世界模型、接触感知融合与 60Hz 反射控制解决接触丰富操作。
OmniVTA 用可预测的视觉-触觉世界模型规划接触演化,再用 60Hz 触觉反射控制器修正偏差,在六类接触丰富任务上同时提升成功率、泛化和抗扰性。
1. 论文概述#
论文名称:《OmniVTA: Visuo-Tactile World Modeling for Contact-Rich Robotic Manipulation》
作者:Yuhang Zheng、Songen Gu、Yupeng Zheng、Weize Li、Yujie Zang、Shuai Tian、Xiang Li、Ce Hao、Chen Gao、Si Liu、Haoran Li、Yilun Chen、Shuicheng Yan、Wenchao Ding
机构:National University of Singapore、CASIA、Fudan University、TARS Robotics、Tsinghua University、Zhongguancun Academy、Beihang University
论文 / 代码 / 项目:arXiv ↗ · GitHub ↗ · Project Page ↗ · OmniViTac Dataset ↗
一句话总结#
【Paper】 OmniVTA 把接触丰富操作拆成“慢速预测规划 + 快速触觉反射”两条环路:先由双流 Visuo-Tactile World Model 预测未来短时接触,再由 Adaptive Fusion Policy 生成动作块,最后用 60Hz Reflexive Latent Tactile Controller 根据预测与观测的差异做单步修正。
核心贡献#
【Paper】
- 发布 OmniViTac,一个包含 21,879 条视觉-触觉-动作对齐轨迹、86 个任务、126 个对象的真实世界数据集,并按接触物理归纳为 Wiping、Peeling、Cutting、Grasping、Assembly、Adjustment 六类模式。
- 提出 TactileVAE:以 3D marker displacement 为输入,用时空 3D 卷积压缩触觉信号,再用 implicit neural representation 连续重建形变场。
- 提出 VTWM:用两个并行的时空 diffusion transformer 建模视觉和触觉未来,并通过共享条件、动态权重和幅值权重强调接触区域。
- 提出 AFP 与 RLTC:AFP 用 Latent Tactile Differential 和 gating 自适应调节视觉/触觉比重;RLTC 以 60Hz 输出高频残差动作,闭环恢复接触。
- 在真实机器人六类任务上,OmniVTA 在对象多样性、未见高度、未见工具和突发扰动下都优于比较方法。
2. 背景与相关工作#
【Paper】 擦拭、剥皮、切割、插接等任务的困难不只在几何对齐,还在于摩擦、滑移、法向力和接触状态转换。视觉容易被遮挡,也难以直接观测接触力,因此仅靠 RGB 的 visuomotor policy 很难判断“是否已经接触”“接触是否过强”或“是否发生滑移”。
论文认为现有视觉-触觉方法有两个瓶颈:
- 数据不足:公开数据集通常任务少、轨迹少,且完整对齐的高频触觉-动作数据稀缺。
- 触觉被动化:多数方法把触觉当作 policy 的附加 observation,而不是显式预测接触动力学;action chunk 又往往开环执行,无法快速处理滑移、错位和外部扰动。
【Analysis】 OmniVTA 的切入点与普通“视觉特征 + 触觉特征拼接”不同:它把触觉变成一个可预测的内部状态,并把预测误差转化为控制信号。这更接近人类的 forward model 加 reflex,而不是单纯扩大 policy 的输入维度。
3. 问题定义#
【Paper】 给定当前与历史视觉观测、触觉观测、机器人本体状态以及历史动作,学习一个策略,输出未来动作块并在接触丰富任务中保持稳定。
| 项目 | 定义 |
|---|---|
| Observation | RGB-D / RGB 视觉、3D marker displacement 触觉、末端位姿与夹爪状态 |
| 视觉频率 | 训练设置为 15Hz;数据采集相机为约 30Hz |
| 触觉频率 | 60Hz(Xense 主传感器) |
| Action | 末端相对动作与夹爪状态;world model 使用当前相机平面上的 2D 投影动作作为历史条件 |
| Slow output | 15FPS 的 6-step action chunk |
| Fast output | 60Hz 单步 residual action |
| Robot | UFACTORY xArm7、平行两指夹爪、指尖触觉传感器 |
| Task patterns | Wiping、Peeling、Cutting、Grasping、Assembly、Adjustment |
【Paper】 每个 action chunk 含未来 6 个 coarse actions,执行时插值到 60Hz;预测触觉 latent 的时间压缩为 15Hz,再通过重复插值与 60Hz 控制步对齐。
4. 方法#
4.1 Overall Architecture#

【Paper】 Slow Policy 接收低频视觉、高频触觉和本体状态,由 VTWM 预测接触演化、AFP 生成长时域动作块;Fast Policy 即 RLTC,每 60Hz 比较预测和实际触觉并输出修正量,最终动作是两者的加权和。
【Analysis】 这是一种频率分工:世界模型负责“接下来可能发生什么”,RLTC 负责“现在偏离了多少”。因此高成本的 diffusion rollout 不需要运行在 60Hz,而触觉反馈也不必承担长时域规划。
4.2 核心模块#
TactileVAE:把 marker 位移变成连续触觉 latent#
【Paper】 光学触觉传感器原始图像分辨率高、推理慢。OmniVTA 使用每个 marker 的三维位移 ,将单帧表示为 张量。Encoder 由 causal 3D convolution、 个下采样模块和 projection-out 组成,输出 的时空 latent,其中 。

Decoder 不重建像素,而是用 implicit neural representation 表示连续形变场:给定空间坐标和 latent 局部特征,MLP 预测该点的三维位移。这样既保留局部接触结构,也能在任意查询坐标上连续重建。
Visuo-Tactile World Model:预测短时接触动力学#

【Paper】 VTWM 有两个并行分支:视觉分支用 SD-VAE 编码图像,触觉分支用预训练 TactileVAE 编码 marker displacement;两者分别送入 spatial-temporal diffusion transformer,联合生成未来视觉和触觉 latent。
- Multi-modal Observation Conditioner:分别编码视觉、触觉与历史动作,再映射到共享条件空间,作为两个分支的共同先验。
- Action representation:每个历史末端位置从 robot base frame 变换到当前 camera frame,再投影到图像平面,得到 2D action condition。论文的消融显示它在未见位置上优于 3D absolute / relative action。
- Dynamic-aware loss:利用相邻触觉帧差分生成 ,强调变化快的空间位置;利用触觉幅值生成 ,强调强接触区域。
Adaptive Visuo-Tactile Fusion Policy:让触觉权重随接触状态变化#
【Paper】 AFP 包括 LTD Encoder、Adaptive Fusion 和 Visuo-Tactile Diffusion Policy。
LTD 对当前触觉 latent 和预测触觉 latent 做拼接,并显式加入差分:
差分项回答的是“未来接触是否正在偏离当前状态”,比简单 concat 更直接地表达潜在接触事件。
接触概率头从 预测未来窗口内的 contact probability,并用触觉形变阈值自动生成 BCE 标签。Gating network 根据 contact logit 与 产生逐通道权重 ,满足 ,再与视觉特征 、投影后的触觉特征 融合:
视觉使用当前与历史帧即可;论文发现额外生成未来视觉对成功率提升不明显,却把 slow policy 推理时间从 230ms 增加到 480ms。
Reflexive Latent Tactile Controller:60Hz 残差闭环#

【Paper】 RLTC 输入单帧实测触觉、与当前控制步对齐的预测触觉 latent、历史 delta action 和 delta gripper state,经 LTD 与三层 MLP 输出单步 refined action 。由于 TactileVAE 在时间维压缩 4 倍,当前帧重复 4 次送入 encoder;15Hz 预测 latent 也重复 4 次,对齐 60Hz 反馈。
训练数据由两类片段组成:触觉落在专家均值 ± 标准差之外的 abnormal recovery,以及处于有效分布内的 normal-contact。异常片段的监督是专家恢复动作与 slow action 的 residual,正常片段的目标 residual 为零。
4.3 关键公式#
TactileVAE#
其中 为空间坐标, 是 positional encoding, 从 latent feature map 插值局部特征, 输出三维形变。训练目标为:
VTWM diffusion objective#
是历史视觉-触觉 observation latent, 标记已知的条件帧;只有未来帧的噪声预测参与损失。
动态和幅值加权后:
其中 来自 , 来自 ,二者 resize 到 tactile latent 的空间分辨率。
AFP 与 RLTC#
动作 diffusion 从高斯噪声 反向去噪到 action chunk :
条件 包含融合特征与 proprioception。AFP 总损失为 ;RLTC 使用:
4.4 Training#
【Paper】 训练分四阶段:TactileVAE → VTWM → AFP → RLTC。TactileVAE 使用约 120 万触觉样本、8 张 A100 训练 50 epochs,;VTWM 使用 AdamW、学习率 、100k steps、;AFP 训练 250k steps,;RLTC 使用正常接触与异常恢复片段监督。
训练输入为 2 帧视觉、同一时间窗口内 8 帧触觉、2 个 proprioception observation。Slow policy 以 15Hz 生成 6-step chunk,执行时插值到 60Hz。主要模块参数量为 TactileVAE 1.96M、VTWM 271.57M、AFP 326.89M、RLTC 0.10M,总计 600.52M。
- Stage 1 预训练 TactileVAE,最小化形变重建误差与 KL 正则。
- Stage 2
用历史多模态 latent 与 2D action condition 训练双流 VTWM,联合使用 diffusion、dynamic-aware 与 amplitude-aware loss。
- Stage 3
冻结或加载触觉表示与世界模型,构造 LTD 特征,训练 contact head、gating 和 action diffusion policy。
- Stage 4
从专家轨迹识别 abnormal recovery / normal-contact 片段,监督 RLTC 学习 residual action。
- return
返回 slow planner 与 fast reflex controller 的组合策略。
4.5 Inference#
【Paper】 推理时,VTWM 根据历史视觉、触觉和动作 rollout 未来触觉(以及训练时联合建模的视觉 latent);AFP 只使用当前/历史视觉与预测触觉生成 6-step action chunk;RLTC 在每个 60Hz 控制周期读取实测触觉,与对应预测 latent 比较并输出修正量。最终执行动作可写成:
其中 是预定义的 fast-policy 权重。
- 用 TactileVAE 与 SD-VAE 编码历史触觉和视觉,构造多模态条件。
- VTWM 通过 diffusion denoising 预测未来短时触觉 latent。
-
AFP 计算 、 与 ,预测接触概率并生成视觉/触觉 gating 权重。
- 动作 diffusion 生成 6-step coarse action chunk,并插值到 60Hz。
-
每个 60Hz 周期用当前触觉和 chunk 对齐的预测 latent 运行 RLTC,输出 residual action。
- execute
执行 ,循环直到任务结束。
4.6 代码实现对照#
【Code】 论文项目页列出的官方仓库是 MrSecant/OmniVTA,数据集仓库为 Hugging Face tars-robotics/OmniVitac,硬件仓库为 MrSecant/OmniVTA_Hardware。截至本文检索时,GitHub 代码仓库公开内容只有 LICENSE,没有 model definition、DataLoader、训练脚本、配置、checkpoint 或 inference entrypoint;硬件仓库也无法在无凭据环境中克隆。因此本文的模块接口、损失和超参数均以论文 v3 的 LaTeX 源码为准,不能把它们误写成已验证的代码行为。
【Analysis】 这也意味着目前无法从代码确认例如 diffusion scheduler、网络层数、数据文件格式和动作归一化方式。若后续仓库公开,应优先补充这些“论文—实现”差异。
5. 实验#
5.1 Experimental Setup#

【Paper】 OmniViTac 由 xArm7 机器人示教与 TacUMI 手持采集设备共同构建,记录 RGB-D、腕部/第三视角图像、指尖触觉、末端轨迹和夹爪状态。数据采集保持各传感器原生频率,离线按时间戳对齐,时间误差低于 10ms。
六类模式分别对应不同的接触物理:Assembly 关注紧公差与多向力,Cutting 依赖法向力和力骤降,Adjustment 依赖扭转/剪切与滑移,Peeling 和 Wiping 需要持续维持法向压力与切向摩擦,Grasping 则覆盖脆弱物体、透明物体和铰接机构。
真实实验使用 xArm7、平行夹爪与 Xense 触觉传感器;视觉 15Hz、触觉 60Hz。对象多样性评估每个对象 10 次;未见高度每个高度 5 次;未见工具和扰动实验每个设置 10 次。指标是成功率,同时要求任务完成且触觉传感器不损坏。
5.2 Main Results#

【Paper】 在对象多样性(O)、几何泛化(G)和扰动鲁棒性(P)三种设置中,OmniVTA 的主要成功率如下:
| 任务 | O | G | P |
|---|---|---|---|
| Wipe | 0.80 | 0.58 | 0.60 |
| Peel | 0.55 | 0.48 | 0.63 |
| Cut | 0.85 | 0.83 | 0.60 |
| Assembly | 0.60 | 0.50 | 0.40 |
| Grasp | 0.90 | — | — |
| Adjustment | 0.65 | 0.65 | — |
作为对照,OmniVTA w/o RLTC 在 Wipe 的 O/G/P 为 0.66/0.40/0.25,在 Cut 为 0.50/0.50/0.20;RDP 在 Wipe 为 0.50/0.38/0.42,在 Cut 为 0.65/0.50/0.43。【Analysis】 这些数字最清楚地说明 RLTC 的价值集中在接触被打断时:它不只是提高平均成功率,而是显著提高重新建立接触的能力。
论文还报告,OmniVTA 接触阶段平均切向形变为 0.35、最大 0.72,而 RDP 平均 0.56、最大 1.1,更容易出现过强接触并损坏传感器。
5.3 Ablation Study#
【Paper】 关键消融结果可以归纳为:
- 预测触觉长度从 0、2、4 增加到 6 个 latent steps 时,Wipe/Peel 平均成功率从 0.09、0.33、0.38 增至 0.40。
- 用 contact state 替代完整预测触觉,平均成功率只有 0.37;说明“未来触觉的形状与强度”比一个二值接触标签更有用。
- LTD 将平均成功率从 0.47 提升到 0.53;在此基础上加入 gating 后达到 0.53,Wipe 从 0.57 提升到 0.66。
- 加入生成视觉特征后平均为 0.54,提升很小,但 slow policy 推理从 230ms 变成 480ms。
- VTWM 在未见位置上用 2D action condition 的 、Cosine=0.91,优于 3D relative(0.056/0.88)和 3D absolute(0.075/0.72)。在已见位置上,dynamic weighting 与 joint generation 将 从 0.041 降到 0.035、Cosine 从 0.90 升到 0.93。
【Analysis】 消融给出一条因果链:更好的触觉 latent → 更准确的未来触觉 → 更合理的 gating → 更稳定的 action chunk;RLTC 则负责把这一条“预测链”在真实执行时拉回传感器观测。
5.4 Generalization#
【Paper】 未见高度实验把 Wipe、Peel、Assembly、Adjustment 的对象放到训练中没有出现的高度;Cut 使用未见过的小刀。OmniVTA 在这些设置下保持较高成功率,尤其 Cut 的几何泛化达到 0.83。扰动实验中突然上下移动对象、破坏当前接触,OmniVTA 仍能通过 RLTC 快速恢复。
【Analysis】 未见工具仍有效说明策略更依赖触觉反馈和接触动力学,而非记忆训练轨迹的绝对几何。需要注意,这种泛化仍发生在单臂、平行夹爪和六类预定义模式内,不能直接外推到灵巧手或双臂场景。
6. 方法分析#
6.1 为什么有效?#
【Analysis】 接触丰富操作同时包含两个时间尺度:擦拭和插接的整体运动需要长时域一致性,滑移和力骤变却要求毫秒级反应。单一 policy 很难同时覆盖这两个频率。OmniVTA 用 VTWM 提供 feedforward anticipation,用 RLTC 提供 feedback correction;AFP 再根据预测接触概率决定何时相信触觉。
更关键的是,dynamic-aware loss 把训练容量集中在“正在变化”或“接触很强”的区域,避免世界模型被大量静态、无接触帧主导。这与触觉的空间局部性和 contact-driven dynamics 相匹配。
6.2 核心创新#
- 数据层:不是只增加轨迹数量,而是用物理接触模式组织数据,让不同任务共享可迁移的接触规律。
- 表示层:implicit decoder 把离散 marker 变成连续形变场;LTD 把当前—未来差异显式编码。
- 预测层:双流 diffusion world model 联合建模视觉与触觉,而不是把触觉当静态附加通道。
- 控制层:slow diffusion planner 与 60Hz tactile reflex controller 组成分层闭环。
6.3 与已有方法的本质区别#
【Paper】 DP、DP+tactile、KineDex、ForceMimic 和 RDP 主要从视觉/触觉直接预测动作,或把力作为辅助输出。OmniVTA 先预测接触未来,再用预测结果调节模态权重与动作,且在执行阶段持续比较预测和观测。
【Analysis】 因此它的基本对象不是“observation → action”,而是“observation → latent contact dynamics → action + residual correction”。这使得触觉同时承担状态估计、未来想象和反馈控制三种职责。
6.4 关键假设#
- 触觉 marker displacement 足以表达任务所需的接触信息,且可以被低维 latent 保留。
- 未来短时触觉可以由历史视觉、触觉和动作预测;不必在推理时生成未来视觉。
- 专家轨迹的触觉均值与标准差能够定义“有效接触分布”,异常状态可用它检测。
- slow action 与 fast residual 的加权和仍在机器人安全控制范围内。
- 共享平行夹爪和相近传感器配置能减小 TacUMI 到 xArm7 的 embodiment gap。
7. 局限性#
7.1 作者明确提出的局限#
【Paper】 论文结尾明确指出 OmniViTac 目前面向单臂、夹爪式触觉操作,不包含双臂或灵巧手;未来工作包括扩展更大世界模型、双臂/灵巧手以及跨 embodiment 的视觉-触觉表示迁移。
7.2 自己分析得到的局限#
【Analysis】
- 计算开销大:VTWM 与 AFP 合计约 598M 参数;虽然 fast controller 只有 0.10M,但 slow policy 230ms 的延迟仍限制了更高频的重规划。
- 传感器依赖明显:训练与真实评测主要使用 Xense,跨传感器结果主要出现在 TactileVAE 表征实验,完整 policy 的跨传感器迁移尚未证明。
- 异常定义是分布式的:用均值 ± 标准差检测异常依赖专家数据覆盖;遇到未见材料、磨损传感器或长期漂移时,阈值可能失效。
- 世界模型 horizon 较短:预测重点是 24 个解码触觉帧,长时域任务仍依赖 action chunk 和连续重规划,尚未展示长时间闭环误差如何累积。
- 代码可复现性暂时不足:截至本文检索时官方代码仓库只有 LICENSE,训练脚本、配置、模型权重和数据处理实现尚未公开,读者无法端到端复现实验。
8. 启发与研究思考#
【Analysis】 OmniVTA 给 VLA / embodied policy 的启发不只限于加入触觉:
- 把难观测的物理量变成可预测 latent,比把原始传感器直接拼到 policy 更容易形成可解释的控制接口。
- 预测误差本身就是控制信号。LTD 使用 ,RLTC 使用预测与实测触觉偏差,这是一种通用的 model-based residual control 范式。
- 多模态融合不应固定权重。接触前视觉负责全局定位,接触中触觉负责局部力学;gating 把这种阶段性先验变成了可学习权重。
- 数据集的 taxonomy 会影响模型设计。如果只按语义任务划分,Wipe 与 Peel 看似不同;按剪切/法向力等物理模式组织后,它们可以共享接触动力学。
- 值得继续追问的方向:能否把 60Hz RLTC 扩展为安全约束控制器?能否让世界模型同时预测力、滑移和不确定性?能否用 OmniViTac 的跨传感器数据训练 sensor-invariant tactile token?