Hana's Blog
OmniVTA 论文精读:视觉-触觉世界模型驱动的接触丰富操作Blur image
Arxiv ID 2603.19201
幻觉翻译 2603.19201
publication pending

OmniVTA 用可预测的视觉-触觉世界模型规划接触演化,再用 60Hz 触觉反射控制器修正偏差,在六类接触丰富任务上同时提升成功率、泛化和抗扰性。

推荐指数:

1. 论文概述#

论文名称:《OmniVTA: Visuo-Tactile World Modeling for Contact-Rich Robotic Manipulation》

作者:Yuhang Zheng、Songen Gu、Yupeng Zheng、Weize Li、Yujie Zang、Shuai Tian、Xiang Li、Ce Hao、Chen Gao、Si Liu、Haoran Li、Yilun Chen、Shuicheng Yan、Wenchao Ding

机构:National University of Singapore、CASIA、Fudan University、TARS Robotics、Tsinghua University、Zhongguancun Academy、Beihang University

论文 / 代码 / 项目arXiv · GitHub · Project Page · OmniViTac Dataset

一句话总结#

【Paper】 OmniVTA 把接触丰富操作拆成“慢速预测规划 + 快速触觉反射”两条环路:先由双流 Visuo-Tactile World Model 预测未来短时接触,再由 Adaptive Fusion Policy 生成动作块,最后用 60Hz Reflexive Latent Tactile Controller 根据预测与观测的差异做单步修正。

核心贡献#

【Paper】

  1. 发布 OmniViTac,一个包含 21,879 条视觉-触觉-动作对齐轨迹、86 个任务、126 个对象的真实世界数据集,并按接触物理归纳为 Wiping、Peeling、Cutting、Grasping、Assembly、Adjustment 六类模式。
  2. 提出 TactileVAE:以 3D marker displacement 为输入,用时空 3D 卷积压缩触觉信号,再用 implicit neural representation 连续重建形变场。
  3. 提出 VTWM:用两个并行的时空 diffusion transformer 建模视觉和触觉未来,并通过共享条件、动态权重和幅值权重强调接触区域。
  4. 提出 AFP 与 RLTC:AFP 用 Latent Tactile Differential 和 gating 自适应调节视觉/触觉比重;RLTC 以 60Hz 输出高频残差动作,闭环恢复接触。
  5. 在真实机器人六类任务上,OmniVTA 在对象多样性、未见高度、未见工具和突发扰动下都优于比较方法。

2. 背景与相关工作#

【Paper】 擦拭、剥皮、切割、插接等任务的困难不只在几何对齐,还在于摩擦、滑移、法向力和接触状态转换。视觉容易被遮挡,也难以直接观测接触力,因此仅靠 RGB 的 visuomotor policy 很难判断“是否已经接触”“接触是否过强”或“是否发生滑移”。

论文认为现有视觉-触觉方法有两个瓶颈:

  • 数据不足:公开数据集通常任务少、轨迹少,且完整对齐的高频触觉-动作数据稀缺。
  • 触觉被动化:多数方法把触觉当作 policy 的附加 observation,而不是显式预测接触动力学;action chunk 又往往开环执行,无法快速处理滑移、错位和外部扰动。

【Analysis】 OmniVTA 的切入点与普通“视觉特征 + 触觉特征拼接”不同:它把触觉变成一个可预测的内部状态,并把预测误差转化为控制信号。这更接近人类的 forward model 加 reflex,而不是单纯扩大 policy 的输入维度。

3. 问题定义#

【Paper】 给定当前与历史视觉观测、触觉观测、机器人本体状态以及历史动作,学习一个策略,输出未来动作块并在接触丰富任务中保持稳定。

项目定义
ObservationRGB-D / RGB 视觉、3D marker displacement 触觉、末端位姿与夹爪状态
视觉频率训练设置为 15Hz;数据采集相机为约 30Hz
触觉频率60Hz(Xense 主传感器)
Action末端相对动作与夹爪状态;world model 使用当前相机平面上的 2D 投影动作作为历史条件
Slow output15FPS 的 6-step action chunk
Fast output60Hz 单步 residual action
RobotUFACTORY xArm7、平行两指夹爪、指尖触觉传感器
Task patternsWiping、Peeling、Cutting、Grasping、Assembly、Adjustment

【Paper】 每个 action chunk 含未来 6 个 coarse actions,执行时插值到 60Hz;预测触觉 latent 的时间压缩为 15Hz,再通过重复插值与 60Hz 控制步对齐。

4. 方法#

4.1 Overall Architecture#

OmniVTA 的 slow-fast 系统架构(论文 Figure 2)

【Paper】 Slow Policy 接收低频视觉、高频触觉和本体状态,由 VTWM 预测接触演化、AFP 生成长时域动作块;Fast Policy 即 RLTC,每 60Hz 比较预测和实际触觉并输出修正量,最终动作是两者的加权和。

【Analysis】 这是一种频率分工:世界模型负责“接下来可能发生什么”,RLTC 负责“现在偏离了多少”。因此高成本的 diffusion rollout 不需要运行在 60Hz,而触觉反馈也不必承担长时域规划。

4.2 核心模块#

TactileVAE:把 marker 位移变成连续触觉 latent#

【Paper】 光学触觉传感器原始图像分辨率高、推理慢。OmniVTA 使用每个 marker 的三维位移 (x,y,z)(x,y,z),将单帧表示为 H×W×3H\times W\times3 张量。Encoder 由 causal 3D convolution、MM 个下采样模块和 projection-out 组成,输出 H/s×W/s×CH/s\times W/s\times C 的时空 latent,其中 s=2Ms=2^M

TactileVAE 的时空编码与隐式形变解码(论文 Figure 4)

Decoder 不重建像素,而是用 implicit neural representation 表示连续形变场:给定空间坐标和 latent 局部特征,MLP 预测该点的三维位移。这样既保留局部接触结构,也能在任意查询坐标上连续重建。

Visuo-Tactile World Model:预测短时接触动力学#

VTWM 与 AFP 的 slow policy 结构(论文 Figure 3)

【Paper】 VTWM 有两个并行分支:视觉分支用 SD-VAE 编码图像,触觉分支用预训练 TactileVAE 编码 marker displacement;两者分别送入 spatial-temporal diffusion transformer,联合生成未来视觉和触觉 latent。

  • Multi-modal Observation Conditioner:分别编码视觉、触觉与历史动作,再映射到共享条件空间,作为两个分支的共同先验。
  • Action representation:每个历史末端位置从 robot base frame 变换到当前 camera frame,再投影到图像平面,得到 2D action condition。论文的消融显示它在未见位置上优于 3D absolute / relative action。
  • Dynamic-aware loss:利用相邻触觉帧差分生成 wdynw_{dyn},强调变化快的空间位置;利用触觉幅值生成 wampw_{amp},强调强接触区域。

Adaptive Visuo-Tactile Fusion Policy:让触觉权重随接触状态变化#

【Paper】 AFP 包括 LTD Encoder、Adaptive Fusion 和 Visuo-Tactile Diffusion Policy。

LTD 对当前触觉 latent ftcf_t^c 和预测触觉 latent ftpf_t^p 做拼接,并显式加入差分:

ft=concat(ftc,ftp,ftpftc)f_t=\operatorname{concat}(f_t^c,f_t^p,f_t^p-f_t^c)

差分项回答的是“未来接触是否正在偏离当前状态”,比简单 concat 更直接地表达潜在接触事件。

接触概率头从 ftf_t 预测未来窗口内的 contact probability,并用触觉形变阈值自动生成 BCE 标签。Gating network 根据 contact logit 与 ftf_t 产生逐通道权重 Wt,WvW_t,W_v,满足 Wt+Wv=1W_t+W_v=1,再与视觉特征 fvf_v、投影后的触觉特征 f~t\tilde f_t 融合:

fvt=concat(Wvfv,Wtf~t)f_{vt}=\operatorname{concat}(W_v\odot f_v, W_t\odot\tilde f_t)

视觉使用当前与历史帧即可;论文发现额外生成未来视觉对成功率提升不明显,却把 slow policy 推理时间从 230ms 增加到 480ms。

Reflexive Latent Tactile Controller:60Hz 残差闭环#

RLTC 的输入输出(论文 Figure 5)

【Paper】 RLTC 输入单帧实测触觉、与当前控制步对齐的预测触觉 latent、历史 delta action 和 delta gripper state,经 LTD 与三层 MLP 输出单步 refined action ara_r。由于 TactileVAE 在时间维压缩 4 倍,当前帧重复 4 次送入 encoder;15Hz 预测 latent 也重复 4 次,对齐 60Hz 反馈。

训练数据由两类片段组成:触觉落在专家均值 ± 标准差之外的 abnormal recovery,以及处于有效分布内的 normal-contact。异常片段的监督是专家恢复动作与 slow action 的 residual,正常片段的目标 residual 为零。

4.3 关键公式#

TactileVAE#

d(x)=Dθ(γ(x),Φ(zt,x))\mathbf d(\mathbf x)=\mathcal D_\theta\bigl(\gamma(\mathbf x),\Phi(\mathbf z_t,\mathbf x)\bigr)

其中 xR2\mathbf x\in\mathbb R^2 为空间坐标,γ\gamma 是 positional encoding,Φ\Phi 从 latent feature map 插值局部特征,Dθ\mathcal D_\theta 输出三维形变。训练目标为:

LTacVAE=d(x)d^(x)22+λKLLKL\mathcal L_{TacVAE}=\|\mathbf d(\mathbf x)-\hat{\mathbf d}(\mathbf x)\|_2^2+\lambda_{KL}\mathcal L_{KL}

VTWM diffusion objective#

Ldiff=E[i(1mi)ϵiϵθ(zo,t)i22]\mathcal L_{diff}=\mathbb E\left[\sum_i(1-m_i)\odot\|\epsilon_i-\epsilon_\theta(\mathbf z_o,t)_i\|_2^2\right]

zo\mathbf z_o 是历史视觉-触觉 observation latent,mim_i 标记已知的条件帧;只有未来帧的噪声预测参与损失。

动态和幅值加权后:

LVTWM=Ldiff+λ1Ldyn+λ2Lamp\mathcal L_{VTWM}=\mathcal L_{diff}+\lambda_1\mathcal L_{dyn}+\lambda_2\mathcal L_{amp}

其中 wdynw_{dyn} 来自 Xi+1Xi2\|X_{i+1}-X_i\|_2wampw_{amp} 来自 Xi2\|X_i\|_2,二者 resize 到 tactile latent 的空间分辨率。

AFP 与 RLTC#

动作 diffusion 从高斯噪声 Ac,TA_{c,T} 反向去噪到 action chunk Ac,0A_{c,0}

Ac,t1=αtAc,tγtϵθ(Ac,t,t,fc)+σtN(0,I)A_{c,t-1}=\alpha_tA_{c,t}-\gamma_t\epsilon_\theta(A_{c,t},t,f_c)+\sigma_t\mathcal N(0,I)

条件 fc=concat(fvt,s)f_c=\operatorname{concat}(f_{vt},s) 包含融合特征与 proprioception。AFP 总损失为 Lact+λctLbce\mathcal L_{act}+\lambda_{ct}\mathcal L_{bce};RLTC 使用:

LRLTC=ara^r22\mathcal L_{RLTC}=\|a_r-\hat a_r\|_2^2

4.4 Training#

【Paper】 训练分四阶段:TactileVAE → VTWM → AFP → RLTC。TactileVAE 使用约 120 万触觉样本、8 张 A100 训练 50 epochs,λKL=106\lambda_{KL}=10^{-6};VTWM 使用 AdamW、学习率 10410^{-4}、100k steps、λdyn=λamp=1\lambda_{dyn}=\lambda_{amp}=1;AFP 训练 250k steps,λct=0.2\lambda_{ct}=0.2;RLTC 使用正常接触与异常恢复片段监督。

训练输入为 2 帧视觉、同一时间窗口内 8 帧触觉、2 个 proprioception observation。Slow policy 以 15Hz 生成 6-step chunk,执行时插值到 60Hz。主要模块参数量为 TactileVAE 1.96M、VTWM 271.57M、AFP 326.89M、RLTC 0.10M,总计 600.52M。

Algorithm 1 OmniVTA Training
输入:
OmniViTac 轨迹、触觉 marker displacement、视觉序列、动作与 proprioception
输出:
TactileVAE、VTWM、AFP 和 RLTC 参数
  1. Stage 1 预训练 TactileVAE,最小化形变重建误差与 KL 正则。
  2. Stage 2

    用历史多模态 latent 与 2D action condition 训练双流 VTWM,联合使用 diffusion、dynamic-aware 与 amplitude-aware loss。

  3. Stage 3

    冻结或加载触觉表示与世界模型,构造 LTD 特征,训练 contact head、gating 和 action diffusion policy。

  4. Stage 4

    从专家轨迹识别 abnormal recovery / normal-contact 片段,监督 RLTC 学习 residual action。

  5. return

    返回 slow planner 与 fast reflex controller 的组合策略。

4.5 Inference#

【Paper】 推理时,VTWM 根据历史视觉、触觉和动作 rollout 未来触觉(以及训练时联合建模的视觉 latent);AFP 只使用当前/历史视觉与预测触觉生成 6-step action chunk;RLTC 在每个 60Hz 控制周期读取实测触觉,与对应预测 latent 比较并输出修正量。最终执行动作可写成:

at=atslow+αatfasta_t=a_t^{slow}+\alpha a_t^{fast}

其中 α\alpha 是预定义的 fast-policy 权重。

Algorithm 2 OmniVTA Inference
输入:
历史视觉/触觉/动作、当前 proprioception、训练好的四个模块
输出:
发送给 xArm7 的 60Hz 动作序列
  1. 用 TactileVAE 与 SD-VAE 编码历史触觉和视觉,构造多模态条件。
  2. VTWM 通过 diffusion denoising 预测未来短时触觉 latent。
  3. AFP 计算 ftcf_t^cftpf_t^pftpftcf_t^p-f_t^c,预测接触概率并生成视觉/触觉 gating 权重。

  4. 动作 diffusion 生成 6-step coarse action chunk,并插值到 60Hz。
  5. 每个 60Hz 周期用当前触觉和 chunk 对齐的预测 latent 运行 RLTC,输出 residual action。

  6. execute

    执行 atslow+αatfasta_t^{slow}+\alpha a_t^{fast},循环直到任务结束。

4.6 代码实现对照#

【Code】 论文项目页列出的官方仓库是 MrSecant/OmniVTA,数据集仓库为 Hugging Face tars-robotics/OmniVitac,硬件仓库为 MrSecant/OmniVTA_Hardware。截至本文检索时,GitHub 代码仓库公开内容只有 LICENSE,没有 model definition、DataLoader、训练脚本、配置、checkpoint 或 inference entrypoint;硬件仓库也无法在无凭据环境中克隆。因此本文的模块接口、损失和超参数均以论文 v3 的 LaTeX 源码为准,不能把它们误写成已验证的代码行为。

【Analysis】 这也意味着目前无法从代码确认例如 diffusion scheduler、网络层数、数据文件格式和动作归一化方式。若后续仓库公开,应优先补充这些“论文—实现”差异。

5. 实验#

5.1 Experimental Setup#

OmniViTac 六类物理接触模式(论文 Figure 6)

【Paper】 OmniViTac 由 xArm7 机器人示教与 TacUMI 手持采集设备共同构建,记录 RGB-D、腕部/第三视角图像、指尖触觉、末端轨迹和夹爪状态。数据采集保持各传感器原生频率,离线按时间戳对齐,时间误差低于 10ms。

六类模式分别对应不同的接触物理:Assembly 关注紧公差与多向力,Cutting 依赖法向力和力骤降,Adjustment 依赖扭转/剪切与滑移,Peeling 和 Wiping 需要持续维持法向压力与切向摩擦,Grasping 则覆盖脆弱物体、透明物体和铰接机构。

真实实验使用 xArm7、平行夹爪与 Xense 触觉传感器;视觉 15Hz、触觉 60Hz。对象多样性评估每个对象 10 次;未见高度每个高度 5 次;未见工具和扰动实验每个设置 10 次。指标是成功率,同时要求任务完成且触觉传感器不损坏。

5.2 Main Results#

六类任务的真实机器人操作结果(论文 Figure 7)

【Paper】 在对象多样性(O)、几何泛化(G)和扰动鲁棒性(P)三种设置中,OmniVTA 的主要成功率如下:

任务OGP
Wipe0.800.580.60
Peel0.550.480.63
Cut0.850.830.60
Assembly0.600.500.40
Grasp0.90
Adjustment0.650.65

作为对照,OmniVTA w/o RLTC 在 Wipe 的 O/G/P 为 0.66/0.40/0.25,在 Cut 为 0.50/0.50/0.20;RDP 在 Wipe 为 0.50/0.38/0.42,在 Cut 为 0.65/0.50/0.43。【Analysis】 这些数字最清楚地说明 RLTC 的价值集中在接触被打断时:它不只是提高平均成功率,而是显著提高重新建立接触的能力。

论文还报告,OmniVTA 接触阶段平均切向形变为 0.35、最大 0.72,而 RDP 平均 0.56、最大 1.1,更容易出现过强接触并损坏传感器。

5.3 Ablation Study#

【Paper】 关键消融结果可以归纳为:

  • 预测触觉长度从 0、2、4 增加到 6 个 latent steps 时,Wipe/Peel 平均成功率从 0.09、0.33、0.38 增至 0.40。
  • 用 contact state 替代完整预测触觉,平均成功率只有 0.37;说明“未来触觉的形状与强度”比一个二值接触标签更有用。
  • LTD 将平均成功率从 0.47 提升到 0.53;在此基础上加入 gating 后达到 0.53,Wipe 从 0.57 提升到 0.66。
  • 加入生成视觉特征后平均为 0.54,提升很小,但 slow policy 推理从 230ms 变成 480ms。
  • VTWM 在未见位置上用 2D action condition 的 L2=0.042L_2=0.042、Cosine=0.91,优于 3D relative(0.056/0.88)和 3D absolute(0.075/0.72)。在已见位置上,dynamic weighting 与 joint generation 将 L2L_2 从 0.041 降到 0.035、Cosine 从 0.90 升到 0.93。

【Analysis】 消融给出一条因果链:更好的触觉 latent → 更准确的未来触觉 → 更合理的 gating → 更稳定的 action chunk;RLTC 则负责把这一条“预测链”在真实执行时拉回传感器观测。

5.4 Generalization#

【Paper】 未见高度实验把 Wipe、Peel、Assembly、Adjustment 的对象放到训练中没有出现的高度;Cut 使用未见过的小刀。OmniVTA 在这些设置下保持较高成功率,尤其 Cut 的几何泛化达到 0.83。扰动实验中突然上下移动对象、破坏当前接触,OmniVTA 仍能通过 RLTC 快速恢复。

【Analysis】 未见工具仍有效说明策略更依赖触觉反馈和接触动力学,而非记忆训练轨迹的绝对几何。需要注意,这种泛化仍发生在单臂、平行夹爪和六类预定义模式内,不能直接外推到灵巧手或双臂场景。

6. 方法分析#

6.1 为什么有效?#

【Analysis】 接触丰富操作同时包含两个时间尺度:擦拭和插接的整体运动需要长时域一致性,滑移和力骤变却要求毫秒级反应。单一 policy 很难同时覆盖这两个频率。OmniVTA 用 VTWM 提供 feedforward anticipation,用 RLTC 提供 feedback correction;AFP 再根据预测接触概率决定何时相信触觉。

更关键的是,dynamic-aware loss 把训练容量集中在“正在变化”或“接触很强”的区域,避免世界模型被大量静态、无接触帧主导。这与触觉的空间局部性和 contact-driven dynamics 相匹配。

6.2 核心创新#

  1. 数据层:不是只增加轨迹数量,而是用物理接触模式组织数据,让不同任务共享可迁移的接触规律。
  2. 表示层:implicit decoder 把离散 marker 变成连续形变场;LTD 把当前—未来差异显式编码。
  3. 预测层:双流 diffusion world model 联合建模视觉与触觉,而不是把触觉当静态附加通道。
  4. 控制层:slow diffusion planner 与 60Hz tactile reflex controller 组成分层闭环。

6.3 与已有方法的本质区别#

【Paper】 DP、DP+tactile、KineDex、ForceMimic 和 RDP 主要从视觉/触觉直接预测动作,或把力作为辅助输出。OmniVTA 先预测接触未来,再用预测结果调节模态权重与动作,且在执行阶段持续比较预测和观测。

【Analysis】 因此它的基本对象不是“observation → action”,而是“observation → latent contact dynamics → action + residual correction”。这使得触觉同时承担状态估计、未来想象和反馈控制三种职责。

6.4 关键假设#

  • 触觉 marker displacement 足以表达任务所需的接触信息,且可以被低维 latent 保留。
  • 未来短时触觉可以由历史视觉、触觉和动作预测;不必在推理时生成未来视觉。
  • 专家轨迹的触觉均值与标准差能够定义“有效接触分布”,异常状态可用它检测。
  • slow action 与 fast residual 的加权和仍在机器人安全控制范围内。
  • 共享平行夹爪和相近传感器配置能减小 TacUMI 到 xArm7 的 embodiment gap。

7. 局限性#

7.1 作者明确提出的局限#

【Paper】 论文结尾明确指出 OmniViTac 目前面向单臂、夹爪式触觉操作,不包含双臂或灵巧手;未来工作包括扩展更大世界模型、双臂/灵巧手以及跨 embodiment 的视觉-触觉表示迁移。

7.2 自己分析得到的局限#

【Analysis】

  1. 计算开销大:VTWM 与 AFP 合计约 598M 参数;虽然 fast controller 只有 0.10M,但 slow policy 230ms 的延迟仍限制了更高频的重规划。
  2. 传感器依赖明显:训练与真实评测主要使用 Xense,跨传感器结果主要出现在 TactileVAE 表征实验,完整 policy 的跨传感器迁移尚未证明。
  3. 异常定义是分布式的:用均值 ± 标准差检测异常依赖专家数据覆盖;遇到未见材料、磨损传感器或长期漂移时,阈值可能失效。
  4. 世界模型 horizon 较短:预测重点是 24 个解码触觉帧,长时域任务仍依赖 action chunk 和连续重规划,尚未展示长时间闭环误差如何累积。
  5. 代码可复现性暂时不足:截至本文检索时官方代码仓库只有 LICENSE,训练脚本、配置、模型权重和数据处理实现尚未公开,读者无法端到端复现实验。

8. 启发与研究思考#

【Analysis】 OmniVTA 给 VLA / embodied policy 的启发不只限于加入触觉:

  • 把难观测的物理量变成可预测 latent,比把原始传感器直接拼到 policy 更容易形成可解释的控制接口。
  • 预测误差本身就是控制信号。LTD 使用 ftpftcf_t^p-f_t^c,RLTC 使用预测与实测触觉偏差,这是一种通用的 model-based residual control 范式。
  • 多模态融合不应固定权重。接触前视觉负责全局定位,接触中触觉负责局部力学;gating 把这种阶段性先验变成了可学习权重。
  • 数据集的 taxonomy 会影响模型设计。如果只按语义任务划分,Wipe 与 Peel 看似不同;按剪切/法向力等物理模式组织后,它们可以共享接触动力学。
  • 值得继续追问的方向:能否把 60Hz RLTC 扩展为安全约束控制器?能否让世界模型同时预测力、滑移和不确定性?能否用 OmniViTac 的跨传感器数据训练 sensor-invariant tactile token?
OmniVTA 论文精读:视觉-触觉世界模型驱动的接触丰富操作
https://agusexp25.top/en/blog/paper-deep-dive-omnivta
Author 菊花花
Published at August 26, 2026