Hana's Blog
TouchWorld 论文精读:让触觉既能预测未来,也能实时纠错Blur image
Arxiv ID 2607.07287
幻觉翻译 2607.07287
publication pending

TouchWorld 将慢速任务分解、触觉未来预测、中速动作块生成与高速触觉残差控制解耦,在六个真实灵巧操作任务上显著提升干净与受扰成功率。

推荐指数:

1. 论文概述#

【Paper】《TouchWorld: A Predictive and Reactive Tactile Foundation Model for Dexterous Manipulation》来自哈尔滨工业大学(深圳)与 PHANES AI。论文的核心判断是:触觉不应该只是 VLA 的一个低频输入 token,而应同时扮演“预测接触目标”和“快速闭环纠错”两种角色。

TouchWorld 系统概念总览(论文 Figure 1)

一句话总结#

【Analysis】 TouchWorld 把一个容易互相干扰的单环控制器拆成三种时间尺度:1 Hz 的语义规划与触觉子目标预测、10 Hz 的视觉-触觉动作块生成、30 Hz 的触觉残差修正;这样既保留 VLA 的长程语义能力,又能在滑移、错位和力不匹配发生时迅速回到可执行轨迹。

核心贡献#

【Paper】

  1. 提出包含 Subtask Planner 与 Tactile World Model 的 High-Level Planning Layer,输出可执行子任务和未来视觉-触觉子目标。
  2. 提出 Visuo-Tactile Goal-Conditioned Policy,以 flow matching 的 Diffusion Transformer 生成名义动作块。
  3. 提出 Tactile-Conditioned Refinement Policy(Tactile Residual Transformer,TRT),在高频触觉历史上预测局部残差。
  4. 建立六任务真实机器人 benchmark;平均成功率在 clean setting 为 65.0%,在人为扰动下为 53.7%,相对最强基线分别提升 15.7 和 18.5 个百分点。

2. 背景与相关工作#

【Paper】 视觉和语言擅长回答“要做什么、物体在哪里”,却难以直接观测接触力、滑移、抓握稳定性或插入是否卡住。灵巧操作因此天然是一个 multi-timescale control 问题:语义阶段变化慢,动作块生成居中,而接触状态变化可能需要毫秒级响应。

现有 VLA 通常在一个 monolithic loop 中同时做任务推理、动作生成和反馈;已有 tactile policy 也常把触觉当作和图像同频的附加输入。论文认为这会造成两个错配:慢速语义推理占用快速控制容量,低频动作刷新又来不及应对局部接触变化。TouchWorld 的思路与 slow-fast visual-tactile policy、Diffusion Policy 和通用 VLA 互补,但显式增加了“未来触觉目标”与“残差反馈”两条路径。

3. 问题定义#

【Paper】 给定任务指令 \ell、多视角图像 ItI_t、本体状态 sts_t、触觉观测 XtX_t 和高层记忆 mtm_t,系统要输出当前执行动作 ata_t。四个策略模块满足:

tsub=πsubtask(,It,mt),gt=πworld(,tsub,It,Xt),\ell_t^{sub}=\pi_{subtask}(\ell,I_t,m_t), \quad g_t=\pi_{world}(\ell,\ell_t^{sub},I_t,X_t), (A^t:t+H1,ct)=πgoal(,tsub,gt,It,st,Xt),(\hat A_{t:t+H-1},c_t)=\pi_{goal}(\ell,\ell_t^{sub},g_t,I_t,s_t,X_t), A~τ:τ+W1=πtactile(A^τ:τ+W1,sτk:τ,Xτk:τ,ct).\tilde A_{\tau:\tau+W-1}=\pi_{tactile}(\hat A_{\tau:\tau+W-1},s_{\tau-k:\tau},X_{\tau-k:\tau},c_t).

其中 HH 是名义动作块长度,WW 是 TRT 的 look-ahead 窗口,kk 是反馈历史长度。论文的实现使用 H=32H=32W=16W=16、每次提交 C=4C=4 个修正动作。

机器人平台是配备 Wuji dexterous hands 与 JQ-Industries tactile glove 的 humanoid platform;遥操作侧使用 Meta Quest headset、Touch Plus controllers 和 Wuji Glove。任务包括 Water Flower、Tabletop Clearing、Cup Insertion、Power Plug Insertion、Pot Wiping、Tissue Pulling,并各自设置 clean 与 human perturbation 两种条件。

4. 方法#

4.1 Overall Architecture#

TouchWorld 三层架构(论文 Figure 2)

【Paper】 数据流是“任务指令与观测 → 子任务和触觉子目标 → 名义动作块 → 触觉残差动作”。三层分别以 1 Hz、10 Hz、30 Hz 更新,模块之间通过子任务文本、goal image / goal tactile 与 context token 传递信息。

4.2 核心模块#

High-Level Planning Layer#

  • Subtask Planner:输入任务指令、当前图像和记忆,输出 {原始任务, executable subtask, 可选 reasoning}。记忆保存前序子任务、子目标与执行状态,帮助模型识别阶段转换。
  • Tactile World Model(TWM):根据当前视觉-触觉状态和子任务预测短期 visual-tactile clip 或 terminal tactile goal。只有在子任务改变或任务状态显著变化时刷新,稳定阶段复用已有目标。

【Analysis】 这一层不直接输出关节控制量,而是把长时程问题压缩为下游策略可消费的“当前阶段”和“预期接触结果”。

Visuo-Tactile Goal-Conditioned Policy#

输入包含全局任务、当前子任务、RGB 图像、image-form tactile、proprioception 和 TWM 的 goal image / tactile latent;输出长度为 HH 的 nominal action chunk。原始触觉被渲染或归一化为图像,使 VLA backbone 可以沿用图像-语言预训练接口;Diffusion Transformer action expert 用 flow matching 从噪声生成动作序列。

Tactile-Conditioned Refinement Policy#

TRT 输入名义动作的长度 WW look-ahead 窗口、最近 kk 步本体与触觉历史以及 VLA context token,输出同长度残差。图像触觉使用 tactile-image encoder,矩阵读数使用卷积层,低维触觉状态使用 Fourier features 与 MLP;不同模态随后由 residual Transformer 融合。

4.3 关键公式#

TRT 的残差定义为:

ΔAτ:τ+W1=fϕ(A^τ:τ+W1,sτk:τ,Xτk:τ,ct),\Delta A_{\tau:\tau+W-1}=f_\phi(\hat A_{\tau:\tau+W-1},s_{\tau-k:\tau},X_{\tau-k:\tau},c_t), A~τ:τ+W1=A^τ:τ+W1+ΔAτ:τ+W1.\tilde A_{\tau:\tau+W-1}=\hat A_{\tau:\tau+W-1}+\Delta A_{\tau:\tau+W-1}.

【Paper】 fϕf_\phi 只需学习示范高频动作与名义动作之差,而不是重新学习完整任务策略。训练目标为:

Lfb=fϕ()(Aτ:τ+W1A^τ:τ+W1)22,\mathcal L_{fb}=\left\|f_\phi(\cdot)-\left(A^*_{\tau:\tau+W-1}-\hat A_{\tau:\tau+W-1}\right)\right\|_2^2,

其中 AA^* 是示范动作,损失只施加在触觉敏感的 residual action subspace;其余维度继续采用名义输出。

4.4 Training#

【Paper】 训练分四阶段,且不对整个层级端到端反向传播:

  1. 用 128,866 条带子任务标签和记忆变体的 teleoperation 记录微调 Qwen3-VL-4B-Instruct Subtask Planner。
  2. 先在 EgoTouch 人类双手触觉视频上预训练 Wan2.2-TI2V-5B,再用 10 小时机器人示范(约 108 万帧、30 FPS)微调 TWM;每个样本预测 384×224 分辨率的 17 帧未来 visual-tactile clip。
  3. 用全局任务、子任务、视觉、图像触觉、本体状态和未来动作块训练 flow-matching nominal policy。
  4. 固定已训练的 nominal policy,接入 TRT,用高频示范动作减去 nominal action 得到 residual target,训练 VLA-refinement stack。
Algorithm 1 TouchWorld 分阶段训练
输入:

带任务、子任务、视觉、触觉、本体状态和动作标注的 teleoperation trajectories。

输出:
Subtask Planner、Tactile World Model、nominal policy 与 TRT。
  1. 按语义更新率采样任务指令、当前观测和记忆,监督子任务标签。
  2. 用人类触觉数据预训练 TWM,再用机器人未来 17 帧目标微调。
  3. 用 flow matching 与 imitation learning 训练名义动作块策略。
  4. 冻结名义策略生成 A^\hat A,以 AA^A^* - \hat A 监督 TRT 残差。

4.5 Inference#

【Paper】 部署时 High-Level Planning Layer 低频刷新子任务和触觉子目标;nominal policy 以 10 Hz 生成动作块;TRT 在 30 Hz 控制循环内用滑动窗口反复修正。每次只提交前 C=4C=4 个动作,随后用新触觉重新预测,因此一个动作块不会锁死后续控制。

Algorithm 2 预测-反应式推理
输入:
任务指令、当前图像、触觉与本体状态、高层记忆。
输出:
执行后的触觉修正动作。
  1. 以 1 Hz 更新 executable subtask;仅在阶段变化时刷新 TWM goal。
  2. 将任务与子任务拼成 prompt,nominal policy 从噪声生成长度 HH 的动作块。

  3. 在每个 30 Hz refinement step 输入长度 WW 的动作窗口和最近触觉历史,预测残差。

  4. 执行修正窗口前 CC 步,读入新反馈后滑动窗口并重复。

4.6 代码实现对照#

论文与项目主页截至本文写作时未公开可访问的官方代码仓库,只有论文、项目主页和 LaTeX 源码。因此没有可核对的 model definition、DataLoader、loss implementation 或 checkpoint 路径;本文关于 1/10/30 Hz、H/W/CH/W/C 和四阶段训练的描述均来自论文正文。【Analysis】 后续若作者公开代码,最值得复核的是 image-form tactile 的具体归一化、TWM 的刷新判据以及 TRT 的 residual action mask。

5. 实验#

5.1 Experimental Setup#

TouchWorld 真实机器人硬件平台(论文 Figure 3)

六个真实机器人任务与扰动设置(论文 Figure 4)

【Paper】 每个任务收集 200 条 teleoperated training trajectories,并进行 100 次真实机器人评估 rollout。基线为 Pi-0.5、FTP-1(无预测-反应层级的单体触觉策略)和 GR00T N1.7。

5.2 Main Results#

方法Clean 平均Human perturbation 平均
Pi-0.540.7%27.7%
FTP-149.3%35.2%
GR00T N1.739.3%26.0%
TouchWorld65.0%53.7%

【Paper】 TouchWorld 在六项任务上均优于三个基线。clean setting 的逐任务成功率为 Water 72、Clearing 76、Cup 66、Plug 45、Wiping 70、Tissue 61;扰动 setting 分别为 60、62、52、35、57、56。提升在插拔、擦拭和软物体拉取等接触密集任务最明显,同时长时程任务也保持优势。

5.3 Ablation Study#

TouchWorld 组件消融(论文 Figure 5)

配置Clean 平均扰动平均移除后说明
Full65.0%53.7%完整层级
w/o Tactile World60.2%51.2%失去未来接触目标
w/o Subtask Planner55.5%46.2%长时程阶段一致性下降
w/o TCR55.3%40.3%在线局部纠错缺失
w/o Tactile43.3%30.0%触觉贡献最大

【Paper】 去掉 tactile input 的退化最大;去掉 TCR 对 human perturbation 尤其敏感,说明预测路径负责“应该接触到哪里”,反应路径负责“实际偏了以后怎么回来”。

5.4 Generalization#

TWM 的 held-out 子目标预测结果如下:

方法Temporal Contact AccuracyContact IoUVolumetric IoU
Current tactile copy70.431.824.6
Nearest-neighbor subgoal77.539.231.0
Tactile World Model86.352.743.8

【Paper】 TWM 不只是复制当前触觉或检索相似轨迹,而是更准确地预测接触发生的时间与终点压力几何。Subtask Planner 分析中,memory-augmented Qwen3-VL-4B 的 subtask accuracy / execution success / transition F1 为 88 / 65 / 82,高于 zero-shot 32B 的 69 / 54 / 71,说明阶段监督与执行记忆比单纯增大模型更关键。

TouchWorld 代表性推理过程(论文 Figure 6)

6. 方法分析#

6.1 为什么有效?#

【Analysis】 第一,TWM 将触觉从“当前状态描述”变为“未来接触参考”,给动作生成提供了比当前帧更稳定的目标。第二,TRT 学习 residual 而非完整 policy,输入短历史即可集中处理滑移、冲击和插入错位。第三,分层频率避免让 1 Hz 的语言推理阻塞 30 Hz 的控制回路。

6.2 核心创新#

论文真正的新意不是单独使用 tactile、world model 或 diffusion,而是把 predictive tactile goal 与 reactive tactile refinement 放在同一策略闭环中,并用子任务记忆把长时程语义接口固定下来。

6.3 与已有方法的本质区别#

单体 VLA 直接从观测到动作;TouchWorld 先决定“当前阶段”和“预期接触结果”,再生成名义动作,最后让触觉残差只修正局部误差。与纯 reactive policy 相比,它提前预测接触;与纯 world model policy 相比,它又保留了高频反馈通道。

6.4 关键假设#

【Paper】 体系假设触觉可以转换到跨人类与机器人共享的 image-form 表示,且短期子目标足以支持当前子任务。【Analysis】 它还隐含假设名义策略已经能完成大部分语义与几何进展,TRT 的局部修正不会改变任务阶段;若名义动作完全错误,残差层可能无力救回。

7. 局限性#

7.1 作者明确提出的局限#

【Paper】 真实评估只有六个任务;TWM 只预测短时域目标;更换触觉传感器或手型需要重新校准与适配数据;固定的更新频率、动作块长度和 commit interval 可能不是所有接触动态的最优选择。

7.2 自己分析得到的局限#

【Analysis】 四阶段训练减少了优化耦合,却也可能造成模块接口的分布偏移:TWM 预测误差、planner 选错子任务和 nominal policy 的动作误差会层层传递。另一个风险是 image-form tactile 牺牲了部分原始力信号的物理可解释性;论文尚未报告跨传感器、跨手型或大规模未见任务的 zero-shot 迁移。

8. 启发与研究思考#

TouchWorld 给出的研究路线可以概括为“语义慢、动作中、反馈快”,但更重要的是明确每个时间尺度的责任边界:Planner 负责阶段,World Model 负责目标,nominal policy 负责进展,TRT 负责纠偏。后续值得探索三点:

  1. 让 TWM 输出带不确定性的多个 tactile goals,并由策略在线选择,而不是只预测单一未来。
  2. 根据接触事件自适应调整 1/10/30 Hz 调度和 commit interval,在平稳运动时省算力、在冲击时提高反馈率。
  3. 用统一的 tactile latent 和 action residual mask 做跨传感器、跨 embodiment 迁移,验证“预测-反应”分解是否比重新训练整套 VLA 更可扩展。
TouchWorld 论文精读:让触觉既能预测未来,也能实时纠错
https://agusexp25.top/en/blog/paper-deep-dive-touchworld
Author 菊花花
Published at August 26, 2026