Hana's Blog
DexUMI 论文精读:用人手作为通用灵巧操作接口Blur image
Arxiv ID 2505.21864
幻觉翻译 2505.21864
publication pending

DexUMI 用针对目标机器人手的可穿戴外骨骼收集带触觉的人类示教,再用视觉适配把人手视频变成机器人视角,从而跨手型学习灵巧操作。

推荐指数:

1. 论文概述#

【Paper】《DexUMI: Using Human Hand as the Universal Manipulation Interface for Dexterous Manipulation》把 embodiment gap 拆成 action/kinematic gap 与 visual gap,分别用硬件和软件适配处理:外骨骼约束人手运动并记录编码器、腕姿态、视觉和触觉;离线流水线再把人手区域替换成目标机器人手。

DexUMI 从人类示教到不同机器人手执行的总览(论文 Teaser)

一句话总结#

【Analysis】 DexUMI 的关键不是训练更大的策略,而是让示教数据在采集时就“长得像”目标机器人:外骨骼提供可迁移动作,同位相机和同型触觉保持观测一致,最后再做机器人手视觉合成。

核心贡献#

【Paper】

  1. 为目标机器人手优化可穿戴外骨骼,使指尖 workspace 匹配且保持可穿戴性。
  2. 集成关节编码器、iPhone ARKit、腕下 OAK-1 相机和触觉传感器,直接记录动作与观测。
  3. 用 SAM2、ProPainter 和动作回放构造机器人视角示教视频,并处理遮挡。
  4. 在欠驱动 Inspire Hand 和全驱动 XHand 的四类任务上达到约 86% 平均阶段成功率,采集吞吐量是传统 teleoperation 的 3.2 倍。

2. 背景与相关工作#

【Paper】 灵巧手在自由度、连杆、驱动方式、接触面和传感器上差异很大。teleoperation 有空间视角错位且缺少直接触觉;视觉 hand retargeting 又受遮挡和指尖定位误差影响。DexUMI 反过来让人直接与物体交互,再把动作和图像转换到机器人域。

3. 问题定义#

【Paper】 给定目标机器人手的运动学与传感器配置,构造外骨骼和数据处理函数,使示教分布与机器人执行分布接近。

  • 输入:RGB 观测 (o_t)、腕部 6-DoF 位姿、外骨骼关节角和触觉 (f_t)。
  • 输出:长度 (L=16) 的 UR5 相对末端动作与手部动作;Inspire 为 6-DoF,XHand 为 12-DoF。
  • 执行:策略 10 Hz 预测,只执行前 8 步;UR5/Inspire/XHand 分别以 125/10/60 Hz 执行并线性插值。
  • 机器人:12-DoF(6 主动 DoF)Inspire Hand 与 12-DoF 全驱动 XHand。

4. 方法#

4.1 Overall Architecture#

DexUMI 的硬件适配架构(论文 Figure 2)

【Paper】 数据流为“外骨骼示教 → 时间对齐与动作映射 → 机器人手回放 → 人手分割/背景修复/机器人手合成 → DINO-V2 + tactile 的 Diffusion Policy”。部署时只保留机器人侧传感器。

4.2 核心模块#

外骨骼机制与 workspace 优化#

【Paper】 外骨骼参数 (mathbf p) 包括关节位置和连杆长度。目标是匹配指尖在 (SE(3)) 中的运动映射,并以参数边界保证佩戴性和拇指避碰。XHand 可从 URDF 初始化;Inspire 的闭环连杆先用动捕指尖轨迹,再用等 DoF 四连杆拟合。

外骨骼与传感器设计(论文 Figure 2)

传感器与动作映射#

  • 【Paper】 Alps 电阻式编码器测量主动关节,逐关节回归映射为机器人电机值;iPhone ARKit 追踪腕姿;OAK-1 150° DFoV 相机固定在手腕下方;XHand 使用磁式触觉阵列,Inspire 使用 FSR。
  • 【Code】 标定脚本为 real_script/teleoperation/calibrate_inspire_mapping.pycalibrate_xhand_mapping.py

软件适配#

视觉适配流水线:分割、背景修复与机器人手合成(论文 Figure 3)

【Paper】 (1) SAM2 分割人手/外骨骼;(2) ProPainter 修复被删背景;(3) 回放同一组动作录制机器人手视频并再次分割;(4) 用两种 mask 的交集进行遮挡感知合成。

【Code】 对应 0_interpolation.py1_replay_hand.py3_segment.py4_inpaint_exo.py5_compose_video.py6_generate_dataset.py,最终写出 Zarr 中的图像、pose、hand_action、proprioception 与 FSR。

Diffusion Policy#

【Paper】 视觉经增强后的 DINO-V2,取 CLS token 与触觉、本体状态拼接,策略预测 16 步 action chunk。手动作可选 absolute 或 relative,腕部始终 relative。

4.3 关键公式#

外骨骼优化目标为:

maxp  S(Wexotip(p),Wrobottip)\max_{\mathbf p}\;\mathcal S(\mathcal W_{\mathrm{exo}}^{\mathrm{tip}}(\mathbf p),\mathcal W_{\mathrm{robot}}^{\mathrm{tip}})

其中指尖 workspace 是所有指尖位姿的集合,外骨骼参数包含关节位置和连杆长度。实现时两侧 workspace 采样并计算最近邻距离;一项鼓励覆盖机器人空间,另一项抑制不可达姿态。【Analysis】 这可看作带边界约束的对称 Chamfer-like workspace 距离。

扩散训练脚本对动作 (a) 加噪并预测噪声:

L=Es,ϵ[ϵϵθ(as,s,ot,ft)22]\mathcal L=\mathbb E_{s,\epsilon}[\lVert\epsilon-\epsilon_\theta(a_s,s,o_t,f_t)\rVert_2^2]

其中 noisy action 是第 (s) 步的加噪动作,视觉与本体输入在 (o_t),触觉输入为 (f_t)。【Code】 train_diffusion_policy.py 明确生成 timestepsnoisy_actions 并调用模型计算 loss。

4.4 Training#

【Paper】 每任务训练 400 epochs;轨迹数为 Cube 310、Egg Carton 175、Tea 400、Kitchen 370 加 100 条 knob-only。Inspire/XHand 分别以 45/30 FPS 记录,按传感器延迟对齐、插值并下采样 3 倍。

【Code】 训练入口使用 Hydra、Accelerate 和可选 EMA;数据 batch 包含 camera_0actionproprioceptionfsr。优化器、noise scheduler 和 checkpoint 由配置实例化。

Algorithm 1 DexUMI policy training
输入:
时间对齐后的视觉、触觉、本体状态与 16 步动作序列
输出:
Diffusion Policy checkpoint
  1. 对轨迹插值、归一化并下采样。
  2. 增强图像,提取 DINO-V2 CLS,并拼接触觉/本体状态。
  3. 随机采样扩散步并给动作加噪,预测噪声。
  4. 反向传播更新策略与视觉 backbone,保存 checkpoint。

4.5 Inference#

【Code】 eval_xhand.pyeval_inspire_hand.py 每 100 ms 采集观测并生成 16 步 chunk,只执行前 8 步。relative 手动作加到当前电机值;XHand 维护 virtual current motor position,减小外力造成的读数漂移。

Algorithm 2 DexUMI policy inference
输入:
机器人相机帧、触觉、本体状态与 checkpoint
输出:
插值后的 UR5 与灵巧手动作
  1. 读取并预处理视觉、触觉和本体观测。
  2. 扩散采样得到未来 16 步动作。
  3. 将 relative 手动作累加到当前(或 virtual)电机状态。
  4. 执行前 8 步并插值到硬件频率。

4.6 代码实现对照#

【Code】 官方仓库还包含 STM32 固件、FSR/编码器驱动、动作回放和完整数据生成脚本。视觉适配是离线脚本链,不是端到端生成模型;机器人手视频必须真实回放采集,这是复现时的硬件前置条件。

5. 实验#

5.1 Experimental Setup#

Cube、Egg Carton、Tea 与 Kitchen 四类任务(论文 Figure 4)

【Paper】 每任务评估 20 个 episode,并复用各方法的初始物体配置。Cube 测试精确抓取;Egg Carton 测试多指协同;Tea 要求用镊子夹茶叶;Kitchen 包含关火旋钮、搬锅、抓盐和撒盐。

5.2 Main Results#

相对/绝对手动作与触觉对比(论文 Figure 5)

【Paper】 完整系统在 Inspire 的 Cube/Carton/Tea(tool、leaf) 上为 1.00/0.85/1.00/0.85;XHand Tea 为 1.00/0.85,Kitchen 的 knob/pan/salt 为 0.95/0.95/0.75。摘要报告平均成功率约 86%。

5.3 Ablation Study#

【Paper】 去掉软件适配后,Raw/Mask 在 Inspire 上明显下降:Cube 从 1.00 变为 0.20/0.60,Carton 从 0.85 变为 0.05/0.10。absolute 手动作也更脆弱;Inspire Tea leaf 在带触觉时为 0.00,而 relative 为 0.85。触觉收益取决于任务,XHand 抓盐有明显帮助,但镊子任务受噪声和弱力信号影响。

5.4 Generalization#

DexUMI 的数据采集效率对比(论文 Figure 6)

【Paper】 15 分钟采集实验显示,DexUMI 虽比裸手慢,但 collection throughput 是 teleoperation 的 3.2 倍;两种手型都能完成精细、接触丰富和长时序任务。

6. 方法分析#

6.1 为什么有效?#

【Analysis】 外骨骼把人类动作投影到机器人可达域;同位相机/同型触觉使输入语义一致;relative action 允许策略持续修正接触误差;视觉合成则消除训练时的人手外观。

6.2 核心创新#

【Analysis】 真正的创新是 interface co-design:机制、传感器、数据生成和 action space 一起设计。单独 retargeting 或 inpainting 都不能同时保证接触动力学和遮挡一致。

6.3 与已有方法的本质区别#

【Paper】 teleoperation 传递远程控制,DexUMI 让人直接操作物体再离线转换;视觉 retargeting 依赖指尖追踪,DexUMI 读取编码器和触觉;普通 imitation learning 不处理 embodiment gap,而 DexUMI 先在数据层处理它。

6.4 关键假设#

【Analysis】 方法假设指尖 workspace 足以代表主要接触几何、腕下相机能固定、机器人手形状可由动作回放得到。移动相机、掌面接触主导或软物体任务会削弱这些假设。

7. 局限性#

7.1 作者明确提出的局限#

【Paper】 每种机器人手仍需单独优化外骨骼;当前只匹配指尖 workspace。3D 打印变形会让编码器失真,FSR 对安装敏感,XHand 触觉高压后会漂移。视觉流水线依赖真实机器人手回放,inpainting 可能模糊且要求相机刚性安装。

7.2 自己分析得到的局限#

【Analysis】 86% 平均成功率来自每任务 20 次、有限初始状态,尚不足以证明跨物体、跨操作者和跨相机泛化。每条示教都要占用目标手回放,数据生成吞吐量也受硬件数量限制;SAM2 固定 prompt 在不同背景下可能失效。

8. 启发与研究思考#

【Analysis】 对 VLA/模仿学习而言,扩大模型前应先检查训练与部署的 observation/action 是否等价。未来可把 workspace 优化扩展到接触 patch 和力闭环,用动作条件生成模型替代真实手回放,并学习对相机位姿变化不敏感的视觉表征。

DexUMI 论文精读:用人手作为通用灵巧操作接口
https://agusexp25.top/blog/paper-deep-dive-dexumi
Author 菊花花
Published at August 27, 2026