Hana's Blog
FastUMI 论文精读:可扩展、硬件无关的通用操作接口Blur image
Arxiv ID 2409.19499
幻觉翻译 2409.19499
publication pending

FastUMI 重新设计 UMI 的硬件与软件,把手持示教、T265 位姿跟踪、跨机器人安装和 ACT/DP 数据处理组成可快速部署的真实操作数据接口。

推荐指数:

1. 论文概述#

【Paper】《FastUMI: A Scalable and Hardware-Independent Universal Manipulation Interface with Dataset》发表于 arXiv(v2,2025 年 2 月),作者来自上海人工智能实验室、上海交通大学、布里斯托大学、复旦大学、香港大学、西交利物浦大学、中国电信等机构。

**【Paper】**本文的目标不是提出一个新的视觉策略,而是解决“策略缺数据”的上游瓶颈:把人类第一视角示教转换成带有精确末端轨迹、夹爪开合和同步视频的机器人数据,并且尽量不绑定某一种机械臂或夹爪。FastUMI 在 UMI 的基础上重做机械结构,以 RealSense T265 直接提供跟踪位姿,配套 ROS 采集和 HDF5/Zarr 转换工具,并公开超过 10,000 条、覆盖 22 个日常任务的示教轨迹。

FastUMI 手持设备与机器人端设备总览(论文 Figure 1)

一句话总结#

**【Analysis】**FastUMI 的关键抽象是“观察视角一致 + 动作坐标可转换”:人手拿着的设备和机器人末端的设备看到近似同一画面,同时 T265、ArUco 标记和 URDF 让同一段示教可落到 TCP 或关节空间。

核心贡献#

【Paper】

  1. 以模块化指尖、ISO 兼容相机支架和相同视角设计,解除对 Weiss WSG-50 等专用夹爪的依赖。
  2. 用商业化 RealSense T265 取代 GoPro-VIO/SLAM 流程,减少标定、坐标变换和部署复杂度,并针对遮挡设计质量检查与回环辅助。
  3. 提供从原始 ROS 数据到 absolute/relative TCP、absolute joint 轨迹的处理链,兼容 ACT 与 Diffusion Policy(DP)。
  4. 针对第一视角数据提出 Smooth-ACT、PoseACT、Depth-Enhanced DP 和动态误差补偿,并在 12 个真实任务上验证。
  5. 开放覆盖 22 个任务的 10,000+ 条轨迹数据集,包含视觉、位姿和夹爪状态。

2. 背景与相关工作#

**【Paper】**真实机器人交互数据通常通过遥操作采集,优点是动作标签精确,代价是需要机器人本体、专用控制器和复杂标定。纯视频方法便宜,却难以恢复接触动力学和精确动作;UMI 这类手持接口缓解了二者的矛盾,但原 UMI 对特定夹爪和 GoPro-VIO 的依赖限制了跨平台部署。

**【Analysis】**FastUMI 的切入点是“先把数据接口标准化,再谈策略规模化”。它不假设一个统一的 action representation,而是同时输出 TCP 和 joint 两种表示,让下游算法选择绝对坐标、相对位移或扩散动作空间。与 UMI 的差别也主要在系统工程:硬件解耦、独立跟踪模块和可审计的数据质量流程共同降低了每条轨迹的边际成本。

3. 问题定义#

**【Paper】**一次示教由手持设备产生,观测为 GoPro 155° 鱼眼图像与 T265 位姿;机器人端安装相同的 GoPro、可调支架和插拔式指尖。设 T265 相对初始位姿为 (pi,Ri)(p_i,R_i),已知相机到夹爪中心的偏移 Δc2g\Delta_{c2g}、机器人基座位姿和 URDF,则系统需要生成:

  • Observation:同步视频帧、T265 位姿、ArUco 标记位置。
  • Action:绝对 TCP、相邻帧相对 TCP,或由 IK 得到的绝对关节角;夹爪宽度归一化到 [0,1][0,1]
  • Robot / Embodiment:论文展示 xArm、Flexiv、Z1 等单臂平台,也支持双臂扩展。
  • Dataset:约 10,000 条轨迹、22 个日常任务;策略评测使用 12 个任务,每个任务 200 条示教。

4. 方法#

4.1 Overall Architecture#

FastUMI 可以看作三层:硬件层负责一致视角与位姿,采集层负责 ROS 多线程同步,处理层负责坐标变换、夹爪估计和策略数据导出。示教端只需手持设备,推理端把同构视觉设备安装到机器人末端;策略本身位于两者之间。

**【Analysis】**数据流是:GoPro/T265/ArUco → ROS 录制 → HDF5 原始 episode → TCP 或 joint 处理 → ACT/DP 训练与执行。硬件结构和数据格式被刻意分离,因此更换机械臂时主要修改 URDF、基座位姿和偏移配置。

4.2 核心模块#

手持设备与机器人端设备#

**【Paper】**手持设备由 GoPro、T265、顶盖、标记和可替换指尖组成。GoPro 负责宽视野观测,T265 负责视觉惯性位姿;机器人端使用 ISO 标准兼容的安装座和 7.5/5 cm 延长臂调节镜头,使鱼眼图像底部与指尖底部对齐。模块化指尖覆盖 Open X-Embodiment 中超过 90% 的常见夹爪类型(论文表述)。

位姿跟踪与质量控制#

**【Paper】**系统要求至少 95% 的采样位姿达到 T265 的 High confidence;低置信度帧被剔除并由邻帧插值。桌面上的蓝色 3D 打印槽帮助 T265 回到熟悉特征以触发 loop closure。论文观察到靠近桌面、夹爪遮挡视觉特征时误差会升高。

夹爪宽度估计#

【Code】data_processing_to_tcp.pydata_processing_to_joint.pyDICT_4X4_50 检测两个 ArUco 标记。两标记均可见时取像素中心距离;只看到一个时关于图像中心镜像估计;都不可见时沿时间插值,再按 marker_minmarker_max 线性映射到 gripper_max

TCP 与关节轨迹转换#

**【Paper】**先将 T265 位姿加上相机到夹爪的偏移,得到基座坐标系下的绝对 TCP;相邻绝对 TCP 相减得到 relative TCP;最后用 URDF 和连续初值求 IK 得到 absolute joint。

T265 到 TCP、基座坐标与偏移的变换示意(论文 Figure 6)

**【Code】**代码中的 base_positionbase_orientationoffsetflange_to_tcp 全部放在 config/config.json。IK 使用 ikpy.chain.Chain.from_urdf_file,上一帧关节解作为下一帧初值,减少时间序列中的跳变。

4.3 关键公式#

绝对 TCP 位置由相机位姿和偏移得到:

pcam(i)=pb2g+piRb2gΔc2g,pee(i)=pcam(i)+Rcam(i)Δc2g.p_{cam}^{(i)}=p_{b2g}+p_i-R_{b2g}\Delta_{c2g},\qquad p_{ee}^{(i)}=p_{cam}^{(i)}+R_{cam}^{(i)}\Delta_{c2g}.

【Paper】pi,Rip_i,R_i 是 T265 的局部位姿,pb2g,Rb2gp_{b2g},R_{b2g} 是初始夹爪中心在基座中的位姿,Δc2g\Delta_{c2g} 是相机中心到夹爪中心的偏移。相邻帧的相对轨迹为:

prel(i)=pee(i+1)pee(i),Rrel(i)=(Ree(i))1Ree(i+1).p_{rel}^{(i)}=p_{ee}^{(i+1)}-p_{ee}^{(i)},\qquad R_{rel}^{(i)}=(R_{ee}^{(i)})^{-1}R_{ee}^{(i+1)}.

ArUco 距离 dd 到物理夹爪宽度 WW 的映射为:

W=ddmindmaxdminGmax.W=\frac{d-d_{min}}{d_{max}-d_{min}}G_{max}.

**【Code】**实现中结果会裁剪到 [0,Gmax][0,G_{max}],再除以 gripper_max 作为策略输入或动作的夹爪通道。

4.4 Training#

Smooth-ACT#

**【Paper】**标准 ACT 的绝对关节预测在第一视角下可能产生未见过的姿态。Smooth-ACT 在 Transformer decoder 顶部增加 GRU,同时监督 decoder 输出和 GRU 输出:

L=a^a1+a^GRUa1+λDKL(qϕ(za,o)N(0,I)).\mathcal L=\|\hat a-a\|_1+\|\hat a_{GRU}-a\|_1+\lambda D_{KL}(q_\phi(z|a,o)\|\mathcal N(0,I)).

PoseACT 与 Depth-Enhanced DP#

PoseACT 将 action 改成绝对或相对 TCP pose,推理时再通过机器人运动学映射回关节角。Depth-Enhanced DP 使用 Depth Anything V2 从 GoPro 帧预测深度,将裁剪后的深度伪彩色图与 RGB 一起送入 ViT-Base/16;论文报告 RTX 4090 上约 20 Hz 的大模型深度推理。

Algorithm 1 FastUMI 数据处理与策略训练
输入:
手持设备采集的 RGB、T265 位姿、ArUco 标记、机器人 URDF 与标定配置
输出:
可供 ACT/DP 训练的 HDF5 或 Zarr 数据,以及训练好的策略
  1. Given 配置相机、T265 话题、基座变换、相机到夹爪偏移和夹爪标记参数
  2. ROS 节点以独立线程记录 GoPro 帧、轨迹和时间戳
  3. 按时间戳抽帧并写入每个 episode 的图像和原始 qpos/action
  4. 利用 T265 位姿变换生成绝对/相对 TCP;检测 ArUco 并插值得到夹爪宽度
  5. 需要 joint action 时,用 URDF 连续求解 IK;需要 DP 时转换为 Zarr
  6. 用 ACT、Smooth-ACT、PoseACT 或 DP 在示教数据上训练策略
  7. return 经过质量检查、可跨平台复用的数据集与策略 checkpoint

4.5 Inference#

**【Paper】**机器人端 GoPro 保持与手持设备相同的视角,策略读取当前图像和状态后输出 joint 或 TCP action。PoseACT 的 TCP 输出经过运动学映射,DP 的 relative TCP 通过延迟匹配执行;非平行夹爪还可启用动态误差补偿,在夹爪闭合导致 TCP 沿局部 Z 轴偏移时修正目标。

Algorithm 2 FastUMI Robot Inference
输入:
机器人端 GoPro 观测、当前状态、训练好的 ACT/DP 策略与机器人模型
输出:
机器人控制周期中的可执行关节或末端动作
  1. 采集与示教端对齐的第一视角图像和当前夹爪状态
  2. 策略预测绝对关节、绝对 TCP 或相对 TCP action
  3. 若为 TCP action,依据当前基座姿态和 URDF 转换到关节目标
  4. 对非平行夹爪估计闭合造成的 TCP 偏移并做动态误差补偿
  5. 交给机器人低层控制器执行,并在下一帧重新闭环

4.6 代码实现对照#

**【Code】**官方仓库 zxzm-zak/FastUMI_Data 当前公开的是数据采集和处理生态,而不是 ACT/DP 的完整训练实现:

论文概念代码位置实际行为
ROS 采集data_collection.py订阅图像与 /camera/odom/sample,按 60 Hz 视频、200 Hz 轨迹写入临时 CSV,再抽帧为 HDF5
TCP 处理data_processing_to_tcp.py基座变换、偏移修正、ArUco 宽度插值并输出 TCP HDF5
Joint 处理data_processing_to_joint.py用 ikpy 和 xArm URDF 连续求 IK,追加归一化夹爪通道
DP 数据data_processing_tcp_to_dp.py将 TCP HDF5 转为 UMI 风格 Zarr
配置config/config.json记录 xArm6、基座位姿、偏移、marker 距离和 flange_to_tcp

**【Analysis】**因此论文中的 Smooth-ACT、PoseACT、Depth-Enhanced DP 属于作者实验算法描述,官方公开仓库主要保证“数据能被这些算法消费”,不能把仓库误读为完整策略训练代码。

5. 实验#

5.1 Experimental Setup#

**【Paper】**数据集包含 22 个日常任务;策略评测选取 12 个任务:4 个 hinged、6 个 pick-place、1 个 pick-push 和 1 个 button press。每个任务训练 200 条示教,每次测试 15 次。T265 与 RoboBaton MINI 的位姿误差在 Pick Cup、Open Container、Rearrange Coke 等任务上用 MoCap 参考进行比较。

FastUMI 数据集任务与示教数量分布(论文 Figure 8)

12 个真实机器人评测任务(论文 Figure 9)

5.2 Main Results#

**【Paper】**ACT 使用 absolute joint,DP 使用 relative TCP。12 任务成功率如下(单位:%):

任务DPACT
Open Container / Open Roaster93.33 / 80.0086.67 / 86.67
Open Drawer / Open Suitcase53.33 / 40.0080.00 / 86.67
Rearrange Coke / Fold Towel80.00 / 93.3386.67 / 73.33
Pick Bear / Unplug Charger80.00 / 86.6720.00 / 86.67
Pick Lid / Pick Pen53.33 / 53.3393.33 / 20.00
Sweep Trash / Open Ricecooker46.67 / 20.006.67 / 80.00

**【Analysis】**这不是“某个策略全面胜出”:DP 的相对轨迹在重复移动和跨工作空间任务上更稳,ACT 的绝对关节在部分深度敏感任务上更直接;第一视角造成的可见性和坐标分布决定了表示选择。

5.3 Ablation Study#

跟踪模块#

**【Paper】**T265 在无遮挡 Pick Cup 上的 10 条轨迹误差约 7–12 mm,在 Open Container 上约 16–19 mm;Rearrange Coke 约 19–36 mm。MINI 在 Pick Cup 约 13–17 mm、Open Container 约 10–12 mm,说明遮挡条件下不同传感器存在互补性。

算法改进#

任务Original DPDepth-Enhanced DP
Pick Lid53.3380.00
Open Ricecooker20.0093.33
任务ACTSmooth-ACTPoseACT absolutePoseACT relative
Pick Bear20.0060.0080.0073.33
Sweep Trash6.6726.6753.3360.00

Depth-Enhanced DP 的深度映射过程(论文 Figure 7)

**【Paper】**深度输入对需要垂直对齐或按压的任务提升明显;GRU 平滑减少非法关节跳变;relative TCP 对长轨迹更好,但会牺牲部分绝对高度信息。

5.4 Generalization#

**【Paper】**相机对比中,GoPro 鱼眼第一视角在 Pick Bear/Open Container 上分别达到 80%/100%,与多视角 D435i 的 86.67%/100% 接近,而窄视角第一视角 D435i 仅 0%/0%。Pick Cup 的 ACT 成功率随示教量 200、400、800 增加为 20.00%、26.67%、53.33%。

6. 方法分析#

6.1 为什么有效?#

**【Analysis】**FastUMI 同时减少了三种分布偏移:手持与机器人端保持视觉一致,TCP/关节转换显式处理 embodiment,质量检查减少传感器异常进入训练集。策略性能因此更多由数据与表示决定,而不是被采集系统的偶然差异主导。

6.2 核心创新#

**【Analysis】**真正的创新不是“换一台跟踪器”,而是把硬件接口、坐标变换、数据质量和下游 action representation 设计成可组合的生态。T265 解决部署复杂度,ISO 支架解决机械臂异构,ArUco 与 IK 解决动作标签,Smooth-ACT/DP-depth 则处理第一视角带来的算法退化。

6.3 与已有方法的本质区别#

**【Paper】**与依赖真实机器人遥操作的系统相比,FastUMI 采集阶段只需手持设备;与纯视频示教相比,它直接记录末端位姿;与原 UMI 相比,它把专用夹爪和 VIO/SLAM 依赖拆掉,并公开更大、更广任务的数据集。

6.4 关键假设#

**【Analysis】**系统依赖“人手设备运动可代表机器人末端运动”“手持与机器人端相机视角足够一致”“URDF 与标定偏移准确”三个假设。任一假设失效,策略可能学到错误的几何关系,即使图像看起来相似也无法执行。

7. 局限性#

7.1 作者明确提出的局限#

【Paper】(1) 主要依赖视觉,缺少力觉/触觉;(2) 尚未覆盖移动操作、全身控制等更复杂形态;(3) 有线连接限制便携性和野外应用;(4) 手持数据与部署 embodiment 仍可能存在形态差异。

7.2 自己分析得到的局限#

**【Analysis】**T265 的置信度和漂移仍受光照、遮挡影响,蓝色槽和回环只是在限定环境中缓解问题;ArUco 宽度映射依赖固定标记几何,反光、污损或单标记镜像会引入系统误差;代码默认 xArm6 配置,迁移到新夹爪仍需重新测量偏移、夹爪尺度和 IK 初值。最后,论文的 12 任务测试主要是已见物体位置的新场景,尚不能等同于开放世界泛化。

8. 启发与研究思考#

**【Analysis】**FastUMI 给数据系统设计的启发是:

  1. 先定义可转换的中间表示(TCP、relative TCP、joint),再绑定具体策略;这样一个数据集可以服务 ACT、DP 和后续 VLA。
  2. 视觉一致性往往比更大的 backbone 更先决定跨 embodiment 成败;相机支架是 policy transfer 的一部分,而不是机械附件。
  3. 数据质量应成为数据集的显式字段。置信度、漂移、插值比例和标定版本若能写入 episode metadata,训练时就可以按质量加权或过滤。
  4. 第一视角策略需要“表示 + 几何约束”共同设计:PoseACT、relative action 和深度增强分别解决坐标稳定性、长轨迹和深度缺失,单一表示很难覆盖所有任务。
FastUMI 论文精读:可扩展、硬件无关的通用操作接口
https://agusexp25.top/blog/paper-deep-dive-fastumi
Author 菊花花
Published at August 27, 2026