Hana's Blog
EgoVerse:面向机器人学习的全球第一视角人类数据集论文精读Blur image
Arxiv ID 2604.07607
幻觉翻译 2604.07607
publication pending

EgoVerse 把全球第一视角人类操作经验组织成可持续增长的数据生态,并用跨 embodiment 共训验证:人类数据可提升机器人 ID/OOD 性能,但有效扩展需要任务对齐数据作为锚点。

推荐指数:

1. 论文概述#

【Paper】 EgoVerse 不是单一的离线数据集,而是由数据采集设备、云端处理和访问系统、标准化数据集以及跨实验室评测组成的 living dataset。当前版本包含 1,362 小时、约 80,000 个 episode、1,965 个任务、240 个场景和 2,087 名 demonstrator。论文把资源分成两部分:EgoVerse-Aegoversea)按统一协议采集,用于可复现实验;EgoVerse-Iegoversei)由产业伙伴在真实环境中采集,强调规模、开放任务和丰富标注。

EgoVerse collaborative framework overview from paper Figure 1

一句话总结#

【Analysis】 论文真正解决的问题不是“再收集一个更大的视频集”,而是把人类经验变成一种跨机器人可复用的中间层:先统一坐标、动作和元数据,再用共享协议测量哪些 diversity 能转化为机器人泛化。

核心贡献#

【Paper】

  1. 提出持续接收贡献的 EgoVerse 数据生态,统一人类和机器人 episode 的格式、标注与访问方式。
  2. 发布跨实验室、跨任务、跨机器人 embodiment 的大规模 human-to-robot transfer study,而非只在单一平台上报告结果。
  3. 设计相机中心的动作表示和分位数归一化,使第一视角人手轨迹能与机器人末端轨迹共同训练。
  4. 发现 co-training 人类数据通常带来 ID/OOD 提升(最高约 30% 的相对改进),但多样人类数据的正向 scaling 依赖 domain-aligned human–robot data。
  5. 在受控实验中区分 demonstrator diversity 与 scene diversity:前者提升对新人的泛化,后者对未见环境的收益更强,尤其在数据预算受限时。

2. 背景与相关工作#

【Paper】 机器人模仿学习的瓶颈是物理数据采集:需要昂贵硬件、熟练 teleoperator 和受控场景,规模和多样性很难像互联网图像或文本那样增长。人类每天在不同房间、物体和身体形态下操作,第一视角视频和 3D hand pose 因而成为潜在的可扩展监督。

现有 human dataset 往往是为某个实验一次性采集,缺乏统一的 schema、版本管理和跨机构复现实验。另一方面,人类和机器人在运动学、视角、速度、控制接口上存在 embodiment gap;直接把两类轨迹拼起来,策略可能学会把它们分成两个互不相干的分布。

【Analysis】 EgoVerse 的切入点是基础设施与科学问题同时设计:EgoDB 让数据持续长大,EgoVerse-A 让“增加多少数据、哪一种 diversity 有用”可以被隔离出来。

3. 问题定义#

给定人类数据 DHD_H 与机器人数据 DRD_R,每条样本包含图像观测 oto_t、状态/姿态和未来动作块 at:t+ka_{t:t+k}。目标是训练一个共享策略,使其在不同 embodiment 上最小化行为克隆误差:

π=argminπ  E(o,a)DHDR[LBC(π(o),a)].\pi^* = \arg\min_\pi\; \mathbb{E}_{(o,a)\sim D_H\cup D_R} \left[\mathcal{L}_{\mathrm{BC}}(\pi(o),a)\right].

人类手部位姿在移动设备坐标系 TtdeviceT_t^{device} 中观测。为了让动作只依赖当前相机帧,论文把未来位姿变换回时刻 tt 的设备坐标系,构成相机中心动作块。研究问题可拆成三个问题:人类数据加入机器人训练是否在多个平台上稳定有效;多样数据量增加时什么样的 aligned data 能防止负迁移;以及 demonstrator diversity 与 scene diversity 分别如何影响泛化。

4. 方法#

4.1 Overall Architecture#

EgoVerse cross-embodiment policy architecture from paper Figure 4

【Paper】 图像和 proprioception 先经过 modality-specific stems,被 token 化到共享空间;共享 Transformer encoder 聚合 human/robot 观测,随后由 embodiment-specific 或 shared action head 预测动作块。人类和机器人样本在训练时分别计算损失,再进行 co-training。

4.2 核心模块#

EgoVerse 数据采集与标注#

  • 输入:Aria 眼镜、产业伙伴 wearable rigs,或头戴式 iPhone 的 RGB 视频;机器人端是多相机图像、状态和动作。
  • 输出:统一 episode,至少包含 egocentric RGB、每只手 21 个 3D keypoints、6-DoF head pose;EgoVerse-A 还记录 task、scene、object set 与 demonstrator 元数据,EgoVerse-I 可提供 1–2 秒粒度语言、active-hand 和 static/mobile manipulation 标签。
  • 为什么需要:手和头的轨迹把“人类如何移动”转成可对齐的几何监督;任务与场景元数据则让受控 split 成为可能。

Human capture setup and unified annotations from paper Figure 2

EgoDB 数据管理系统#

【Paper】 原始数据上传到 S3-backed storage,nightly pipeline 做预处理、验证和索引,episode metadata 写入 SQL;网页 viewer 支持浏览示例和标注,训练端按 filters 同步子集。

EgoDB data management pipeline from paper Figure 3

跨 embodiment 表示#

机器人动作按平台不同表示:Georgia Tech 双 ARX5 使用 camera-frame 的 6D Euler pose + gripper(每步 14D),Stanford 使用 quaternion + gripper(每步 16D),UCSD Unitree G1 使用腕部 SE(3)\mathbb{SE}(3) 加五个相对手部 keypoint。

人类动作块定义为:

at:t+kH=[(Ttdevice)1Tt+idevicept+iH]i=1k.a^H_{t:t+k} = \left[ \left(T_t^{\mathrm{device}}\right)^{-1}T_{t+i}^{\mathrm{device}}p^H_{t+i} \right]_{i=1}^{k}.

这样,未来相机运动被显式消除,手部轨迹与机器人末端轨迹拥有同一个“当前观测帧”参考系。

Transformer policy#

【Paper】 共享的 egocentric RGB stem 使用 ResNet-18;proprioception 进入 MLP;learned query attention 把不同模态转换成固定数量 token。共享 token 与 robot wrist-camera、proprioception 等独立 token 拼接后送入 Transformer encoder,learnable tokens 汇聚 task-relevant context。动作解码器是多层 Transformer decoder,采用 flow matching 生成连续 action chunk,必要时为不同 action space 使用独立 head。

【Code】 官方 egomimic/algo/hpt.py 实现了 modality stems、共享 trunk、action tokens 和 domain-specific heads;preprocess_tokens() 拼接 token 并加入正弦位置编码,postprocess_tokens() 可取 action token、mean 或 max。仓库同时提供 egomimic/algo/pi.py,基于 OpenPI/PI0 进行另一条 co-training 路径。

4.3 关键公式#

分位数归一化#

为减轻不同传感器和 embodiment 的量纲差异,论文把每个 feature 的第 1 和第 99 百分位映射到 [1,1][-1,1]

x^=2(xq0.01q0.99q0.01)1.\hat{x}=2\left(\frac{x-q_{0.01}}{q_{0.99}-q_{0.01}}\right)-1.

q0.01q_{0.01}q0.99q_{0.99} 是训练分布分位点。相比均值方差归一化,分位数对少量异常姿态更稳健。

BC co-training#

LBCcotrain=LCFMrobot+LCFMhuman.\mathcal{L}_{\mathrm{BC-cotrain}} =\mathcal{L}_{\mathrm{CFM}}^{robot}+\mathcal{L}_{\mathrm{CFM}}^{human}.

【Paper】 每一步从 human 与 robot mini-batch 分别计算 conditional flow matching loss,再求和。CFM 让 action decoder 学习从噪声状态到示范动作块的向量场;ϕ\phiθ\theta(encoder 与 decoder)联合优化。

可选的表示对齐损失#

【Code】 hpt.py 还实现了基于 Sinkhorn 的 optimal transport(OT)对齐:先取 trunk 的 action tokens,再按动作距离构造跨 batch cost;可选 Soft-DTW 处理时序形状。该分支不是正文主结果的必要条件,代码中由 ot_6dofuse_dtw 等开关控制。

4.4 Training#

【Paper】 EgoVerse-A 的 dataset unit 通常约 5 分钟,产出每任务 5–10 条演示;六个 flagship task 覆盖单臂、双臂、精细放置与长时程操作。机器人每任务约 150–300 条演示。训练阶段对图像做 random crop 与 color jitter,并对不同 embodiment 的 action/proprioception 独立归一化。

Algorithm 1 EgoVerse 跨 embodiment 共训
输入:
人类 episode DHD_H、机器人 episode DRD_R、多模态观测与动作块
输出:
共享 encoder 与各 embodiment action head
  1. 从 EgoDB filters 同步任务、场景和 embodiment 子集,读取统一 schema。
  2. 把图像、proprioception、语言和动作转换成各自 stem 的输入;将未来人手轨迹变换到当前设备帧。
  3. 对 human 与 robot mini-batch 分别前向,计算 CFM/BC loss;按配置叠加 OT 对齐项。
  4. 反向更新共享 trunk 与 action heads,周期性在 held-out episode 上计算 Avg-MSE。

4.5 Inference#

【Paper】 推理时策略读取当前 egocentric RGB、必要的 wrist camera 和 proprioception,生成长度为 kk 的 action chunk;机器人只执行闭环控制所需的一段,再获取新观测。人类数据本身不参与运行时决策,而是在训练时提供跨 embodiment 的行为先验。

Algorithm 2 相机中心 action-chunk 推理
输入:
机器人当前多相机观测 oto_t、状态 qtq_t 和任务指令
输出:
机器人控制接口可执行的动作块
  1. 按机器人 embodiment 选择对应 camera/proprioception stem 和 action head。
  2. 对输入做训练时同构的 resize、归一化与视觉预处理,送入共享 Transformer trunk。
  3. 从 action tokens 解码连续动作;flow-matching head 通过若干采样步得到动作序列。
  4. 将动作转换回平台坐标或关节接口,执行一小段并循环读取新观测。

4.6 代码实现对照#

论文组件官方代码位置可核对行为
训练入口egomimic/trainHydra.py使用 PyTorch Lightning + Hydra,支持 DDP 和配置化 dataset filters。
HPT policyegomimic/algo/hpt.pymodality stems、共享 Transformer trunk、action tokens、domain heads 与 BC/OT loss。
Pi0 路径egomimic/algo/pi.py调用 OpenPI PI0Pytorch,按 embodiment 注册 action converter,并支持语言/状态 prompt。
数据配置egomimic/hydra_configs/data/*.yamlhuman_bimanualeva_bimanual 等 domain 通过 SQL lambda filters 选择 episode。
数据可视化egomimic/scripts/data_visualization/latent_inspector.py浏览 per-episode zarr,叠加 Cartesian、orientation、keypoint 和 annotation。

【Analysis】 代码仓库是可运行的数据处理与训练框架,但云端 EgoDB、所有原始数据和论文中三家实验室的硬件不随仓库发布。因此读者可以复现实验配置和模型逻辑,却不能仅靠 git clone 重建论文的完整数据规模与真实机器人 rollout。

5. 实验#

5.1 Experimental Setup#

Three robot platforms used in the consortium study from paper Figure 3

【Paper】 评测覆盖三种平台:Georgia Tech 的双 ARX5、Stanford 的肩部安装双 ARX5,以及 UCSD 的 Unitree G1 + Inspire Hand。四个代表性 flagship task(具体主结果聚焦 object-in-container、cup-on-saucer、bag-grocery)各做 20 次 ID 和 20 次 OOD rollout,报告按任务子指标聚合的 normalized score。

Flagship task definitions from paper Figure 4

5.2 Main Results#

Co-training results across robots from paper Figure 5

【Paper】 加入 EgoVerse-A 人类数据后,大多数机器人和任务的 ID/OOD normalized score 都提升,最高约 30%。这不是单一平台现象:单臂 object-in-container、精细双臂 cup-on-saucer 和长时程 bag-grocery 在不同机器人上总体复现了 co-training 的收益。

论文也报告了一个重要反例:Stanford 平台的 bag-grocery 性能下降,而 Georgia Tech 与 UCSD 上升。作者推测是该 embodiment 的机械限制迫使机器人演示采用与人类策略不同的动作路线,导致共享策略面对冲突 supervision。

5.3 Ablation Study#

Domain-aligned data enables scaling from paper Figure 6

【Paper】 固定机器人数据,逐步增加 diverse human data 与 domain-aligned human data:

训练条件结果解释
仅增加 diverse EgoVerse-A8 小时数据本身未稳定带来 ID/OOD 增益。
仅加入 aligned human data有任务锚点,但规模收益有限。
少量 aligned + 增加 diverse data出现正向 scaling;例如 2 小时 aligned 数据可“锚定”2–8 小时 diverse 数据。

【Analysis】 这更像“表示学习的坐标系校准”而非简单的数据量定律:aligned data 告诉策略哪些人类动作与当前机器人任务语义对应,之后多样数据才更容易被当作可迁移变化,而不是噪声。

5.4 Generalization#

【Paper】 受控 diversity 子集固定 16 名 demonstrator 和 16 个 scene,在固定预算下改变覆盖范围。增加 demonstrator 数量(单 scene 2 小时或多 scene 8 小时)持续改善对 unseen demonstrator 的 Avg-MSE;增加 scene 数量 {1,2,4,8,16}\{1,2,4,8,16\} 则持续改善对 unseen scene 的泛化。联合扩展时,scene diversity 的边际收益逐渐超过额外 demonstrator diversity,且在低数据预算下最明显。

6. 方法分析#

6.1 为什么有效?#

【Analysis】 EgoVerse 的有效性来自三层互补约束:相机中心坐标把移动的人体视角变成稳定的局部动作问题;共享视觉 stem 和 Transformer trunk 迫使 human/robot 观测进入可比较的 latent space;aligned human data 提供语义锚点,diverse data 再扩展外观、场景和运动风格的覆盖。

6.2 核心创新#

  • 数据集 → living ecosystem:采集、处理、查询和版本化是一体化设计,而非一次性发布压缩包。
  • 跨实验室可复现研究:同一任务协议、不同机器人平台,让“有效性”不依赖单一硬件。
  • 把 diversity 拆因子:分别测 demonstrator 与 scene,避免把所有变化混成一个“更多数据”变量。
  • 简单但关键的对齐:相机中心 action chunk 与 quantile normalization 让不同来源能共享 BC/CFM 目标。

6.3 与已有方法的本质区别#

【Analysis】 传统 robot dataset 的扩展路径是增加 teleoperation 轨迹;EgoVerse 把人类经验作为 embodiment-agnostic 数据层,再在下游决定机器人。与只追求大规模 in-the-wild 视频的方法相比,它保留了任务语义、手部几何和 scene/demonstrator 元数据,因此能做可控 scaling study;与只在单一实验室验证 human-to-robot transfer 的工作相比,它把跨平台复现作为主要结果。

6.4 关键假设#

  • 人类 hand/head pose 足以作为机器人末端运动的有用 proxy。
  • 任务语义在不同 embodiment 间可通过共享 instruction 和局部坐标对齐。
  • 统一的视觉与动作归一化能吸收大部分传感器/控制接口差异。
  • 少量 domain-aligned 数据可以为大规模 diverse data 提供稳定锚点。
  • offline Avg-MSE 的趋势至少能部分反映下游机器人泛化;论文也承认这不是 rollout 的替代品。

7. 局限性#

7.1 作者明确提出的局限#

【Paper】 研究主要集中在 human-and-robot co-training,尚未系统比较 pre-train/fine-tune 等更广泛的算法路线。scene 与 demonstrator diversity 的受控实验主要依赖 offline metrics,仍需要更多真实机器人 rollout 来验证其与操作成功率的对应关系。

7.2 自己分析得到的局限#

【Analysis】 数据生态的规模依赖合作机构、云存储和访问权限,个人研究者未必能获得与论文相同的 episode 分布;统一 action schema 仍不能消除动力学、接触模型和控制频率差异;人类手部轨迹是“怎么动”的 proxy,不等价于机器人可执行的 grasp affordance;持续更新还会造成 dataset shift,需要冻结版本和 data cards 才能稳定比较。

8. 启发与研究思考#

【Analysis】 这篇论文给出的最大启发是:机器人 foundation model 的瓶颈不只是模型参数,而是“哪些经验能被可靠地共享”。后续工作可以把 aligned data 选择写成可学习的 curriculum,在 EgoDB schema 中加入接触事件、物体 affordance 和失败标签,并建立把 offline diversity 指标、跨 embodiment latent distance 与真实 rollout 放在同一协议中的版本化 benchmark。

如果把人类视为一组连续变化的 embodiment,那么 EgoVerse 的 scene/demonstrator scaling 实验也提供了一个有趣视角:机器人不是从“人类”迁移到“某一台机器”,而是在一个经验流形上寻找可执行的子空间。真正可扩展的 robot learning 数据系统,应该同时记录数据量、来源、对齐程度和可迁移边界。

EgoVerse:面向机器人学习的全球第一视角人类数据集论文精读
https://agusexp25.top/blog/paper-deep-dive-egoverse
Author 菊花花
Published at August 27, 2026