

EgoVerse:面向机器人学习的全球第一视角人类数据集论文精读
精读 EgoVerse:用可持续增长的第一视角人类数据、统一数据基础设施和跨 embodiment 共训,系统研究人类经验如何迁移到机器人操作。
EgoVerse 把全球第一视角人类操作经验组织成可持续增长的数据生态,并用跨 embodiment 共训验证:人类数据可提升机器人 ID/OOD 性能,但有效扩展需要任务对齐数据作为锚点。
1. 论文概述#
【Paper】 EgoVerse 不是单一的离线数据集,而是由数据采集设备、云端处理和访问系统、标准化数据集以及跨实验室评测组成的 living dataset。当前版本包含 1,362 小时、约 80,000 个 episode、1,965 个任务、240 个场景和 2,087 名 demonstrator。论文把资源分成两部分:EgoVerse-A(egoversea)按统一协议采集,用于可复现实验;EgoVerse-I(egoversei)由产业伙伴在真实环境中采集,强调规模、开放任务和丰富标注。

一句话总结#
【Analysis】 论文真正解决的问题不是“再收集一个更大的视频集”,而是把人类经验变成一种跨机器人可复用的中间层:先统一坐标、动作和元数据,再用共享协议测量哪些 diversity 能转化为机器人泛化。
核心贡献#
【Paper】
- 提出持续接收贡献的 EgoVerse 数据生态,统一人类和机器人 episode 的格式、标注与访问方式。
- 发布跨实验室、跨任务、跨机器人 embodiment 的大规模 human-to-robot transfer study,而非只在单一平台上报告结果。
- 设计相机中心的动作表示和分位数归一化,使第一视角人手轨迹能与机器人末端轨迹共同训练。
- 发现 co-training 人类数据通常带来 ID/OOD 提升(最高约 30% 的相对改进),但多样人类数据的正向 scaling 依赖 domain-aligned human–robot data。
- 在受控实验中区分 demonstrator diversity 与 scene diversity:前者提升对新人的泛化,后者对未见环境的收益更强,尤其在数据预算受限时。
2. 背景与相关工作#
【Paper】 机器人模仿学习的瓶颈是物理数据采集:需要昂贵硬件、熟练 teleoperator 和受控场景,规模和多样性很难像互联网图像或文本那样增长。人类每天在不同房间、物体和身体形态下操作,第一视角视频和 3D hand pose 因而成为潜在的可扩展监督。
现有 human dataset 往往是为某个实验一次性采集,缺乏统一的 schema、版本管理和跨机构复现实验。另一方面,人类和机器人在运动学、视角、速度、控制接口上存在 embodiment gap;直接把两类轨迹拼起来,策略可能学会把它们分成两个互不相干的分布。
【Analysis】 EgoVerse 的切入点是基础设施与科学问题同时设计:EgoDB 让数据持续长大,EgoVerse-A 让“增加多少数据、哪一种 diversity 有用”可以被隔离出来。
3. 问题定义#
给定人类数据 与机器人数据 ,每条样本包含图像观测 、状态/姿态和未来动作块 。目标是训练一个共享策略,使其在不同 embodiment 上最小化行为克隆误差:
人类手部位姿在移动设备坐标系 中观测。为了让动作只依赖当前相机帧,论文把未来位姿变换回时刻 的设备坐标系,构成相机中心动作块。研究问题可拆成三个问题:人类数据加入机器人训练是否在多个平台上稳定有效;多样数据量增加时什么样的 aligned data 能防止负迁移;以及 demonstrator diversity 与 scene diversity 分别如何影响泛化。
4. 方法#
4.1 Overall Architecture#

【Paper】 图像和 proprioception 先经过 modality-specific stems,被 token 化到共享空间;共享 Transformer encoder 聚合 human/robot 观测,随后由 embodiment-specific 或 shared action head 预测动作块。人类和机器人样本在训练时分别计算损失,再进行 co-training。
4.2 核心模块#
EgoVerse 数据采集与标注#
- 输入:Aria 眼镜、产业伙伴 wearable rigs,或头戴式 iPhone 的 RGB 视频;机器人端是多相机图像、状态和动作。
- 输出:统一 episode,至少包含 egocentric RGB、每只手 21 个 3D keypoints、6-DoF head pose;
EgoVerse-A还记录 task、scene、object set 与 demonstrator 元数据,EgoVerse-I可提供 1–2 秒粒度语言、active-hand 和 static/mobile manipulation 标签。 - 为什么需要:手和头的轨迹把“人类如何移动”转成可对齐的几何监督;任务与场景元数据则让受控 split 成为可能。

EgoDB 数据管理系统#
【Paper】 原始数据上传到 S3-backed storage,nightly pipeline 做预处理、验证和索引,episode metadata 写入 SQL;网页 viewer 支持浏览示例和标注,训练端按 filters 同步子集。

跨 embodiment 表示#
机器人动作按平台不同表示:Georgia Tech 双 ARX5 使用 camera-frame 的 6D Euler pose + gripper(每步 14D),Stanford 使用 quaternion + gripper(每步 16D),UCSD Unitree G1 使用腕部 加五个相对手部 keypoint。
人类动作块定义为:
这样,未来相机运动被显式消除,手部轨迹与机器人末端轨迹拥有同一个“当前观测帧”参考系。
Transformer policy#
【Paper】 共享的 egocentric RGB stem 使用 ResNet-18;proprioception 进入 MLP;learned query attention 把不同模态转换成固定数量 token。共享 token 与 robot wrist-camera、proprioception 等独立 token 拼接后送入 Transformer encoder,learnable tokens 汇聚 task-relevant context。动作解码器是多层 Transformer decoder,采用 flow matching 生成连续 action chunk,必要时为不同 action space 使用独立 head。
【Code】 官方 egomimic/algo/hpt.py 实现了 modality stems、共享 trunk、action tokens 和 domain-specific heads;preprocess_tokens() 拼接 token 并加入正弦位置编码,postprocess_tokens() 可取 action token、mean 或 max。仓库同时提供 egomimic/algo/pi.py,基于 OpenPI/PI0 进行另一条 co-training 路径。
4.3 关键公式#
分位数归一化#
为减轻不同传感器和 embodiment 的量纲差异,论文把每个 feature 的第 1 和第 99 百分位映射到 :
、 是训练分布分位点。相比均值方差归一化,分位数对少量异常姿态更稳健。
BC co-training#
【Paper】 每一步从 human 与 robot mini-batch 分别计算 conditional flow matching loss,再求和。CFM 让 action decoder 学习从噪声状态到示范动作块的向量场; 和 (encoder 与 decoder)联合优化。
可选的表示对齐损失#
【Code】 hpt.py 还实现了基于 Sinkhorn 的 optimal transport(OT)对齐:先取 trunk 的 action tokens,再按动作距离构造跨 batch cost;可选 Soft-DTW 处理时序形状。该分支不是正文主结果的必要条件,代码中由 ot_6dof、use_dtw 等开关控制。
4.4 Training#
【Paper】 EgoVerse-A 的 dataset unit 通常约 5 分钟,产出每任务 5–10 条演示;六个 flagship task 覆盖单臂、双臂、精细放置与长时程操作。机器人每任务约 150–300 条演示。训练阶段对图像做 random crop 与 color jitter,并对不同 embodiment 的 action/proprioception 独立归一化。
- 从 EgoDB filters 同步任务、场景和 embodiment 子集,读取统一 schema。
- 把图像、proprioception、语言和动作转换成各自 stem 的输入;将未来人手轨迹变换到当前设备帧。
- 对 human 与 robot mini-batch 分别前向,计算 CFM/BC loss;按配置叠加 OT 对齐项。
- 反向更新共享 trunk 与 action heads,周期性在 held-out episode 上计算 Avg-MSE。
4.5 Inference#
【Paper】 推理时策略读取当前 egocentric RGB、必要的 wrist camera 和 proprioception,生成长度为 的 action chunk;机器人只执行闭环控制所需的一段,再获取新观测。人类数据本身不参与运行时决策,而是在训练时提供跨 embodiment 的行为先验。
- 按机器人 embodiment 选择对应 camera/proprioception stem 和 action head。
- 对输入做训练时同构的 resize、归一化与视觉预处理,送入共享 Transformer trunk。
- 从 action tokens 解码连续动作;flow-matching head 通过若干采样步得到动作序列。
- 将动作转换回平台坐标或关节接口,执行一小段并循环读取新观测。
4.6 代码实现对照#
| 论文组件 | 官方代码位置 | 可核对行为 |
|---|---|---|
| 训练入口 | egomimic/trainHydra.py | 使用 PyTorch Lightning + Hydra,支持 DDP 和配置化 dataset filters。 |
| HPT policy | egomimic/algo/hpt.py | modality stems、共享 Transformer trunk、action tokens、domain heads 与 BC/OT loss。 |
| Pi0 路径 | egomimic/algo/pi.py | 调用 OpenPI PI0Pytorch,按 embodiment 注册 action converter,并支持语言/状态 prompt。 |
| 数据配置 | egomimic/hydra_configs/data/*.yaml | human_bimanual 与 eva_bimanual 等 domain 通过 SQL lambda filters 选择 episode。 |
| 数据可视化 | egomimic/scripts/data_visualization/latent_inspector.py | 浏览 per-episode zarr,叠加 Cartesian、orientation、keypoint 和 annotation。 |
【Analysis】 代码仓库是可运行的数据处理与训练框架,但云端 EgoDB、所有原始数据和论文中三家实验室的硬件不随仓库发布。因此读者可以复现实验配置和模型逻辑,却不能仅靠 git clone 重建论文的完整数据规模与真实机器人 rollout。
5. 实验#
5.1 Experimental Setup#

【Paper】 评测覆盖三种平台:Georgia Tech 的双 ARX5、Stanford 的肩部安装双 ARX5,以及 UCSD 的 Unitree G1 + Inspire Hand。四个代表性 flagship task(具体主结果聚焦 object-in-container、cup-on-saucer、bag-grocery)各做 20 次 ID 和 20 次 OOD rollout,报告按任务子指标聚合的 normalized score。

5.2 Main Results#

【Paper】 加入 EgoVerse-A 人类数据后,大多数机器人和任务的 ID/OOD normalized score 都提升,最高约 30%。这不是单一平台现象:单臂 object-in-container、精细双臂 cup-on-saucer 和长时程 bag-grocery 在不同机器人上总体复现了 co-training 的收益。
论文也报告了一个重要反例:Stanford 平台的 bag-grocery 性能下降,而 Georgia Tech 与 UCSD 上升。作者推测是该 embodiment 的机械限制迫使机器人演示采用与人类策略不同的动作路线,导致共享策略面对冲突 supervision。
5.3 Ablation Study#

【Paper】 固定机器人数据,逐步增加 diverse human data 与 domain-aligned human data:
| 训练条件 | 结果解释 |
|---|---|
仅增加 diverse EgoVerse-A | 8 小时数据本身未稳定带来 ID/OOD 增益。 |
| 仅加入 aligned human data | 有任务锚点,但规模收益有限。 |
| 少量 aligned + 增加 diverse data | 出现正向 scaling;例如 2 小时 aligned 数据可“锚定”2–8 小时 diverse 数据。 |
【Analysis】 这更像“表示学习的坐标系校准”而非简单的数据量定律:aligned data 告诉策略哪些人类动作与当前机器人任务语义对应,之后多样数据才更容易被当作可迁移变化,而不是噪声。
5.4 Generalization#
【Paper】 受控 diversity 子集固定 16 名 demonstrator 和 16 个 scene,在固定预算下改变覆盖范围。增加 demonstrator 数量(单 scene 2 小时或多 scene 8 小时)持续改善对 unseen demonstrator 的 Avg-MSE;增加 scene 数量 则持续改善对 unseen scene 的泛化。联合扩展时,scene diversity 的边际收益逐渐超过额外 demonstrator diversity,且在低数据预算下最明显。
6. 方法分析#
6.1 为什么有效?#
【Analysis】 EgoVerse 的有效性来自三层互补约束:相机中心坐标把移动的人体视角变成稳定的局部动作问题;共享视觉 stem 和 Transformer trunk 迫使 human/robot 观测进入可比较的 latent space;aligned human data 提供语义锚点,diverse data 再扩展外观、场景和运动风格的覆盖。
6.2 核心创新#
- 数据集 → living ecosystem:采集、处理、查询和版本化是一体化设计,而非一次性发布压缩包。
- 跨实验室可复现研究:同一任务协议、不同机器人平台,让“有效性”不依赖单一硬件。
- 把 diversity 拆因子:分别测 demonstrator 与 scene,避免把所有变化混成一个“更多数据”变量。
- 简单但关键的对齐:相机中心 action chunk 与 quantile normalization 让不同来源能共享 BC/CFM 目标。
6.3 与已有方法的本质区别#
【Analysis】 传统 robot dataset 的扩展路径是增加 teleoperation 轨迹;EgoVerse 把人类经验作为 embodiment-agnostic 数据层,再在下游决定机器人。与只追求大规模 in-the-wild 视频的方法相比,它保留了任务语义、手部几何和 scene/demonstrator 元数据,因此能做可控 scaling study;与只在单一实验室验证 human-to-robot transfer 的工作相比,它把跨平台复现作为主要结果。
6.4 关键假设#
- 人类 hand/head pose 足以作为机器人末端运动的有用 proxy。
- 任务语义在不同 embodiment 间可通过共享 instruction 和局部坐标对齐。
- 统一的视觉与动作归一化能吸收大部分传感器/控制接口差异。
- 少量 domain-aligned 数据可以为大规模 diverse data 提供稳定锚点。
- offline Avg-MSE 的趋势至少能部分反映下游机器人泛化;论文也承认这不是 rollout 的替代品。
7. 局限性#
7.1 作者明确提出的局限#
【Paper】 研究主要集中在 human-and-robot co-training,尚未系统比较 pre-train/fine-tune 等更广泛的算法路线。scene 与 demonstrator diversity 的受控实验主要依赖 offline metrics,仍需要更多真实机器人 rollout 来验证其与操作成功率的对应关系。
7.2 自己分析得到的局限#
【Analysis】 数据生态的规模依赖合作机构、云存储和访问权限,个人研究者未必能获得与论文相同的 episode 分布;统一 action schema 仍不能消除动力学、接触模型和控制频率差异;人类手部轨迹是“怎么动”的 proxy,不等价于机器人可执行的 grasp affordance;持续更新还会造成 dataset shift,需要冻结版本和 data cards 才能稳定比较。
8. 启发与研究思考#
【Analysis】 这篇论文给出的最大启发是:机器人 foundation model 的瓶颈不只是模型参数,而是“哪些经验能被可靠地共享”。后续工作可以把 aligned data 选择写成可学习的 curriculum,在 EgoDB schema 中加入接触事件、物体 affordance 和失败标签,并建立把 offline diversity 指标、跨 embodiment latent distance 与真实 rollout 放在同一协议中的版本化 benchmark。
如果把人类视为一组连续变化的 embodiment,那么 EgoVerse 的 scene/demonstrator scaling 实验也提供了一个有趣视角:机器人不是从“人类”迁移到“某一台机器”,而是在一个经验流形上寻找可执行的子空间。真正可扩展的 robot learning 数据系统,应该同时记录数据量、来源、对齐程度和可迁移边界。