

ACE-Ego-0 论文精读:把第一视角人类视频变成 VLA 的可用动作监督
精读 ACE-Ego-0:用 camera-space action、形态条件、时间对齐和可靠性加权,把 1.48K 小时人类第一视角视频与机器人数据统一用于 VLA 预训练。
ACE-Ego-0 将第一视角人类视频转换为带质量估计的 camera-space pseudo-actions,并用形态条件、物理时间对齐和可靠性加权辅助损失与机器人数据共同预训练 VLA。
1. 论文概述#
论文名称:《ACE-Ego-0: Unifying Egocentric Human and Robotic Data for VLA Pretraining》
作者:Hao Li、Ganlong Zhao、Yufei Liu、Haotian Hou、Guoquan Ye、Tongyan Fang、Chunxiao Liu、Siyuan Huang、Jianbo Liu、Xiaogang Wang、Hongsheng Li
论文 / 项目 / 代码:arXiv ↗ · Project Page ↗ · ACE-Ego ↗

一句话总结#
【Paper】 ACE-Ego-0 解决的不是“如何再收集一个机器人数据集”,而是如何把便宜、规模大但动作标签噪声高的第一视角人类视频,安全地接入机器人 VLA 的训练目标。它沿空间、结构、时间三条轴统一 action representation,再用 reliability-aware human auxiliary loss 隔离 pseudo-action 的噪声。
核心贡献#
【Paper】
- 统一动作接口:机器人末端和人手轨迹都转换到 head-camera 坐标系,使用 22 维双臂 action;再加入 robot URDF 或 human source surrogate 的 morphology token。
- 时间对齐:按物理时长而不是固定帧数构造 action chunk,使 10–30 Hz 的数据覆盖相同未来时间窗口。
- 可靠性加权监督:机器人数据使用完整的 primary flow-matching loss;人类 pseudo-actions 只通过带通道和时间步权重的 Huber auxiliary loss 参与。
- 可扩展数据管线:从 Ego4D、EgoExo4D、EPIC-KITCHENS-100、HOI4D、EgoDex、Xperience-10M 中产出 1,478.9 小时 pseudo-action 视频,与 4,534.8+ 小时机器人 / 仿真数据组成 6,013.7+ 小时混合池。
- 实验结果:RoboCasa GR1 TableTop 平均成功率 72.8%,RoboTwin 2.0 Easy / Hard 为 91.12% / 90.62%,真实 ARX 双臂平台六项任务平均成功率为 78.3%。
【Analysis】 ACE-Ego-0 的真正创新是把“表示对齐”和“标签可信度”拆成两个正交问题:同一个坐标系并不意味着标签同样可靠,二者必须分别处理。
2. 背景与相关工作#
【Paper】 VLA 的性能通常随 embodied data 的规模和多样性增长,但机器人示教需要遥操作、标定和传感器记录,扩展成本很高。第一视角人类视频覆盖厨房、家庭和工作台中的长尾操作,采集便宜得多,因此成为有吸引力的补充监督。
困难在于,两类数据同时存在四种错位:
| 错位 | 机器人示教 | 人类视频 pseudo-action |
|---|---|---|
| 空间 | base / world / camera 等不同坐标 | 手部重建常在 local frame,且有深度歧义 |
| 结构 | 不同机械臂、关节链、夹爪行程 | 没有 URDF,只有人手形态 |
| 时间 | 10–30 Hz、不同 chunk 步数 | 视频帧率和动作持续时间不一致 |
| 监督质量 | 传感器记录的高保真 action | 遮挡、抖动、追踪失败导致噪声 |
已有 cross-embodiment VLA 往往解决共享 action space 或 embodiment tokenizer,但没有同时处理 camera frame、kinematic structure 和 control frequency。另一方面,EgoMimic、HumanPlus、EgoVLA 等方法从人类视频恢复手部或接触轨迹,却容易把 noisy pseudo-actions 当作机器人真值直接训练。
【Analysis】 直接混合数据的隐患不是“人类视频没有用”,而是高质量机器人标签会被低质量标签的统计偏差拖动。ACE-Ego-0 让人类视频主要提供行为覆盖和视觉先验,把精确控制锚定在机器人数据上。
3. 问题定义#
给定多视角图像 、语言指令 、embodiment 信息 ,策略需要输出未来一段 camera-space action chunk:
其中 随数据源控制频率 改变,但对应相同的物理时长 。每个双臂 action 为 22 维:
| 项目 | 定义 |
|---|---|
| Observation | head / wrist RGB 图像和语言指令 |
| Action | camera-space 末端 / 手腕位置、6D 旋转、gripper、activity flag |
| Robot | AgiBot、Galaxea、Galbot、GR1 等多种 embodiment |
| Human | 六个第一视角视频来源,经 3D hand reconstruction 得到 pseudo-action |
| 训练目标 | 机器人 primary flow matching + 人类 reliability-aware auxiliary loss |
【Paper】 论文把人类动作视为可用但不等价于机器人传感器标签的 supervision。因而目标不是让人手轨迹完全“伪装成”机器人轨迹,而是在共享接口中保留它们的质量差异。
4. 方法#
4.1 Overall Architecture#

【Paper】 Qwen3-VL-4B-Instruct 编码 head / wrist 图像与语言;约 600M 参数的 flow-matching DiT action expert 额外接收 morphology token,输出按物理时间对齐的连续 action chunk。机器人样本进入 primary loss,人类样本进入 reliability-aware auxiliary loss。
数据流只有一条共享接口:
图像 + 指令 ──> Qwen3-VL ──> action expert ──> camera-space action chunk
↑
robot URDF / human surrogate morphology tokentext4.2 核心模块#
(1) Camera-space action#
- 输入:机器人在 source frame 中的末端 pose,或人手重建得到的 wrist / palm 几何。
- 中间模块:外参变换、连续 6D rotation、hand-centric frame、gripper normalization。
- 输出:统一的双臂 22-D action。
- 作用:观测和动作位于同一个 head-camera frame,换 embodiment 时只需更换 camera extrinsic。
【Paper】 机器人 pose 使用
人类则把 wrist 作为 end-effector origin,用 wrist、palm、thumb 和 middle finger 构造稳定 hand-centric frame;拇指到 palm 的距离经过线性归一化后充当 gripper openness。
(2) Cross-embodiment morphology conditioning#
【Paper】 机器人 morphology 由 URDF graph encoder 生成。图节点是 URDF joints,每个节点包含 joint type、axis、origin、limits、actuation 和到左右末端链的距离;消息传递后分别池化全身和操作链,形成 body / chain summary。人类视频没有 URDF,因此每个视频源学习一个 surrogate embedding ,吸收相机视场、视觉域和标注质量等稳定因素。
【Analysis】 token 只注入 action expert,不进入共享 VLM trunk。这样 VLM 学的是跨 embodiment 的视觉语言语义,动作头再根据具体机构解释同一 camera-space trajectory。
(3) Time-aligned action chunking#
不同数据源的控制频率为 时,目标物理窗口为 ,因此:
论文默认 秒;20 Hz 的 RoboCasa SFT 数据对应 40 steps。为减少 variable-length padding,采样器还按 task cluster、episode phase bucket 和 horizon bucket 构造 composite key。
(4) Egocentric video-to-action pipeline#

【Paper】 五个阶段分别是:
- Dataset curation:统一 clip id、帧号、相机内参、narration 和许可证;保留 4–30 秒片段。
- Video selection:ego-interaction filter 去除观察者视角,再用 image-captioning filter 要求同时出现 manipulation verb 和 object noun。
- 3D hand reconstruction:SAM3 做 2D tracking,HaMeR 估计 MANO pose,VIPE 提供相机运动;先拟合 root,再用 reprojection + temporal smoothness 做全局轨迹优化。
- Action parameterization:转为与机器人相同的 wrist / orientation / gripper / activity layout;磁盘保存 16-D Euler 版本,训练时转为 22-D continuous-6D 版本。
- Quality control:completeness、static、spike 和 bimanual filters 删除 NaN、静止片段、异常速度和不可信双手耦合。
产出的 1,478.9 小时视频并不被当作“机器人真值”,而是带有 dataset-level 和 step-level quality 的辅助监督。
4.3 关键公式#
Robot primary flow-matching loss#
给定干净机器人 action chunk 和噪声 ,采样 :
模型预测 velocity field ,目标为 :
是 padding、无效 arm 或越界投影的 action mask。
Human reliability-aware auxiliary loss#
人类目标先经过长度为 3 的 temporal smoothing,得到 。每个时间步和通道的权重为:
位置通道的静态 prior 为 1,旋转和 gripper 通道的 prior 为 0.001; 反映数据集整体质量, 根据局部速度和 jerk 超过数据集 95th percentile 的程度衰减。
其中 ,最终目标是:
【Analysis】 这组公式体现了一个清晰的风险预算:机器人标签决定主要 vector field,人类标签只在可靠维度、可靠时间片段上施加小幅度的鲁棒约束。
4.4 Training#
【Paper】 预训练使用 Qwen3-VL-4B-Instruct 和约 600M 参数的 flow-matching DiT action expert,在 128 张 A800 80GB 上训练 200K steps;AdamW 配合 cosine schedule,VLM learning rate 为 ,action expert 为 ,warmup 5K steps。输入图像为 ,推理时用 4 个 flow-matching steps 解码。
- 把机器人 pose 和人手轨迹转换为 22-D camera-space action,并按 建立时间对齐 chunk。
- 由 robot URDF graph 或 human source embedding 生成 morphology token,注入 action expert。
- 对机器人 chunk 加高斯噪声,计算全 action mask 下的 flow-matching primary loss。
- 对平滑后的人类 chunk 计算 dataset / step / channel reliability,使用归一化 Huber auxiliary loss。
- 按 更新 VLM、action expert、URDF encoder 和 human surrogate embeddings。
4.5 Inference#
【Paper】 推理时,VLM 编码当前 head / wrist 图像和语言,action expert 在 morphology token 条件下用 4 步 flow matching 生成 camera-space action chunk。部署到新机器人时,把输出的 camera-frame pose 用相机外参逆变换回执行 frame:
6D rotation 先通过 Gram–Schmidt 恢复为完整旋转矩阵,再交给机器人低层控制器。新 embodiment 需要注册 URDF 以取得 morphology token,并提供自己的 camera extrinsic 和 controller。
- 编码当前图像和指令,读取 robot URDF morphology token。
-
从高斯噪声开始,用 4 次 flow-matching 更新得到 camera-space 22-D action chunk。
-
将 6D rotation 正交化,并用 camera extrinsic 的逆变换转回机器人 base / torso frame。
- 交给低层控制器执行一段动作,获取下一次 observation 后闭环重复。
4.6 代码实现对照#
【Code】 论文给出的官方代码地址是 https://github.com/ACERobotics-VLA/ACE-Ego。在本次写作时,该地址返回 HTTP 404,项目主页也返回 GitHub Pages 404,因此无法访问 model definition、DataLoader、loss 或 checkpoint 文件。
【Analysis】 因为仓库内容不可访问,本文没有把论文附录中的超参数误写成“代码默认值”。可以核对的实现边界只有论文明确给出的配置:Qwen3-VL-4B-Instruct、约 600M DiT、 秒、4 步推理和 。若代码公开,优先检查 action mask、human source embedding、URDF graph cache 和 reliability weight 是否与论文一致。
5. 实验#
5.1 Experimental Setup#

【Paper】 评测覆盖两个仿真 benchmark 和一个真实双臂平台:
| Benchmark | 设置 | 评测协议 |
|---|---|---|
| RoboCasa GR1 TableTop | GR1 humanoid,24 个桌面任务 | 每任务 50 rollouts |
| RoboTwin 2.0 | 双臂,50 个任务,Easy / Hard domain randomization | 每任务 100 trials |
| ARX bimanual | Pick Tea、Scoop Coffee、Category Sorting、Sweep Cubes、Stack Bowls、Pack Shoes | 每任务 30 trials |
预训练池包含约 4.53K 小时机器人 / 仿真 action 和 1.48K 小时人类 pseudo-action。机器人来源包括 AgiBot Alpha/Beta、Galaxea R1Lite、AgiBot DigitalWorld、RoboCasa 和 Galbot;人类来源为 Ego4D、EgoExo4D、EPIC-KITCHENS-100、HOI4D、EgoDex、Xperience-10M。
5.2 Main Results#
【Paper】 ACE-Ego-0 在 RoboCasa 的 24 任务平均成功率为 72.8%,高于 DIAL 70.2%、JoyAI-RA 63.2% 和 ABot-M0 58.3%。在 RoboTwin 2.0 上,Easy 为 91.12%,Hard 为 90.62%,均高于表中对比方法。
| 方法 | RoboCasa 平均 | RoboTwin Easy | RoboTwin Hard |
|---|---|---|---|
| GR00T-N1.6 | 47.6 | - | - |
| FLARE | 55.0 | - | - |
| JoyAI-RA | 63.2 | 90.48 | 89.28 |
| DIAL | 70.2 | - | - |
| Hy-VLA | - | 90.90 | 90.10 |
| ACE-Ego-0 | 72.8 | 91.12 | 90.62 |

真实 ARX 平台上,ACE-Ego-0 六任务平均成功率为 78.3%,高于同数据 fine-tune 的 (71.7%)和 GR00T-N1.7(35.6%)。Scoop Coffee 上达到 86.7%,而 GR00T-N1.7 为 36.7%;Sweep Cubes 上 GR00T-N1.7 只有 6.7%,说明长轨迹和双臂同步仍是主要差异来源。
5.3 Ablation Study#

【Paper】 在 RoboCasa 上逐个移除组件:
| 配置 | 成功率 | 相对完整模型 |
|---|---|---|
| 完整 ACE-Ego-0 | 72.8% | - |
| 去掉 morphology token | 70.9% | -1.9 |
| 去掉 time-aligned chunking | 71.7% | -1.1 |
| 去掉 human auxiliary loss | 69.2% | -3.6 |
| Robot only(无人类视频) | 68.3% | -4.5 |
| From Qwen(无 embodied pretrain) | 65.4% | -7.4 |
【Analysis】 最大跌幅来自 reliability-aware human auxiliary loss,而不是 representation 模块。这说明将人类视频“纳入训练”本身不是关键,关键是让它以不破坏机器人主目标的方式纳入。
5.4 Generalization#
【Paper】 在 data-scarce 的 Sweep Cubes fine-tuning 中,只有 34 条机器人示教时成功率为 10%(1/10);加入 419 个任务匹配的人类视频 episode 后升至 40%(4/10)。人类轨迹覆盖的凸包面积为 0.296 ,机器人示教只有 0.062 ,扩大约 4.8 倍。

【Analysis】 这个实验支持一种更具体的泛化解释:人类视频未必提供精确的 gripper 或 rotation 标签,但可以填补 end-effector position 的行为覆盖空洞,尤其适合下游机器人数据稀缺的场景。
6. 方法分析#
6.1 为什么有效?#
【Analysis】 ACE-Ego-0 的增益可以拆成三个互补来源:
- 相机坐标降低学习难度:视觉输入和动作输出共享 reference frame,模型不必为每个机器人重新学习 world-to-camera 变换。
- morphology token 提供结构条件:相同的末端轨迹,在不同关节链和尺寸下对应不同控制可行性;URDF summary 让 action expert 看到这种差异。
- 人类数据扩大行为支持集:即使 pseudo-action 有噪声,position trajectory 的覆盖仍比少量机器人示教广;reliability weighting 将它限制在安全的监督维度。
6.2 核心创新#
【Paper】
- 将 spatial、structural、temporal alignment 放在进入共享 VLA objective 之前完成。
- 将 clean robot labels 和 noisy human labels 放进不同 loss path,而不是仅设置一个 dataset id。
- 用同一 morphology-token interface 处理 URDF graph 与 human surrogate embedding。
- 将大规模 human video 的价值从“模仿人类手指动作”转为“提供可筛选的 embodied behavior coverage”。
6.3 与已有方法的本质区别#
【Analysis】 与只做 cross-embodiment action tokenizer 的方法相比,ACE-Ego-0 还显式解决 camera frame 和 physical time;与直接把人类 pseudo-actions 做 behavior cloning 的方法相比,它把监督质量建模进 loss;与只用 latent intent 的 human-video 方法相比,它保留了可投影到机器人控制器的显式位置轨迹。
6.4 关键假设#
【Paper】 方法依赖以下假设:
- head-camera frame 足以作为不同 embodiment 的共同几何接口;
- wrist / hand-centric trajectory 对机器人 end-effector 是有用 proxy;
- position 比 rotation 和 gripper 更容易从第一视角视频可靠恢复;
- embodiment 的结构差异可以由 URDF summary 或 source-level surrogate token 概括;
- 2 秒左右的 physical horizon 能在不同数据集间提供可比较的短期控制窗口。
【Analysis】 这些假设在桌面操作上合理,但不自动推广到移动操作、全身控制、力觉或高度灵巧手任务。
7. 局限性#
7.1 作者明确提出的局限#
【Paper】 作者指出,当前评测主要集中在 tabletop manipulation;预训练池没有 dexterous hand data,也没有 force / torque sensing。人类 pseudo-action 在 rotation 和 fine-grained finger motion 上的 fidelity 仍有限,因此 reliability-aware objective 目前主要把监督集中到 position。
7.2 自己分析得到的局限#
【Analysis】
- 代码可复现性受限:论文给出的代码仓库和项目页在本次核对时均为 404,训练采样权重、URDF registry、质量阈值 manifest 和真实部署脚本无法独立验证。
- camera-space 不是完全 embodiment-agnostic:它仍依赖准确 extrinsic、相机视野和深度尺度;换成移动相机或严重遮挡视角时,统一坐标可能失效。
- human surrogate 过于 source-level:一个 embedding 只能表达数据集的平均偏差,无法反映同一数据源内部不同人的体型、相机高度和动作风格。
- 质量权重可能放大选择偏差:用速度、jerk 和存活率估计可靠性,可能把真实的快速接触动作误判为 reconstruction failure。
- 结果仍有长程退化:Pack Shoes 等长 horizon 任务上所有模型都明显下降,说明预训练规模并没有消除闭环漂移和阶段切换问题。
8. 启发与研究思考#
【Analysis】 我认为 ACE-Ego-0 给 VLA 数据规模化提供了三个可迁移的设计原则:
- 先统一接口,再混合数据:坐标、时间、动作维度和 mask 应在 shared backbone 之前标准化,而不是让模型自己猜 dataset convention。
- 把标签质量当作一等公民:数据集 id 只能告诉模型“来自哪里”,reliability map 才能告诉它“这一维、这一帧到底该信多少”。
- 人类视频更适合做 coverage prior:在机器人示教很少时,人类视频最有价值的部分可能是 position-level 行为分布和视觉语义,而不是完整的机器人 action imitation。
后续值得验证的方向包括:用不确定性模型替代手工的 和 jerk 阈值;把 force / tactile reliability 纳入同一 objective;让 human morphology 从单一 source token 变成由视觉估计的连续条件;以及测试 camera-space interface 在 mobile manipulation 和 whole-body humanoid control 中是否仍然成立。