Hana's Blog
ACE-Ego-0 论文精读:把第一视角人类视频变成 VLA 的可用动作监督Blur image
Arxiv ID 2606.17200
幻觉翻译 2606.17200
publication pending

ACE-Ego-0 将第一视角人类视频转换为带质量估计的 camera-space pseudo-actions,并用形态条件、物理时间对齐和可靠性加权辅助损失与机器人数据共同预训练 VLA。

推荐指数:

1. 论文概述#

论文名称:《ACE-Ego-0: Unifying Egocentric Human and Robotic Data for VLA Pretraining》

作者:Hao Li、Ganlong Zhao、Yufei Liu、Haotian Hou、Guoquan Ye、Tongyan Fang、Chunxiao Liu、Siyuan Huang、Jianbo Liu、Xiaogang Wang、Hongsheng Li

论文 / 项目 / 代码arXiv · Project Page · ACE-Ego

ACE-Ego-0 将机器人、仿真和第一视角人类视频统一到同一个 VLA 预训练框架(论文 teaser)

一句话总结#

【Paper】 ACE-Ego-0 解决的不是“如何再收集一个机器人数据集”,而是如何把便宜、规模大但动作标签噪声高的第一视角人类视频,安全地接入机器人 VLA 的训练目标。它沿空间、结构、时间三条轴统一 action representation,再用 reliability-aware human auxiliary loss 隔离 pseudo-action 的噪声。

核心贡献#

【Paper】

  1. 统一动作接口:机器人末端和人手轨迹都转换到 head-camera 坐标系,使用 22 维双臂 action;再加入 robot URDF 或 human source surrogate 的 morphology token。
  2. 时间对齐:按物理时长而不是固定帧数构造 action chunk,使 10–30 Hz 的数据覆盖相同未来时间窗口。
  3. 可靠性加权监督:机器人数据使用完整的 primary flow-matching loss;人类 pseudo-actions 只通过带通道和时间步权重的 Huber auxiliary loss 参与。
  4. 可扩展数据管线:从 Ego4D、EgoExo4D、EPIC-KITCHENS-100、HOI4D、EgoDex、Xperience-10M 中产出 1,478.9 小时 pseudo-action 视频,与 4,534.8+ 小时机器人 / 仿真数据组成 6,013.7+ 小时混合池。
  5. 实验结果:RoboCasa GR1 TableTop 平均成功率 72.8%,RoboTwin 2.0 Easy / Hard 为 91.12% / 90.62%,真实 ARX 双臂平台六项任务平均成功率为 78.3%。

【Analysis】 ACE-Ego-0 的真正创新是把“表示对齐”和“标签可信度”拆成两个正交问题:同一个坐标系并不意味着标签同样可靠,二者必须分别处理。

2. 背景与相关工作#

【Paper】 VLA 的性能通常随 embodied data 的规模和多样性增长,但机器人示教需要遥操作、标定和传感器记录,扩展成本很高。第一视角人类视频覆盖厨房、家庭和工作台中的长尾操作,采集便宜得多,因此成为有吸引力的补充监督。

困难在于,两类数据同时存在四种错位:

错位机器人示教人类视频 pseudo-action
空间base / world / camera 等不同坐标手部重建常在 local frame,且有深度歧义
结构不同机械臂、关节链、夹爪行程没有 URDF,只有人手形态
时间10–30 Hz、不同 chunk 步数视频帧率和动作持续时间不一致
监督质量传感器记录的高保真 action遮挡、抖动、追踪失败导致噪声

已有 cross-embodiment VLA 往往解决共享 action space 或 embodiment tokenizer,但没有同时处理 camera frame、kinematic structure 和 control frequency。另一方面,EgoMimic、HumanPlus、EgoVLA 等方法从人类视频恢复手部或接触轨迹,却容易把 noisy pseudo-actions 当作机器人真值直接训练。

【Analysis】 直接混合数据的隐患不是“人类视频没有用”,而是高质量机器人标签会被低质量标签的统计偏差拖动。ACE-Ego-0 让人类视频主要提供行为覆盖和视觉先验,把精确控制锚定在机器人数据上。

3. 问题定义#

给定多视角图像 oto_t、语言指令 ll、embodiment 信息 mm,策略需要输出未来一段 camera-space action chunk:

πθ(ot,l,m)a^t:t+Hd1,\pi_\theta(o_t,l,m) \rightarrow \hat{\mathbf a}_{t:t+H_d-1},

其中 HdH_d 随数据源控制频率 fdf_d 改变,但对应相同的物理时长 TT^\star。每个双臂 action 为 22 维:

at=[at,L;at,R],at,h=[px,py,pz,r1,,r6,g,α].\mathbf a_t = [\mathbf a_{t,L};\mathbf a_{t,R}],\qquad \mathbf a_{t,h}=[p_x,p_y,p_z,r_1,\ldots,r_6,g,\alpha].
项目定义
Observationhead / wrist RGB 图像和语言指令
Actioncamera-space 末端 / 手腕位置、6D 旋转、gripper、activity flag
RobotAgiBot、Galaxea、Galbot、GR1 等多种 embodiment
Human六个第一视角视频来源,经 3D hand reconstruction 得到 pseudo-action
训练目标机器人 primary flow matching + 人类 reliability-aware auxiliary loss

【Paper】 论文把人类动作视为可用但不等价于机器人传感器标签的 supervision。因而目标不是让人手轨迹完全“伪装成”机器人轨迹,而是在共享接口中保留它们的质量差异。

4. 方法#

4.1 Overall Architecture#

ACE-Ego-0 总体架构:Qwen3-VL 提供视觉语言表示,带 morphology token 的 action expert 通过 flow matching 输出 camera-space action(论文 Figure 2)

【Paper】 Qwen3-VL-4B-Instruct 编码 head / wrist 图像与语言;约 600M 参数的 flow-matching DiT action expert 额外接收 morphology token,输出按物理时间对齐的连续 action chunk。机器人样本进入 primary loss,人类样本进入 reliability-aware auxiliary loss。

数据流只有一条共享接口:

图像 + 指令 ──> Qwen3-VL ──> action expert ──> camera-space action chunk

                   robot URDF / human surrogate morphology token
text

4.2 核心模块#

(1) Camera-space action#

  • 输入:机器人在 source frame ss 中的末端 pose,或人手重建得到的 wrist / palm 几何。
  • 中间模块:外参变换、连续 6D rotation、hand-centric frame、gripper normalization。
  • 输出:统一的双臂 22-D action。
  • 作用:观测和动作位于同一个 head-camera frame,换 embodiment 时只需更换 camera extrinsic。

【Paper】 机器人 pose 使用

pcam=Rcamsps+tcams,Rcam,ee=RcamsRs,ee.p_{\mathrm{cam}}=R_{\mathrm{cam}\leftarrow s}p_s+t_{\mathrm{cam}\leftarrow s}, \qquad R_{\mathrm{cam},ee}=R_{\mathrm{cam}\leftarrow s}R_{s,ee}.

人类则把 wrist 作为 end-effector origin,用 wrist、palm、thumb 和 middle finger 构造稳定 hand-centric frame;拇指到 palm 的距离经过线性归一化后充当 gripper openness。

(2) Cross-embodiment morphology conditioning#

【Paper】 机器人 morphology 由 URDF graph encoder 生成。图节点是 URDF joints,每个节点包含 joint type、axis、origin、limits、actuation 和到左右末端链的距离;消息传递后分别池化全身和操作链,形成 body / chain summary。人类视频没有 URDF,因此每个视频源学习一个 surrogate embedding ede_d,吸收相机视场、视觉域和标注质量等稳定因素。

hmorph={Pmorph(Eurdf(Gr)),robot,Psurr(ed),human video.h_{\mathrm{morph}}= \begin{cases} P_{\mathrm{morph}}(E_{\mathrm{urdf}}(\mathcal G_r)),&\text{robot},\\ P_{\mathrm{surr}}(e_d),&\text{human video}. \end{cases}

【Analysis】 token 只注入 action expert,不进入共享 VLM trunk。这样 VLM 学的是跨 embodiment 的视觉语言语义,动作头再根据具体机构解释同一 camera-space trajectory。

(3) Time-aligned action chunking#

不同数据源的控制频率为 fdf_d 时,目标物理窗口为 TT^\star,因此:

Hd=round(fdT).H_d=\operatorname{round}(f_dT^\star).

论文默认 T=2T^\star=2 秒;20 Hz 的 RoboCasa SFT 数据对应 40 steps。为减少 variable-length padding,采样器还按 task cluster、episode phase bucket 和 horizon bucket 构造 composite key。

(4) Egocentric video-to-action pipeline#

将原始第一视角视频转为 camera-space pseudo-actions 的五阶段管线(论文 Figure 4)

【Paper】 五个阶段分别是:

  1. Dataset curation:统一 clip id、帧号、相机内参、narration 和许可证;保留 4–30 秒片段。
  2. Video selection:ego-interaction filter 去除观察者视角,再用 image-captioning filter 要求同时出现 manipulation verb 和 object noun。
  3. 3D hand reconstruction:SAM3 做 2D tracking,HaMeR 估计 MANO pose,VIPE 提供相机运动;先拟合 root,再用 reprojection + temporal smoothness 做全局轨迹优化。
  4. Action parameterization:转为与机器人相同的 wrist / orientation / gripper / activity layout;磁盘保存 16-D Euler 版本,训练时转为 22-D continuous-6D 版本。
  5. Quality control:completeness、static、spike 和 bimanual filters 删除 NaN、静止片段、异常速度和不可信双手耦合。

产出的 1,478.9 小时视频并不被当作“机器人真值”,而是带有 dataset-level 和 step-level quality 的辅助监督。

4.3 关键公式#

Robot primary flow-matching loss#

给定干净机器人 action chunk a\mathbf a 和噪声 ϵN(0,I)\boldsymbol\epsilon\sim\mathcal N(0,I),采样 sU(0,1)s\sim\mathcal U(0,1)

as=sa+(1s)ϵ.\mathbf a_s=s\mathbf a+(1-s)\boldsymbol\epsilon.

模型预测 velocity field v^θ(as,s)\hat v_\theta(\mathbf a_s,s),目标为 aϵ\mathbf a-\boldsymbol\epsilon

Laction=Es,ϵt,jMt,jv^θ(as,s)t,j(aϵ)t,j2.\mathcal L_{\mathrm{action}}= \mathbb E_{s,\boldsymbol\epsilon} \sum_{t,j}M_{t,j} \left\|\hat v_\theta(\mathbf a_s,s)_{t,j}-(\mathbf a-\boldsymbol\epsilon)_{t,j}\right\|^2.

Mt,jM_{t,j} 是 padding、无效 arm 或越界投影的 action mask。

Human reliability-aware auxiliary loss#

人类目标先经过长度为 3 的 temporal smoothing,得到 a~\tilde{\mathbf a}。每个时间步和通道的权重为:

Wt,j=ρjwdata(d,h(j))wstep(t,h(j)).W_{t,j}=\rho_j\,w_{\mathrm{data}}(d,h(j))\,w_{\mathrm{step}}(t,h(j)).

位置通道的静态 prior 为 1,旋转和 gripper 通道的 prior 为 0.001;wdata[0.25,1]w_{\mathrm{data}}\in[0.25,1] 反映数据集整体质量,wstepw_{\mathrm{step}} 根据局部速度和 jerk 超过数据集 95th percentile 的程度衰减。

Lhaux=Es,ϵ1Zt,jMt,jWt,jHuberβ(v^θ(as,s)t,j(a~ϵ)t,j),\mathcal L_{\mathrm{haux}}= \mathbb E_{s,\boldsymbol\epsilon}\frac1Z \sum_{t,j}M_{t,j}W_{t,j} \operatorname{Huber}_\beta\left( \hat v_\theta(\mathbf a_s,s)_{t,j}-(\tilde{\mathbf a}-\boldsymbol\epsilon)_{t,j} \right),

其中 Z=t,jMt,jWt,jZ=\sum_{t,j}M_{t,j}W_{t,j},最终目标是:

L=Laction+λhauxLhaux,λhaux=0.1.\mathcal L=\mathcal L_{\mathrm{action}}+\lambda_{\mathrm{haux}}\mathcal L_{\mathrm{haux}}, \qquad \lambda_{\mathrm{haux}}=0.1.

【Analysis】 这组公式体现了一个清晰的风险预算:机器人标签决定主要 vector field,人类标签只在可靠维度、可靠时间片段上施加小幅度的鲁棒约束。

4.4 Training#

【Paper】 预训练使用 Qwen3-VL-4B-Instruct 和约 600M 参数的 flow-matching DiT action expert,在 128 张 A800 80GB 上训练 200K steps;AdamW 配合 cosine schedule,VLM learning rate 为 2×1052\times10^{-5},action expert 为 10410^{-4},warmup 5K steps。输入图像为 256×256256\times256,推理时用 4 个 flow-matching steps 解码。

Algorithm 1 ACE-Ego-0 混合数据训练
输入:
机器人 action 数据、人类 pseudo-action 数据、图像、语言、URDF 或 human source id。
输出:
统一 camera-space VLA policy πθ\pi_\theta
  1. 把机器人 pose 和人手轨迹转换为 22-D camera-space action,并按 Hd=round(fdT)H_d=\operatorname{round}(f_dT^\star) 建立时间对齐 chunk。
  2. 由 robot URDF graph 或 human source embedding 生成 morphology token,注入 action expert。
  3. 对机器人 chunk 加高斯噪声,计算全 action mask 下的 flow-matching primary loss。
  4. 对平滑后的人类 chunk 计算 dataset / step / channel reliability,使用归一化 Huber auxiliary loss。
  5. L=Laction+0.1Lhaux\mathcal L=\mathcal L_{\mathrm{action}}+0.1\mathcal L_{\mathrm{haux}} 更新 VLM、action expert、URDF encoder 和 human surrogate embeddings。

4.5 Inference#

【Paper】 推理时,VLM 编码当前 head / wrist 图像和语言,action expert 在 morphology token 条件下用 4 步 flow matching 生成 camera-space action chunk。部署到新机器人时,把输出的 camera-frame pose 用相机外参逆变换回执行 frame:

p^s=Rcams(p^camtcams),R^s,ee=RcamsR^cam,ee.\hat p_s=R_{\mathrm{cam}\leftarrow s}^{\top}(\hat p_{\mathrm{cam}}-t_{\mathrm{cam}\leftarrow s}), \qquad \hat R_{s,ee}=R_{\mathrm{cam}\leftarrow s}^{\top}\hat R_{\mathrm{cam},ee}.

6D rotation 先通过 Gram–Schmidt 恢复为完整旋转矩阵,再交给机器人低层控制器。新 embodiment 需要注册 URDF 以取得 morphology token,并提供自己的 camera extrinsic 和 controller。

Algorithm 2 ACE-Ego-0 camera-space 推理
输入:
当前多视角图像、语言指令、目标机器人 URDF、camera extrinsic。
输出:
执行 frame 中的连续 action chunk。
  1. 编码当前图像和指令,读取 robot URDF morphology token。
  2. 从高斯噪声开始,用 4 次 flow-matching 更新得到 camera-space 22-D action chunk。

  3. 将 6D rotation 正交化,并用 camera extrinsic 的逆变换转回机器人 base / torso frame。

  4. 交给低层控制器执行一段动作,获取下一次 observation 后闭环重复。

4.6 代码实现对照#

【Code】 论文给出的官方代码地址是 https://github.com/ACERobotics-VLA/ACE-Ego。在本次写作时,该地址返回 HTTP 404,项目主页也返回 GitHub Pages 404,因此无法访问 model definition、DataLoader、loss 或 checkpoint 文件。

【Analysis】 因为仓库内容不可访问,本文没有把论文附录中的超参数误写成“代码默认值”。可以核对的实现边界只有论文明确给出的配置:Qwen3-VL-4B-Instruct、约 600M DiT、T=2T^\star=2 秒、4 步推理和 λhaux=0.1\lambda_{\mathrm{haux}}=0.1。若代码公开,优先检查 action mask、human source embedding、URDF graph cache 和 reliability weight 是否与论文一致。

5. 实验#

5.1 Experimental Setup#

ACE-Ego-0 预训练数据处理概览:从视频筛选、手部重建到质量控制(论文 Figure 3)

【Paper】 评测覆盖两个仿真 benchmark 和一个真实双臂平台:

Benchmark设置评测协议
RoboCasa GR1 TableTopGR1 humanoid,24 个桌面任务每任务 50 rollouts
RoboTwin 2.0双臂,50 个任务,Easy / Hard domain randomization每任务 100 trials
ARX bimanualPick Tea、Scoop Coffee、Category Sorting、Sweep Cubes、Stack Bowls、Pack Shoes每任务 30 trials

预训练池包含约 4.53K 小时机器人 / 仿真 action 和 1.48K 小时人类 pseudo-action。机器人来源包括 AgiBot Alpha/Beta、Galaxea R1Lite、AgiBot DigitalWorld、RoboCasa 和 Galbot;人类来源为 Ego4D、EgoExo4D、EPIC-KITCHENS-100、HOI4D、EgoDex、Xperience-10M。

5.2 Main Results#

【Paper】 ACE-Ego-0 在 RoboCasa 的 24 任务平均成功率为 72.8%,高于 DIAL 70.2%、JoyAI-RA 63.2% 和 ABot-M0 58.3%。在 RoboTwin 2.0 上,Easy 为 91.12%,Hard 为 90.62%,均高于表中对比方法。

方法RoboCasa 平均RoboTwin EasyRoboTwin Hard
GR00T-N1.647.6--
FLARE55.0--
JoyAI-RA63.290.4889.28
DIAL70.2--
Hy-VLA-90.9090.10
ACE-Ego-072.891.1290.62

ARX 真实双臂任务结果:ACE-Ego-0 与 π0.5、GR00T-N1.7 的比较(论文 Figure 7a)

真实 ARX 平台上,ACE-Ego-0 六任务平均成功率为 78.3%,高于同数据 fine-tune 的 π0.5\pi_{0.5}(71.7%)和 GR00T-N1.7(35.6%)。Scoop Coffee 上达到 86.7%,而 GR00T-N1.7 为 36.7%;Sweep Cubes 上 GR00T-N1.7 只有 6.7%,说明长轨迹和双臂同步仍是主要差异来源。

5.3 Ablation Study#

RoboCasa 组件消融:移除 morphology、时间对齐或 reliability-aware loss 的性能下降(论文 Figure 7b)

【Paper】 在 RoboCasa 上逐个移除组件:

配置成功率相对完整模型
完整 ACE-Ego-072.8%-
去掉 morphology token70.9%-1.9
去掉 time-aligned chunking71.7%-1.1
去掉 human auxiliary loss69.2%-3.6
Robot only(无人类视频)68.3%-4.5
From Qwen(无 embodied pretrain)65.4%-7.4

【Analysis】 最大跌幅来自 reliability-aware human auxiliary loss,而不是 representation 模块。这说明将人类视频“纳入训练”本身不是关键,关键是让它以不破坏机器人主目标的方式纳入。

5.4 Generalization#

【Paper】 在 data-scarce 的 Sweep Cubes fine-tuning 中,只有 34 条机器人示教时成功率为 10%(1/10);加入 419 个任务匹配的人类视频 episode 后升至 40%(4/10)。人类轨迹覆盖的凸包面积为 0.296 m2\mathrm m^2,机器人示教只有 0.062 m2\mathrm m^2,扩大约 4.8 倍。

Sweep Cubes 微调数据的动作覆盖:机器人示教、人类视频和叠加分布(论文 Figure 8)

【Analysis】 这个实验支持一种更具体的泛化解释:人类视频未必提供精确的 gripper 或 rotation 标签,但可以填补 end-effector position 的行为覆盖空洞,尤其适合下游机器人数据稀缺的场景。

6. 方法分析#

6.1 为什么有效?#

【Analysis】 ACE-Ego-0 的增益可以拆成三个互补来源:

  1. 相机坐标降低学习难度:视觉输入和动作输出共享 reference frame,模型不必为每个机器人重新学习 world-to-camera 变换。
  2. morphology token 提供结构条件:相同的末端轨迹,在不同关节链和尺寸下对应不同控制可行性;URDF summary 让 action expert 看到这种差异。
  3. 人类数据扩大行为支持集:即使 pseudo-action 有噪声,position trajectory 的覆盖仍比少量机器人示教广;reliability weighting 将它限制在安全的监督维度。

6.2 核心创新#

【Paper】

  • 将 spatial、structural、temporal alignment 放在进入共享 VLA objective 之前完成。
  • 将 clean robot labels 和 noisy human labels 放进不同 loss path,而不是仅设置一个 dataset id。
  • 用同一 morphology-token interface 处理 URDF graph 与 human surrogate embedding。
  • 将大规模 human video 的价值从“模仿人类手指动作”转为“提供可筛选的 embodied behavior coverage”。

6.3 与已有方法的本质区别#

【Analysis】 与只做 cross-embodiment action tokenizer 的方法相比,ACE-Ego-0 还显式解决 camera frame 和 physical time;与直接把人类 pseudo-actions 做 behavior cloning 的方法相比,它把监督质量建模进 loss;与只用 latent intent 的 human-video 方法相比,它保留了可投影到机器人控制器的显式位置轨迹。

6.4 关键假设#

【Paper】 方法依赖以下假设:

  • head-camera frame 足以作为不同 embodiment 的共同几何接口;
  • wrist / hand-centric trajectory 对机器人 end-effector 是有用 proxy;
  • position 比 rotation 和 gripper 更容易从第一视角视频可靠恢复;
  • embodiment 的结构差异可以由 URDF summary 或 source-level surrogate token 概括;
  • 2 秒左右的 physical horizon 能在不同数据集间提供可比较的短期控制窗口。

【Analysis】 这些假设在桌面操作上合理,但不自动推广到移动操作、全身控制、力觉或高度灵巧手任务。

7. 局限性#

7.1 作者明确提出的局限#

【Paper】 作者指出,当前评测主要集中在 tabletop manipulation;预训练池没有 dexterous hand data,也没有 force / torque sensing。人类 pseudo-action 在 rotation 和 fine-grained finger motion 上的 fidelity 仍有限,因此 reliability-aware objective 目前主要把监督集中到 position。

7.2 自己分析得到的局限#

【Analysis】

  1. 代码可复现性受限:论文给出的代码仓库和项目页在本次核对时均为 404,训练采样权重、URDF registry、质量阈值 manifest 和真实部署脚本无法独立验证。
  2. camera-space 不是完全 embodiment-agnostic:它仍依赖准确 extrinsic、相机视野和深度尺度;换成移动相机或严重遮挡视角时,统一坐标可能失效。
  3. human surrogate 过于 source-level:一个 embedding 只能表达数据集的平均偏差,无法反映同一数据源内部不同人的体型、相机高度和动作风格。
  4. 质量权重可能放大选择偏差:用速度、jerk 和存活率估计可靠性,可能把真实的快速接触动作误判为 reconstruction failure。
  5. 结果仍有长程退化:Pack Shoes 等长 horizon 任务上所有模型都明显下降,说明预训练规模并没有消除闭环漂移和阶段切换问题。

8. 启发与研究思考#

【Analysis】 我认为 ACE-Ego-0 给 VLA 数据规模化提供了三个可迁移的设计原则:

  1. 先统一接口,再混合数据:坐标、时间、动作维度和 mask 应在 shared backbone 之前标准化,而不是让模型自己猜 dataset convention。
  2. 把标签质量当作一等公民:数据集 id 只能告诉模型“来自哪里”,reliability map 才能告诉它“这一维、这一帧到底该信多少”。
  3. 人类视频更适合做 coverage prior:在机器人示教很少时,人类视频最有价值的部分可能是 position-level 行为分布和视觉语义,而不是完整的机器人 action imitation。

后续值得验证的方向包括:用不确定性模型替代手工的 ρj\rho_j 和 jerk 阈值;把 force / tactile reliability 纳入同一 objective;让 human morphology 从单一 source token 变成由视觉估计的连续条件;以及测试 camera-space interface 在 mobile manipulation 和 whole-body humanoid control 中是否仍然成立。

ACE-Ego-0 论文精读:把第一视角人类视频变成 VLA 的可用动作监督
https://agusexp25.top/en/blog/paper-deep-dive-ace-ego-0
Author 菊花花
Published at August 25, 2026