Hana's Blog
EgoInfinity 论文精读:把任意视角网络视频编译成可执行机器人动作Blur image
Arxiv ID 2606.17385
幻觉翻译 2606.17385
publication pending

EgoInfinity 将带文本描述的任意视角 RGB 人类视频提升为度量 4D 手—物交互,再以交互感知修正和机器人专属 retargeter 生成可执行轨迹。

推荐指数:

1. 论文概述#

【Paper】 EgoInfinity 不把网络视频直接当作 2D pseudo-action,而是建设一个可替换模块组成的 4D hand-object interaction(HOI)data engine。输入为带语义标注的 RGB 视频,输出为米制手部轨迹、物体点云/网格、6-DoF 物体轨迹与交互状态;这些 agent-agnostic 表示随后可被编译到不同机器人上。

EgoInfinity 数据引擎总览(论文 pipeline 图)

一句话总结#

【Analysis】 这篇论文的关键不是“从视频恢复一只手”,而是把异构视觉模型的输出校到同一度量坐标系,并让接触状态决定物体怎么动。只有这样,web video 才从看起来合理的影像变成可送入 IK 与 policy 的数据资产。

核心贡献#

【Paper】

  1. 提出面向 web-scale 的模块化 4D HOI 数据引擎,自动完成目标物体发现、度量几何、手物体追踪、交互修正与坐标重构,无需 mocap、深度相机、CAD、wearable 或人工指定物体。
  2. 以 MoGe-2、Flow3r、GeoCalib、WiLoR、SAM-3/SAM-2、SAM-3D 等模块建立共享的 metric camera frame,而非直接拼接彼此尺度不一致的预测。
  3. 利用 staticgraspedmoving 交互状态修正物体 6-DoF:握住时绑定到手,静止时锁定至稳健点云中心,降低纯视觉跟踪漂移。
  4. 提出机器人专属、SE(3)SE(3)-equivariant 的根坐标估计器,以 flow matching 对部分可见人体带来的多解性采样,并用 IK 可行性选择候选。
  5. 在 106 段 Action100M 操作视频上展示跨 Unitree G1、Robonaut2、双 Franka FR3 的 retargeting,以及 LEAP 手抓取和 Franka 切、倒、擦等真实机器人演示。

2. 背景与相关工作#

【Paper】 实验室和工厂示教具备 robot-compatible action,却受场地、对象与操作者限制;网络视频覆盖更广,却没有尺度、物体 6-DoF、接触状态和机器人关节轨迹。仅在 2D 画面或像素空间对齐人类动作,容易产生视觉上流畅但物理上未 grounding 的 pseudo-action。

【Paper】 EgoInfinity 利用 Action100M 的文本标注做语言 grounding:Action100M 本身含 1.47 亿 action segments、约 14.6 年视频。论文不宣称一次性发布一个静态大数据集,而强调一个能伴随其中各感知模块进步而更新的 data engine。

【Analysis】 这与传统 video imitation 的分界在于中间表示。若中间层是二维手腕轨迹,之后的 retargeter 只能猜深度;若中间层保留有尺度的手、物体、重力和接触关系,retargeter 才有机会把“同一个任务意图”迁移给形态不同的机器人。

3. 问题定义#

【Paper】 给定一段长度为 TT 的 RGB 视频 V1:TV_{1:T} 及其文本描述 dd,引擎生成每帧的手与物体状态:

Ht={Mth,Kth,cpth,Pto,Mo,cpto,st}.\mathcal H_t=\{\mathcal M_t^h,\mathcal K_t^h,{}^c\mathbf p_t^h, \mathcal P_t^o,\mathcal M^o,{}^c\mathbf p_t^o,s_t\}.

其中,Mth\mathcal M_t^hKth\mathcal K_t^h 是 MANO 手网格和关键点,cpthSE(3){}^c\mathbf p_t^h\in SE(3) 是相机系手位姿;Pto\mathcal P_t^oMo\mathcal M^ocpto{}^c\mathbf p_t^o 分别为物体点云、网格和 6-DoF 位姿,sts_t 是交互状态。目标不是恢复完整人体,而是产出能被下游 robot embodiment 使用的 agent-agnostic 交互表示。

对于目标机器人 rr,retargeter 接收手部轨迹与可选重力 cg{}^c\mathbf g,估计根坐标 cpr{}^c\mathbf p^r,再寻找满足机器人运动学的关节轨迹 q1:Tq_{1:T}。这使得只有手出现在画面中时,仍能定义机器人 torso/base 下的可执行目标。

4. 方法#

4.1 Overall Architecture#

从重建手轨迹到跨 embodiment 运动 retargeting(论文 Figure:Retargeting pipeline)

【Paper】 数据流为:视频与语义描述 → 共享度量几何下的手/物体重建 → interaction-aware refinement → 4D HOI → 机器人根坐标候选 → IK 与后处理关节轨迹。架构中的前半段刻画“人做了什么”,后半段处理“这个机器人怎样做”。

4.2 核心模块#

共享度量几何与自动目标发现#

【Paper】 系统先以 WiLoR 进行轻量 Pass 1,找出有手且满足手部运动/相机运动线索的片段;仅对活跃片段运行昂贵的 Pass 2。MoGe-2 估计焦距和全局 metric scale,Flow3r 提供密集深度,GeoCalib 从早期帧估计重力。WiLoR 输出 MANO pose/shape、手网格和关键点;缺失或不稳定帧由 infilling 模块补全。

【Paper】 目标物体不由人手选定。系统从视频描述抽取 object noun,以 SAM-3 的文本提示定位目标,再以 SAM-2 沿时间传播 mask;mask 与深度反投影为每帧物体点云,视觉证据充足时由 SAM-3D 生成网格,FoundationPose++ 跟踪同一 metric frame 中的 6-DoF 位姿。

Interaction-Aware Refinement#

【Paper】 视觉跟踪的核心失败是:物体本应静止却漂移,握住时被遮挡而位姿跳变。EgoInfinity 先由 mask/depth 给出初始物体提议,再以 MEMFOF optical flow 与手关键点将帧归入 staticgraspedmoving。在握持段,物体按 palm-aligned canonical transform 刚性绑定到手;静止段使用稳健点云中心锁定;移动段保留视觉提议,最后过滤不合理尺度和背景误检。

【Analysis】 这里的物理性来自“状态条件下该信谁”,不是一个端到端 physics simulator:抓住时手是比受遮挡物体更可靠的参考,未接触时反而不应让手带动物体。这种不对称约束正好压住单目重建最典型的 drift。

部分人体可见下的 root-frame 估计#

【Paper】 根坐标网络 Φ\Phi 的输入是双手位姿轨迹和可选重力,输出相机系的机器人 root pose。它使用 Vector Neuron(VN)层和 VN-Transformer:先用手位置中心化得到 translation equivariance,再以 3D vector feature 保持 rotation equivariance;rotation head 的两个向量经 Gram—Schmidt 变为 SO(3)SO(3) 矩阵,translation 则预测 root-relative offset。

【Paper】 由于相同手部轨迹可对应多个身体/torso 姿态,作者不用确定性回归,而以 conditional flow matching 建模根坐标分布。模型在 MuJoCo 中为每个目标机器人独立训练,用程序生成的手轨迹与随机相机提供监督,并注入 tracking noise、tracking jump、手遮挡和 gravity noise;30% 样本丢弃重力输入。

4.3 关键公式#

【Paper】 手和物体模块必须先处于同一相机系与米制尺度,初始 HOI 状态才可写为:

Ht={Mth,Kth,cpth,Pto,Mo,cpto}.\mathcal H_t= \{\mathcal M_t^h,\mathcal K_t^h,{}^c\mathbf p_t^h, \mathcal P_t^o,\mathcal M^o,{}^c\mathbf p_t^o\}.

上标 cc 表示 camera frame;cpSE(3){}^c\mathbf p\in SE(3) 同时编码旋转与平移。这里的共享坐标是接触判断、绑定和 retargeting 的前提,而非展示层的可选附加信息。

对于根坐标估计,论文要求任意刚体变换 GSE(3)\mathbf G\in SE(3) 下满足:

GΦ(x)=Φ(Gx),\mathbf G\cdot\Phi(\mathbf x)=\Phi(\mathbf G\cdot\mathbf x),

其中 x\mathbf x 为手轨迹与可选重力。它保证把输入视频的相机系整体旋转/平移后,预测 root frame 也作同样变换,而不是依赖某个固定相机朝向。

translation head 的恢复式为:

ctr=cRrv+c.{}^c\mathbf t^r={}^c\mathbf R^r\mathbf v+\mathbf c.

cRr{}^c\mathbf R^r 是预测的根旋转,v\mathbf v 是 root-relative offset,c\mathbf c 是手位置质心。通过预测中心化后的相对位移,网络避免直接回归随相机平移变化的绝对坐标。

4.4 Training#

【Paper】 训练分为两类。数据引擎本身组合既有感知模块,并没有在文中定义一个统一的端到端可训练损失;目标机器人上的 Φ\Phi 则完全用 MuJoCo 合成数据训练:在操作工作区附近生成平滑双手 Cartesian 轨迹,使用 warm-started position-only IK 与样条构造可行 motion,再随机采样相机,将手轨迹和真值 root pose 变到 camera frame。

Algorithm 1 Robot-Specific Root Estimator Training
输入:
目标机器人的 MuJoCo 模型、操作工作区与噪声增强配置
输出:
该机器人的 conditional flow root-frame estimator Φ\Phi
  1. 采样近似可操作的关节参考姿态,并生成以末端为锚点的平滑双手轨迹
  2. 用 warm-start IK 与样条插值得到对应的根坐标和时间序列
  3. 采样虚拟相机,将手轨迹、重力和 root pose 变换到 camera frame
  4. 加入轨迹噪声、跳变、手遮挡和重力扰动;部分样本移除重力
  5. 以 conditional flow matching 学习根坐标的条件分布
  6. return 保存机器人专属的 Φ\Phi

4.5 Inference#

【Paper】 对一段视频,flow model 在重叠时间窗中生成多个 root-frame 假设;论文使用 20 步 Euler 积分采样。候选先经 kk-means 聚类,窗口级估计用 translation 线性插值和 rotation SLERP 变为每帧 root trajectory。每个候选随后接受带 warm start、null-space regularization 的 sequential IK 评估,按收敛率、末端残差、manipulability、关节限位余量与平滑度选优;失败帧插值,手指再从 MANO keypoint 做机器人专属几何映射。

Algorithm 2 Any-View Video-to-Robot Retargeting
输入:
RGB 视频、语义描述、目标机器人与训练好的 Φ\Phi
输出:
可执行的关节轨迹 q1:Tq_{1:T}
  1. 筛出 hand-present 片段,恢复共享度量下的手、物体、深度与重力
  2. 用语义 prompt 定位/追踪物体,并按交互状态修正 6-DoF 轨迹
  3. 在每个窗口以 flow model 采样并聚类多个 root-frame 候选
  4. 将候选插值为每帧 root trajectory,并运行 warm-start sequential IK
  5. 按 IK 成功率、误差、限位、manipulability 与平滑度选出最优候选
  6. return 后处理失败帧和手指关节,输出 q1:Tq_{1:T}

4.6 代码实现对照#

【Code】 截至本文写作时,arXiv 和官方 Hugging Face 页面没有给出可运行的 EgoInfinity data-engine 或 retargeter 源码,故不能把论文中的模块、loss 或超参数当作已经可复现的实现。frontmatter 的 code 因而保持为空。

【Code】 官方发布的是 EgoInfinity Browser 与标为 preview 的 EgoInfinity dataset。dataset 的 sample 目录确实含 camera.jsondepth.npzflow.mp4hand_joints.binobject_pose.binscene.jsonsignals.json、物体 .ply,以及 retarget/{franka,g1,robonaut2,xlerobot}/trajectory.npz、仿真视频与指标;它验证了论文所述中间表示和 retarget 输出的发布形态。

【Analysis】 数据卡写“104 个 clips 具有四种 embodiment 的 retarget 结果”,论文正文则称 curated subset 有 106 个视频。两者可能反映不同发布快照或可成功 retarget 的子集;官方没有在页面解释差异,使用者应以下载版本的实际清单为准。

5. 实验#

5.1 Experimental Setup#

EgoInfinity 的数据浏览、跨机器人 retargeting 与真实机器人示例(论文 experiments 图)

【Paper】 作者在 Action100M 的可扩展 curated subset 上处理 106 段 manipulation videos。评估涵盖浏览器式数据服务、数据统计、三种差异很大的 embodiment(Unitree G1、NASA Robonaut2、dual-Franka FR3)和真实机器人执行/学习。报告的 retarget 指标包括逐帧 IK rate、手位置/朝向误差、关节限位余量、manipulability 与 joint-velocity smoothness。

【Paper】 真实侧一条路线是在 LEAP dexterous hand 上把提取手轨迹作为 grasp policy prior;另一条路线是将动作直接 retarget 给 dual-arm Franka FR3,展示 cutting、pouring、wiping。论文将这些视作从网络视频到可执行行为的端到端验证,而非对一个单独 VLA backbone 的训练比较。

5.2 Main Results#

【Paper】 三个 embodiment 的数据集级结果如下。IK Rate 是逐帧收敛比例;位置/朝向误差均相对于 IK target,而不是对人类动作的绝对成功率。

RobotIK RatePos. ErrorOri. ErrorJoint-Limit MarginManipulabilitySmoothness
Unitree G10.8212.86 cm6.73°0.619 rad0.0120.00693
Robonaut20.7746.67 cm8.25°0.134 rad0.0580.00343
Dual-Franka0.70610.27 cm12.17°0.572 rad0.0800.00582

【Analysis】 G1 的 tracking error 和 IK rate 最好,不能简单推出它“更适合所有任务”:指标还取决于 root-frame 模型、工作区与人手轨迹的重合程度。Dual-Franka 的较低 IK rate 与较大误差更像是在量化 embodiment mismatch,也说明编译到不同机器人不会是零损失操作。

106 段 curated Action100M 子集的时长、物体、动词与交互状态分布(论文 Figure:Dataset statistics)

【Paper】 数据统计图显示:88% clips 中、47% objects 被实际操作;握持类型在左手、右手与双手间较均衡。该图的意义是证明 pipeline 处理的不是只含静态物体的 web 视频,不过作者未在正文给出端到端吞吐量、单位视频成本或大规模训练集上的 policy scaling curve。

5.3 Ablation Study#

【Paper】 当前论文没有报告带数值的标准 ablation table,例如移除交互状态修正、改用纯视觉 object pose、移除重力或改变 root estimator 后的统一对比。论文通过其设计与定性/系统级结果论证模块必要性,但不能据此量化 Phase F、SAM-3D、Flow3r 或 flow matching 分别贡献了多少。

【Analysis】 最有价值的补充消融应固定同一组源视频和目标机器人,依次移除 static lock、grasp binding、metric calibration、重力、flow multi-hypothesis,再同时报告接触滑移/漂移、IK feasible rate 和真实任务成功率。只有把视觉几何指标连到执行结果,才能检验“物理 grounding”是否真的发生。

5.4 Generalization#

【Paper】 论文的主要泛化维度是任何视角与 cross-embodiment:画面可以只出现局部人体,系统仍用手轨迹推断 root frame;同一 HOI 能送入 G1、Robonaut2 或双 Franka。真实结果进一步包含抓取、切割、倒液与擦拭这类不同 interaction pattern。

【Analysis】 这不是严格的 open-world performance guarantee。论文的视觉范围仍偏向近似静态机位的教学/操作视频,且模型选择、对象可见性和接触复杂度都会影响能否形成可靠的 metric HOI。

6. 方法分析#

6.1 为什么有效?#

【Analysis】 EgoInfinity 把原本相互抵消的误差变成可约束的量:depth 给尺度,gravity 给方向,手和物体都落入同一 frame;随后状态机提供时序先验。面对遮挡,视觉证据变弱但“手正在握持”的语义仍强,因此将物体绑定到手比继续逐帧追踪更稳定。retarget 部分再以 IK 作为最终可执行性筛选器,使产生的 root hypothesis 必须经机器人运动学检验。

6.2 核心创新#

【Paper】 三项相互关联的创新是:跨模块 metric calibration、interaction-aware object refinement,以及对任意视角/部分人体观测进行多模态根坐标推断的 SE(3)SE(3)-equivariant flow retargeter。

【Analysis】 “引擎”思路本身也很重要:它不押注一个永久最强的单一视觉 backbone,而是规定模块之间必须传递什么中间语义与坐标关系。相比把所有错误压进一个 black-box VLA,这更容易替换感知器或定位失败环节。

6.3 与已有方法的本质区别#

路线中间表示主要短板EgoInfinity 的取舍
实验室/穿戴式示教已对齐的第一视角与动作成本高、场景多样性有限接受较噪的网络 RGB,以重建与修正换取规模/多样性
2D human-video imitation图像、2D keypoint 或 pseudo-action深度、尺度、接触和 6-DoF 不充分显式恢复 metric hand-object state
传统 retargeting全身 mocap 或已知人体根坐标任意网络视角下身体常不可见直接从手轨迹分布预测 robot root hypothesis

6.4 关键假设#

【Paper】 系统假设视频近似 static camera;需要语义描述足以产生目标物体 prompt;假设单目 metric depth、手重建与 object segmentation 能在共享坐标中达到可用精度;同时,根坐标网络必须对每个目标机器人在仿真中单独训练。

【Analysis】 这些假设决定数据引擎更接近“自动化筛选 + 编译器”而非对所有网络视频零配置运行的通用解码器。它可以丢弃低质量视频,但若筛选偏好稳定教学镜头,最终数据分布仍会有选择偏差。

7. 局限性#

7.1 作者明确提出的局限#

【Paper】 作者明确限定在 approximately static-camera 视频,因而排除 body-mounted 与 handheld footage;系统不保证精确手物接触对齐、指尖落点、力一致性或 no-slip;没有 tactile observation;retargeter 是机器人专属的,面对新形态需要 retrain/calibration,且适合 functional transfer 而非精确人体运动模仿。

7.2 自己分析得到的局限#

【Analysis】 首先,当前实验量证明了“可 retarget”与若干真实技能示例,却不足以分离视频质量、重建质量、root 推断和控制器对失败的贡献。其次,SAM-3 的文本 prompt 能否找对对象强依赖原始描述,包含多个可交互对象或含糊动词时可能出现语义错配。最后,preview dataset 的 104/106 数量差异和源码未公开,限制了对性能、筛选规则与修正细节的独立复现。

8. 启发与研究思考#

【Analysis】 可以把 EgoInfinity 视作 VLA 训练之前的 data compiler:先把大量非结构化行为视频转成带几何、接触和动作可行性证据的数据,再让 policy 学习。后续很自然的方向包括:

  1. 用 SLAM-aware geometry 放宽静态机位假设,并显式估计相机/人体运动的不确定性。
  2. 将接触从粗粒度状态提升为接触点、摩擦和力的概率分布,再以触觉或仿真约束校准。
  3. 将 IK score 反向用于数据质量过滤或 retargeter 训练,形成“视频—几何—可执行性”的闭环筛选。
  4. 在公开、版本化的数据与源码基础上,比较不同 4D 中间表示对 policy pretraining、world model 和真实泛化的边际收益。
EgoInfinity 论文精读:把任意视角网络视频编译成可执行机器人动作
https://agusexp25.top/en/blog/paper-deep-dive-egoinfinity
Author 菊花花
Published at August 27, 2026