Back
精读 ACE-Ego-0:用 camera-space action、形态条件、时间对齐和可靠性加权,把 1.48K 小时人类第一视角视频与机器人数据统一用于 VLA 预训练。
paper deep dive
ace-ego-0
vision-language-action model
learning from human video
cross-embodiment