-
EgoSteer 论文精读:从第一视角视频到可操控灵巧操作精读 EgoSteer:EgoSmith 数据流水线、统一机器人栈与世界模型增强 VLA 如何共同实现 40+ 任务的可操控双手灵巧操作。
19 min read -
EgoScale 论文精读:用 2 万小时人类视频扩展灵巧操作精读 NVIDIA EgoScale:把大规模第一视角人类视频、动作缩放律与人机对齐 mid-training 组合起来,迁移到 22-DoF 灵巧手。
20 min read -
DexUMI 论文精读:用人手作为通用灵巧操作接口精读 DexUMI:通过可穿戴外骨骼与视觉适配,把人类灵巧手示教迁移到 Inspire Hand 和 XHand。
12 min read -
TouchWorld 论文精读:让触觉既能预测未来,也能实时纠错精读 TouchWorld:通过分层规划、触觉世界模型与 30 Hz 残差控制,把视觉语义、接触预测和快速触觉反馈组合成灵巧操作策略。
16 min read -
T-Rex 论文精读:Tactile-Reactive Dexterous Manipulation精读 T-Rex:用 100 小时触觉同步数据、时间 VQ-VAE 与异步 MoT,让 VLA 在双手灵巧操作中以高频触觉闭环修正动作。
15 min read -
GR-RL:面向长时域灵巧精密操作的强化学习专精化精读 ByteDance Seed 的 GR-RL:用分布式 critic 学习任务进度、过滤次优示范,再通过形态对称增强和 latent-space online RL,让 VLA 学会多眼孔鞋带穿线。
17 min read -
UniDex 论文精读:从第一视角人类视频到通用灵巧手控制精读 UniDex:用人类视频构建跨形态灵巧手数据集,以 FAAS 统一动作空间,并用 3D VLA 实现零样本跨手迁移。
19 min read -
CAIP 论文精读:让视觉表征对动作有感觉精读 CAIP:用第一视角人类视频中的手部姿态作为动作代理,通过动作-图像对比预训练获得更适合灵巧操作的视觉表征。
22 min read