-
ViVa 论文精读:让视频生成模型成为机器人价值函数精读 ViVa:把 Wan2.2 的时空生成先验改造成价值模型,同时预测未来本体状态与任务回报,并接入 RECAP 改善长时程机器人强化学习。
14 min read -
VLAC 论文精读:让 VLA 同时成为策略与过程奖励模型精读 VLAC:用成对观测预测带符号的任务进度,把 InternVL 变成可泛化的 Critic,并接入异步 PPO 让真实机器人从成功与失败中持续改进。
17 min read -
VP-VLA 论文精读精读 VP-VLA:以 crosshair 和 bounding box 作为 System 2 规划与 System 1 控制之间的原生视觉接口,提升 VLA 的空间 grounding 与 OOD 操作鲁棒性。
22 min read -
VTAM 论文精读:让机器人用触觉预测接触动力学精读 VTAM:把 GelSight 触觉流纳入视频世界模型,并用虚拟力正则抑制视觉主导,在薯片抓取、黄瓜削皮和白板擦拭上实现稳健接触控制。
13 min read -
What Matters for Latent Actions in Robot Learning 论文精读系统拆解 What Matters for Latent Actions in Robot Learning:41 项设计选择、三阶段训练、代理指标与真实机器人验证。
16 min read -
Do World Action Models Generalize Better than VLAs? 论文精读精读 WAM 与 VLA 的鲁棒性对比:RoboTwin 2.0-Plus 和 LIBERO-Plus 如何用 7 类扰动检验视频时空先验、训练数据多样性与推理效率。
22 min read -
WSA1 论文精读:3D World-Spatial-Action Robot Control精读 WSA1:用 3D 世界预测、3D 一致视觉思考和 3D 逆动力学统一 VLA/WAM,并以 6,000 小时异构数据实现高效泛化。
19 min read -
A1 论文精读:Fully Transparent、Adaptive、Efficient 的 Truncated VLA精读 A1:用多出口 VLM 与跨层 Truncated Flow Matching 同时压缩 backbone 和 action head 的推理成本,并对照官方代码分析实现。
19 min read -
BeyondMimic 论文精读:从动作跟踪到可组合的人形机器人控制精读 BeyondMimic:用统一强化学习动作跟踪获得敏捷、自然的人形技能,再以状态–动作潜空间扩散和分类器引导实现零样本任务组合。
18 min read -
DexUMI 论文精读:用人手作为通用灵巧操作接口精读 DexUMI:通过可穿戴外骨骼与视觉适配,把人类灵巧手示教迁移到 Inspire Hand 和 XHand。
12 min read -
DreamControl-v2 论文精读:让人形机器人在自身空间里“做梦”精读 DreamControl-v2:把异构人体动作预先重定向到 Unitree-G1 空间,用可控扩散先生成参考轨迹,再以物理 RL 学习可自主执行的全身技能。
16 min read -
EBench 论文精读:通用移动操作能力诊断精读 EBench:用 26 个跨移动、长时程与灵巧精密操作的任务,把通用操作策略的单一成功率拆成五维能力画像和四类泛化诊断。
11 min read -
EgoInfinity 论文精读:把任意视角网络视频编译成可执行机器人动作精读 EgoInfinity:以共享度量 3D、交互状态修正和 SE(3) 等变根坐标估计,将网络人类视频转化为跨机器人可 retarget 的 4D 手—物交互数据。
22 min read -
EgoLive 论文精读:面向真实人类任务的大规模第一视角数据集精读 EgoLive:用双目头戴设备和自动化多模态标注,把 1,680 小时真实服务场景转化为可用于机器人学习的第一视角数据。
21 min read -
EgoScale 论文精读:用 2 万小时人类视频扩展灵巧操作精读 NVIDIA EgoScale:把大规模第一视角人类视频、动作缩放律与人机对齐 mid-training 组合起来,迁移到 22-DoF 灵巧手。
20 min read
Collection