-
SIMPLER 论文精读:用仿真可靠评测真实机器人操作策略精读 SIMPLER:通过系统辨识、视觉匹配和变体聚合,把真实数据训练的机器人策略放进仿真,并用 MMRV 与 Pearson 评估其与真实表现的相关性。
23 min read -
RoboCasa 论文精读:把日常机器人训练数据扩展到十万条轨迹精读 RoboCasa:用可交互厨房、LLM 任务设计与 MimicGen 轨迹扩增构建大规模仿真数据,并验证模拟数据的规模效应和真实迁移价值。
24 min read -
Open X-Embodiment 论文精读:用跨机器人数据训练 RT-X 通用策略精读 Open X-Embodiment:统一 22 种机器人、60 个数据集与 RLDS 格式,并分析 RT-1-X/RT-2-X 如何从跨具身数据中获得正迁移。
17 min read -
Open-H-Embodiment 论文精读:让医疗机器人也拥有可扩展的基础模型数据精读 Open-H-Embodiment:780 小时、20 种医疗机器人平台的数据基础设施,以及 GR00T-H 和 Cosmos-H-Surgical-Simulator 的跨具身验证。
20 min read -
HiFi-UMI 论文精读:仅用高保真 UMI 数据学习可部署操作策略精读 HiFi-UMI:用 3 mm 轨迹精度、40 μs 硬件同步和六视角采集,把机器人无关示教推进到零机器人后训练与真实机器人部署。
22 min read -
EgoVerse:面向机器人学习的全球第一视角人类数据集论文精读精读 EgoVerse:用可持续增长的第一视角人类数据、统一数据基础设施和跨 embodiment 共训,系统研究人类经验如何迁移到机器人操作。
19 min read -
EgoLive 论文精读:面向真实人类任务的大规模第一视角数据集精读 EgoLive:用双目头戴设备和自动化多模态标注,把 1,680 小时真实服务场景转化为可用于机器人学习的第一视角数据。
21 min read -
EgoInfinity 论文精读:把任意视角网络视频编译成可执行机器人动作精读 EgoInfinity:以共享度量 3D、交互状态修正和 SE(3) 等变根坐标估计,将网络人类视频转化为跨机器人可 retarget 的 4D 手—物交互数据。
22 min read -
What Matters for Latent Actions in Robot Learning 论文精读系统拆解 What Matters for Latent Actions in Robot Learning:41 项设计选择、三阶段训练、代理指标与真实机器人验证。
16 min read -
VideoVLA 论文精读:让视频生成器同时想象与执行精读 VideoVLA:基于 CogVideoX-5B 的多模态 DiT 同时预测未来视频 latent 与 7D 动作,在 SIMPLER 和真实 Realman 上验证视频想象带来的泛化能力。
21 min read -
StarVLA 论文精读:用可插拔骨干与动作头统一 VLA 研究精读 StarVLA:以 backbone–action-head 分解统一 FAST、OFT、π 与 GR00T,并复用训练、评测和部署接口降低 VLA 复现实验门槛。
18 min read -
SimpleVLA-RL 论文精读:用在线强化学习扩展 VLA 的数据与泛化能力精读 SimpleVLA-RL:基于 veRL 为 OpenVLA-OFT 接入闭环并行 rollout、二值结果奖励与探索增强,在 LIBERO、RoboTwin 和真实机器人上验证 VLA 的 RL scaling。
18 min read -
PriorVLA 论文精读:保留预训练先验的 VLA 适配PriorVLA 用冻结 Prior Expert 与 Expert Queries 保留 VLA 的场景和运动先验,在少样本与 OOD 机器人操作中提升适配性能。
18 min read -
πRL 论文精读:为 Flow-based VLA 打通 Online RL精读 πRL:将 flow matching 的去噪过程改写为可计算似然的随机策略,使 π0 与 π0.5 能以 PPO 从在线交互中继续提升。
16 min read -
OmniVTA 论文精读:视觉-触觉世界模型驱动的接触丰富操作精读 OmniVTA:从 21,879 条视觉-触觉-动作轨迹出发,用 TactileVAE、双流世界模型、接触感知融合与 60Hz 反射控制解决接触丰富操作。
24 min read