-
HiFi-UMI 论文精读:仅用高保真 UMI 数据学习可部署操作策略精读 HiFi-UMI:用 3 mm 轨迹精度、40 μs 硬件同步和六视角采集,把机器人无关示教推进到零机器人后训练与真实机器人部署。
22 min read -
What Matters for Latent Actions in Robot Learning 论文精读系统拆解 What Matters for Latent Actions in Robot Learning:41 项设计选择、三阶段训练、代理指标与真实机器人验证。
16 min read -
VideoVLA 论文精读:让视频生成器同时想象与执行精读 VideoVLA:基于 CogVideoX-5B 的多模态 DiT 同时预测未来视频 latent 与 7D 动作,在 SIMPLER 和真实 Realman 上验证视频想象带来的泛化能力。
21 min read -
πRL 论文精读:为 Flow-based VLA 打通 Online RL精读 πRL:将 flow matching 的去噪过程改写为可计算似然的随机策略,使 π0 与 π0.5 能以 PPO 从在线交互中继续提升。
16 min read -
LA4VLA 论文精读:Learning to Act without Seeing精读 LA4VLA:从 DROID 轨迹构造 33K 个 vision-agnostic atomic action episode,用 Language-Action 预训练让 VLA 学会语言如何约束动作。
20 min read -
GR-RL:面向长时域灵巧精密操作的强化学习专精化精读 ByteDance Seed 的 GR-RL:用分布式 critic 学习任务进度、过滤次优示范,再通过形态对称增强和 latent-space online RL,让 VLA 学会多眼孔鞋带穿线。
17 min read -
DreamVLA 论文精读:让机器人先“做梦”再行动精读 DreamVLA:用动态区域、深度与语义构成的未来世界知识替代整帧预测,再由结构化注意力和 Diffusion Transformer 完成逆动力学控制。
19 min read -
villa-X 论文精读:用物理接地的 Latent Action 连接 VLA 规划与控制精读 villa-X:用 proprioceptive FDM 让 latent action 对齐机器人动力学,再以 joint diffusion 联合规划 latent action 与低层动作,实现跨 embodiment 的 VLA 迁移。
19 min read -
LAPA 论文精读:从无动作标签视频学习 Vision-Language-Action 模型精读 LAPA:用 VQ-VAE 从相邻视频帧学习离散 latent action,再让 VLM 预测它,最后用少量机器人动作标签完成真实控制映射。
25 min read -
InternVLA-M1 论文精读:用空间先验连接 VLM 推理与机器人动作精读 InternVLA-M1:通过 230 万条空间 grounding 数据、空间提示和双监督训练,让 Qwen2.5-VL 的空间推理迁移到 DiT 动作专家。
20 min read -
InSpire:用内在空间推理提升 VLA 泛化能力精读 InSpire:在动作生成前插入目标物体相对机器人方向的 VQA 桥接,用粗粒度空间推理抑制 VLA 的 shortcut learning 与 spurious correlation。
24 min read -
FAST 论文精读:高效的 Vision-Language-Action 动作 Tokenization精读 FAST:用 DCT 与 BPE 压缩高频机器人动作,把自回归 VLA 从“预测数百个冗余 token”变成高信息密度的动作序列。
22 min read -
CoT-VLA 论文精读:让机器人先想象目标,再执行动作精读 CoT-VLA:用未来子目标图像作为视觉 Chain-of-Thought,再通过混合注意力和 Action Chunking 生成闭环动作。
27 min read -
ActionCodec 论文精读:什么样的 Action Tokenizer 才适合 VLA?精读 ActionCodec:从 VLA 优化视角重新定义动作 token,分析 overlap、词表容量、多模态互信息与 token 独立性。
14 min read -
ACE-Ego-0 论文精读:把第一视角人类视频变成 VLA 的可用动作监督精读 ACE-Ego-0:用 camera-space action、形态条件、时间对齐和可靠性加权,把 1.48K 小时人类第一视角视频与机器人数据统一用于 VLA 预训练。
21 min read