-
π₀.₇ 论文精读:用多模态提示把机器人基础模型变成可操控的通才精读 Physical Intelligence 的 π₀.₇:多模态 context、混合质量数据、子目标图像与异步 flow policy 如何带来灵巧、跨形态和组合泛化。
24 min read -
G0.5 论文精读:One Autoregressive Stream for Robot Action精读 Galaxea G0.5:用跨形态 ActionCodec、原生 CoT 与视觉记忆,把 VLM 重新变成同时推理和行动的 autoregressive VLA。
25 min read -
ACE-Ego-0 论文精读:把第一视角人类视频变成 VLA 的可用动作监督精读 ACE-Ego-0:用 camera-space action、形态条件、时间对齐和可靠性加权,把 1.48K 小时人类第一视角视频与机器人数据统一用于 VLA 预训练。
21 min read -
Qwen-RobotManip 论文精读:对齐如何释放机器人规模化精读 Qwen-RobotManip:通过跨 embodiment 对齐、相机坐标系动作、人到机器人合成与双流训练,把约 38,100 小时开放数据转化为可迁移的 VLA 能力。
19 min read -
π₀ 论文精读:通用机器人控制的视觉-语言-动作流模型精读 π₀:基于预训练 PaliGemma VLM 与 flow matching action expert,在 10000+ 小时跨形态机器人数据上预训练,并验证直接提示、语言指令和微调。
27 min read