-
UniDex 论文精读:从第一视角人类视频到通用灵巧手控制精读 UniDex:用人类视频构建跨形态灵巧手数据集,以 FAAS 统一动作空间,并用 3D VLA 实现零样本跨手迁移。
19 min read -
π*₀.₆ 与 RECAP 论文精读:让 VLA 从真实经验中变强精读 Physical Intelligence 的 RECAP:用分布式 value function 估计 advantage,再以 advantage conditioning 从示教、自治轨迹和人工干预中迭代改进 VLA。
23 min read -
RDT2 论文精读:探索 UMI 数据规模化的跨本体零样本泛化极限精读 RDT2:用 10,000+ 小时 UMI 示教数据与 RVQ、Flow Matching、蒸馏三阶段训练,让 7B VLA 零样本迁移到未见机器人本体。
19 min read -
RDT-1B 论文精读:用 Diffusion Transformer 学习双臂操作精读 RDT-1B:如何用 Diffusion Transformer、物理可解释的统一动作空间和跨机器人预训练,解决双臂操作中的多模态与数据稀缺。
22 min read -
Qwen-VLA 论文精读:统一跨任务、环境与机器人形态的 VLA精读 Qwen-VLA:以 Qwen3.5-4B 和 1.15B DiT flow-matching action decoder 统一操作、导航与轨迹预测,并分析其分阶段训练与跨 embodiment 泛化。
20 min read -
π₀.₇ 论文精读:用多模态提示把机器人基础模型变成可操控的通才精读 Physical Intelligence 的 π₀.₇:多模态 context、混合质量数据、子目标图像与异步 flow policy 如何带来灵巧、跨形态和组合泛化。
24 min read -
OneTwoVLA 论文精读:让 VLA 在必要时思考、其余时间行动精读 OneTwoVLA:用统一 VLA、自适应 Reason/Act 决策和 reasoning-centric 数据,提升机器人长程规划、纠错、交互与视觉指代。
18 min read -
MolmoAct 论文精读:空间推理 Action Reasoning Model精读 MolmoAct:用深度感知 token、视觉轨迹 trace 与离散动作 token,把 VLA 的感知、规划和控制组织成可解释、可 steer 的三阶段推理。
14 min read -
LAPA 论文精读:从无动作标签视频学习 Vision-Language-Action 模型精读 LAPA:用 VQ-VAE 从相邻视频帧学习离散 latent action,再让 VLM 预测它,最后用少量机器人动作标签完成真实控制映射。
25 min read -
LAP:Language-Action Pre-Training 论文精读精读 LAP-3B:把连续末端动作写成自然语言,再用 flow-matching action expert 实现零样本跨 embodiment 迁移。
19 min read -
Knowledge Insulating Vision-Language-Action Models 论文精读精读 Knowledge Insulation:用离散动作学习保护 VLM 表征,再用无梯度回传的 Flow Matching action expert 实现快速、连续且更会听指令的 VLA。
22 min read -
InternVLA-M1 论文精读:用空间先验连接 VLM 推理与机器人动作精读 InternVLA-M1:通过 230 万条空间 grounding 数据、空间提示和双监督训练,让 Qwen2.5-VL 的空间推理迁移到 DiT 动作专家。
20 min read -
InSpire:用内在空间推理提升 VLA 泛化能力精读 InSpire:在动作生成前插入目标物体相对机器人方向的 VQA 桥接,用粗粒度空间推理抑制 VLA 的 shortcut learning 与 spurious correlation。
24 min read -
HEX:跨形态人形全身操作论文精读精读 HEX:用 body-part 对齐状态、UPP-MoE、视觉历史缓存与 flow matching,让全尺寸人形机器人跨形态完成协调的全身操作。
20 min read -
GR00T N1 论文精读:面向通用人形机器人的开放基础模型精读 NVIDIA GR00T N1:双系统 VLA、Eagle-2、Flow Matching DiT 与数据金字塔如何共同支撑跨形态人形机器人策略。
23 min read
Collection