-
ThinkAct 论文精读:用视觉潜变量让 VLA 先思考再行动精读 ThinkAct:用动作对齐的视觉奖励通过 GRPO 训练 embodied reasoning,再以视觉计划 latent 条件化 DiT Action Model,实现长时规划、少样本适应与自纠错。
14 min read -
ChatVLA-2 论文精读:让 VLA 保留 VLM 的开放世界推理精读 ChatVLA-2:通过 Dynamic MoE、reasoning-following action expert 与两阶段训练,让 VLA 在数学、OCR 和空间关系任务中利用预训练 VLM 的开放世界知识。
23 min read