-
VLAC 论文精读:让 VLA 同时成为策略与过程奖励模型精读 VLAC:用成对观测预测带符号的任务进度,把 InternVL 变成可泛化的 Critic,并接入异步 PPO 让真实机器人从成功与失败中持续改进。
17 min read -
TouchWorld 论文精读:让触觉既能预测未来,也能实时纠错精读 TouchWorld:通过分层规划、触觉世界模型与 30 Hz 残差控制,把视觉语义、接触预测和快速触觉反馈组合成灵巧操作策略。
16 min read -
ThinkAct 论文精读:用视觉潜变量让 VLA 先思考再行动精读 ThinkAct:用动作对齐的视觉奖励通过 GRPO 训练 embodied reasoning,再以视觉计划 latent 条件化 DiT Action Model,实现长时规划、少样本适应与自纠错。
14 min read -
StarVLA 论文精读:用可插拔骨干与动作头统一 VLA 研究精读 StarVLA:以 backbone–action-head 分解统一 FAST、OFT、π 与 GR00T,并复用训练、评测和部署接口降低 VLA 复现实验门槛。
18 min read -
FineVLA 论文精读:用细粒度语言让 VLA 真正听懂“怎么做”精读 FineVLA:从异构轨迹清洗、DTW 采样到 RoboFine-Bench 与 FG/Raw 混合训练,理解细粒度指令如何带来可操控的机器人行为。
19 min read -
VLA-0 论文精读:不改 VLM,直接把动作写成文本精读 VLA-0:以 Qwen2.5-VL 为底座,不新增动作 token 或动作头,仅用数字文本、动作集成和 masked action augmentation 构建高性能 VLA。
21 min read -
Qwen-VLA 论文精读:统一跨任务、环境与机器人形态的 VLA精读 Qwen-VLA:以 Qwen3.5-4B 和 1.15B DiT flow-matching action decoder 统一操作、导航与轨迹预测,并分析其分阶段训练与跨 embodiment 泛化。
20 min read -
OneTwoVLA 论文精读:让 VLA 在必要时思考、其余时间行动精读 OneTwoVLA:用统一 VLA、自适应 Reason/Act 决策和 reasoning-centric 数据,提升机器人长程规划、纠错、交互与视觉指代。
18 min read -
RoboDual 论文精读:让通才 VLA 与扩散专家协同控制精读 RoboDual:以 OpenVLA 负责语义规划、DiT 专家负责快速多模态动作去噪,解析双系统的条件桥接、异步推理、实验结果与官方代码差异。
24 min read