-
VLAC 论文精读:让 VLA 同时成为策略与过程奖励模型精读 VLAC:用成对观测预测带符号的任务进度,把 InternVL 变成可泛化的 Critic,并接入异步 PPO 让真实机器人从成功与失败中持续改进。
17 min read -
RLinf-USER:真机在线策略学习系统 论文精读精读 RLinf-USER:将机器人作为一等硬件资源,以异步流水线、云边通信和持久回放缓冲区支撑长时程真机在线策略学习。
19 min read -
RL-100 论文精读:用真实世界 RL 把扩散策略推向 100% 成功率精读 RL-100:在扩散视觉运动策略上统一模仿学习、迭代离线 RL 与在线 RL,并用一致性蒸馏实现一步控制。
16 min read