Back
精读 ViVa:把 Wan2.2 的时空生成先验改造成价值模型,同时预测未来本体状态与任务回报,并接入 RECAP 改善长时程机器人强化学习。
paper deep dive
robot reinforcement learning
video generation
value function