Back
RynnValue 用从观测到语言目标的剩余时间替代偏好与归一化进度,在 7,000+ 小时异构机器人数据上训练价值模型,并作为 VLA 的密集奖励接口。
paper deep dive
robotic value model
reward modeling
reinforcement learning
vla
精读 WARP-RM:通过 AR(1) 时间扭曲生成自监督进度标签,再用密集 signed progress 过滤和重加权行为克隆数据。
imitation learning
data curation