Back
精读 MMaDA-VLA:把语言、图像、动作放进同一离散 token 空间,用并行迭代去噪共同生成目标观测与动作块。
paper deep dive
vla
discrete diffusion
world model
精读 dWorldEval:把视觉、语言和动作放进同一离散 token 序列,以关键帧记忆和 progress token 实现可扩展的机器人策略评估。
robot policy evaluation
robot learning