Back
精读 DreamVLA:用动态区域、深度与语义构成的未来世界知识替代整帧预测,再由结构化注意力和 Diffusion Transformer 完成逆动力学控制。
paper deep dive
dreamvla
vision-language-action model
world model
diffusion policy