Back
精读 VideoVLA:基于 CogVideoX-5B 的多模态 DiT 同时预测未来视频 latent 与 7D 动作,在 SIMPLER 和真实 Realman 上验证视频想象带来的泛化能力。
paper deep dive
videovla
vision-language-action model
video generation
diffusion policy
robot learning