Back
精读 CogACT:在 7B VLM 后接最大 308M 参数的 Diffusion Transformer 动作模块,用 cognition token 连接认知与动作,在 SIMPLER 与多台真实机器人上超过 OpenVLA 和 RT-2-X。
paper deep dive
cogact
vision-language-action model
diffusion policy
robot learning