Back
精读 CoT-VLA:用未来子目标图像作为视觉 Chain-of-Thought,再通过混合注意力和 Action Chunking 生成闭环动作。
paper deep dive
cot-vla
vision-language-action model
visual chain-of-thought
robot manipulation