Back
精读 OpenVLA:一个 7B 开源视觉-语言-动作模型,如何融合 DINOv2、SigLIP 与 Llama 2,用动作 tokenization 在 Open X-Embodiment 上实现多机器人控制与低成本微调。
paper deep dive
openvla
vision-language-action model
robot learning