Back
精读 HALO:用 Mixture-of-Transformers 将文本推理、视觉子目标预测与动作生成统一为 Embodied Multimodal Chain-of-Thought,并分析其训练配方、实验和代码现状。
paper deep dive
vla
multimodal reasoning
robot manipulation