-
G0.5 论文精读:One Autoregressive Stream for Robot Action精读 Galaxea G0.5:用跨形态 ActionCodec、原生 CoT 与视觉记忆,把 VLM 重新变成同时推理和行动的 autoregressive VLA。
25 min read -
FASTer 论文精读:用神经动作 Tokenization 加速自回归 VLA精读 FASTer:从 FASTerVQ 的二维动作压缩、RVQ 与 DCT 重建,到 FASTerVLA 的 Block-wise Autoregression 和 Action Expert。
15 min read -
FAST 论文精读:高效的 Vision-Language-Action 动作 Tokenization精读 FAST:用 DCT 与 BPE 压缩高频机器人动作,把自回归 VLA 从“预测数百个冗余 token”变成高信息密度的动作序列。
22 min read -
CoT-VLA 论文精读:让机器人先想象目标,再执行动作精读 CoT-VLA:用未来子目标图像作为视觉 Chain-of-Thought,再通过混合注意力和 Action Chunking 生成闭环动作。
27 min read -
CLAP 论文精读:从人类视频学习可执行的 Vision-Language-Action 模型精读 CLAP:用 Act-VAE 建立物理动作词表,再以 VD-VAE 对齐人类视频,训练 CLAP-NTP,并用 CLAP-RF 与 Knowledge Matching 实现快速控制。
22 min read -
CAIP 论文精读:让视觉表征对动作有感觉精读 CAIP:用第一视角人类视频中的手部姿态作为动作代理,通过动作-图像对比预训练获得更适合灵巧操作的视觉表征。
22 min read -
ActionCodec 论文精读:什么样的 Action Tokenizer 才适合 VLA?精读 ActionCodec:从 VLA 优化视角重新定义动作 token,分析 overlap、词表容量、多模态互信息与 token 独立性。
14 min read -
ACE-Ego-0 论文精读:把第一视角人类视频变成 VLA 的可用动作监督精读 ACE-Ego-0:用 camera-space action、形态条件、时间对齐和可靠性加权,把 1.48K 小时人类第一视角视频与机器人数据统一用于 VLA 预训练。
21 min read -
X-VLA 论文精读:用 Soft Prompt 统一跨本体 Vision-Language-Action 学习精读 X-VLA:通过 embodiment-specific Soft Prompt、统一 EE6D 动作空间与 Flow Matching,在异构机器人数据上稳定预训练并高效适配新本体。
25 min read -
SmolVLA 论文精读:面向低成本机器人的高效 Vision-Language-Action 模型精读 SmolVLA:用 450M 参数的 SmolVLM、轻量 Flow Matching Action Expert 与异步推理解耦,让 VLA 可在单 GPU 训练并部署到消费级硬件。
22 min read -
Qwen-RobotManip 论文精读:对齐如何释放机器人规模化精读 Qwen-RobotManip:通过跨 embodiment 对齐、相机坐标系动作、人到机器人合成与双流训练,把约 38,100 小时开放数据转化为可迁移的 VLA 能力。
19 min read -
ChatVLA-2 论文精读:让 VLA 保留 VLM 的开放世界推理精读 ChatVLA-2:通过 Dynamic MoE、reasoning-following action expert 与两阶段训练,让 VLA 在数学、OCR 和空间关系任务中利用预训练 VLM 的开放世界知识。
23 min read -
TinyVLA 论文精读:轻量 VLM 与扩散策略打造快速 VLA精读 TinyVLA:用 1.3B 以下的 Llava-Pythia 骨干和 Diffusion Policy decoder 替代大模型自回归动作 token,在少量机器人数据下获得更快推理、更强数据效率与跨任务泛化。
28 min read -
RT-2 论文精读:Vision-Language-Action Models精读 RT-2:把低层机器人动作编码成 VLM 文本 token,与互联网图文数据 co-fine-tune,让 VLA 直接输出控制动作,并系统分析其泛化、符号理解、推理与代码边界。
21 min read -
RoboDual 论文精读:让通才 VLA 与扩散专家协同控制精读 RoboDual:以 OpenVLA 负责语义规划、DiT 专家负责快速多模态动作去噪,解析双系统的条件桥接、异步推理、实验结果与官方代码差异。
24 min read
Collection