-
CLAP 论文精读:从人类视频学习可执行的 Vision-Language-Action 模型精读 CLAP:用 Act-VAE 建立物理动作词表,再以 VD-VAE 对齐人类视频,训练 CLAP-NTP,并用 CLAP-RF 与 Knowledge Matching 实现快速控制。
22 min read -
X-VLA 论文精读:用 Soft Prompt 统一跨本体 Vision-Language-Action 学习精读 X-VLA:通过 embodiment-specific Soft Prompt、统一 EE6D 动作空间与 Flow Matching,在异构机器人数据上稳定预训练并高效适配新本体。
25 min read -
SmolVLA 论文精读:面向低成本机器人的高效 Vision-Language-Action 模型精读 SmolVLA:用 450M 参数的 SmolVLM、轻量 Flow Matching Action Expert 与异步推理解耦,让 VLA 可在单 GPU 训练并部署到消费级硬件。
22 min read -
Qwen-RobotManip 论文精读:对齐如何释放机器人规模化精读 Qwen-RobotManip:通过跨 embodiment 对齐、相机坐标系动作、人到机器人合成与双流训练,把约 38,100 小时开放数据转化为可迁移的 VLA 能力。
19 min read -
RT-2 论文精读:Vision-Language-Action Models精读 RT-2:把低层机器人动作编码成 VLM 文本 token,与互联网图文数据 co-fine-tune,让 VLA 直接输出控制动作,并系统分析其泛化、符号理解、推理与代码边界。
21 min read -
π₀.₅ 论文精读:面向开放世界泛化的 Vision-Language-Action 模型精读 π₀.₅:通过异构数据 co-training、层级 subtask 推理与 FAST/Flow 混合动作表示,让移动操作机器人在未见过的家庭环境中执行长时程整理任务。
30 min read -
π₀ 论文精读:通用机器人控制的视觉-语言-动作流模型精读 π₀:基于预训练 PaliGemma VLM 与 flow matching action expert,在 10000+ 小时跨形态机器人数据上预训练,并验证直接提示、语言指令和微调。
27 min read -
OpenVLA-OFT 论文精读:Fine-Tuning Vision-Language-Action Models精读 OpenVLA-OFT:通过并行解码、Action Chunking、连续动作与 L1 回归,把 7B VLA 适配到 LIBERO 与双臂 ALOHA。
29 min read