-
ACT 论文精读:Action Chunking with Transformers精读 ACT:用 Action Chunking、Temporal Ensembling 与 CVAE 让低成本双臂机器人学习精细操作,并对照官方代码逐层分析。
24 min read -
BAGEL 论文精读:交错多模态预训练中的涌现能力精读 BAGEL:7B active / 14B total 的统一理解与生成模型,用 MoT、Rectified Flow 和视频/网页交错数据训练,并分析 IntelligentBench 与世界建模涌现。
27 min read -
CogACT 论文精读:让 VLM 负责认知,让 Diffusion Transformer 负责动作精读 CogACT:在 7B VLM 后接最大 308M 参数的 Diffusion Transformer 动作模块,用 cognition token 连接认知与动作,在 SIMPLER 与多台真实机器人上超过 OpenVLA 和 RT-2-X。
30 min read -
Diffusion Policy 论文精读:用动作扩散学习视觉运动策略精读 Diffusion Policy:用条件去噪扩散在动作空间生成动作序列,结合 receding-horizon、视觉 conditioning 和 Time-series Diffusion Transformer,并对照官方代码拆解训练与推理。
21 min read -
OpenVLA 论文精读精读 OpenVLA:一个 7B 开源视觉-语言-动作模型,如何融合 DINOv2、SigLIP 与 Llama 2,用动作 tokenization 在 Open X-Embodiment 上实现多机器人控制与低成本微调。
26 min read -
OpenVLA-OFT 论文精读:Fine-Tuning Vision-Language-Action Models精读 OpenVLA-OFT:通过并行解码、Action Chunking、连续动作与 L1 回归,把 7B VLA 适配到 LIBERO 与双臂 ALOHA。
29 min read -
π₀ 论文精读:通用机器人控制的视觉-语言-动作流模型精读 π₀:基于预训练 PaliGemma VLM 与 flow matching action expert,在 10000+ 小时跨形态机器人数据上预训练,并验证直接提示、语言指令和微调。
27 min read -
π₀.₅ 论文精读:面向开放世界泛化的 Vision-Language-Action 模型精读 π₀.₅:通过异构数据 co-training、层级 subtask 推理与 FAST/Flow 混合动作表示,让移动操作机器人在未见过的家庭环境中执行长时程整理任务。
30 min read -
RoboDual 论文精读:让通才 VLA 与扩散专家协同控制精读 RoboDual:以 OpenVLA 负责语义规划、DiT 专家负责快速多模态动作去噪,解析双系统的条件桥接、异步推理、实验结果与官方代码差异。
24 min read -
RT-2 论文精读:Vision-Language-Action Models精读 RT-2:把低层机器人动作编码成 VLM 文本 token,与互联网图文数据 co-fine-tune,让 VLA 直接输出控制动作,并系统分析其泛化、符号理解、推理与代码边界。
21 min read -
TinyVLA 论文精读:轻量 VLM 与扩散策略打造快速 VLA精读 TinyVLA:用 1.3B 以下的 Llava-Pythia 骨干和 Diffusion Policy decoder 替代大模型自回归动作 token,在少量机器人数据下获得更快推理、更强数据效率与跨任务泛化。
28 min read -
ChatVLA-2 论文精读:让 VLA 保留 VLM 的开放世界推理精读 ChatVLA-2:通过 Dynamic MoE、reasoning-following action expert 与两阶段训练,让 VLA 在数学、OCR 和空间关系任务中利用预训练 VLM 的开放世界知识。
23 min read -
Qwen-RobotManip 论文精读:对齐如何释放机器人规模化精读 Qwen-RobotManip:通过跨 embodiment 对齐、相机坐标系动作、人到机器人合成与双流训练,把约 38,100 小时开放数据转化为可迁移的 VLA 能力。
19 min read -
SmolVLA 论文精读:面向低成本机器人的高效 Vision-Language-Action 模型精读 SmolVLA:用 450M 参数的 SmolVLM、轻量 Flow Matching Action Expert 与异步推理解耦,让 VLA 可在单 GPU 训练并部署到消费级硬件。
22 min read -
X-VLA 论文精读:用 Soft Prompt 统一跨本体 Vision-Language-Action 学习精读 X-VLA:通过 embodiment-specific Soft Prompt、统一 EE6D 动作空间与 Flow Matching,在异构机器人数据上稳定预训练并高效适配新本体。
25 min read
Collection