-
Training-Time Action Conditioning 论文精读精读 Training-Time Action Conditioning:用训练时模拟推理延迟和 action prefix 条件化,去掉 RTC 的推理时 inpainting 开销。
15 min read -
SLIM-0.5B 论文精读:用 action-grounded predictive latents 做紧凑机器人策略精读 SLIM:以逆/前向动力学联合预训练 MoT latent,再以 flow matching 输出连续动作,在不做具身预训练下兼顾鲁棒性与低延迟。
19 min read -
πRL 论文精读:为 Flow-based VLA 打通 Online RL精读 πRL:将 flow matching 的去噪过程改写为可计算似然的随机策略,使 π0 与 π0.5 能以 PPO 从在线交互中继续提升。
16 min read -
LingBot-VA 论文精读:用因果世界模型驱动机器人控制精读 LingBot-VA:将视频世界建模与逆动力学动作生成交织为因果自回归序列,并以 MoT、KV Cache、部分去噪和 FDM 校正实现长时程闭环操控。
20 min read -
BagelVLA 论文精读:用交错语言计划与视觉预见解决长时域操作精读 BagelVLA:在统一 MoT 模型中交错生成子任务文本、未来关键帧和动作,并用 Residual Flow Guidance 降低视觉预见延迟。
13 min read -
A2A 论文精读:用历史动作替代高斯噪声的 Flow Matching 策略精读 A2A:把历史本体动作编码为 Flow Matching 的起点,以轻量 MLP 生成未来动作,在单步推理下兼顾低延迟与视觉鲁棒性。
20 min read -
Knowledge Insulating Vision-Language-Action Models 论文精读精读 Knowledge Insulation:用离散动作学习保护 VLM 表征,再用无梯度回传的 Flow Matching action expert 实现快速、连续且更会听指令的 VLA。
22 min read -
SmolVLA 论文精读:面向低成本机器人的高效 Vision-Language-Action 模型精读 SmolVLA:用 450M 参数的 SmolVLM、轻量 Flow Matching Action Expert 与异步推理解耦,让 VLA 可在单 GPU 训练并部署到消费级硬件。
22 min read -
π₀ 论文精读:通用机器人控制的视觉-语言-动作流模型精读 π₀:基于预训练 PaliGemma VLM 与 flow matching action expert,在 10000+ 小时跨形态机器人数据上预训练,并验证直接提示、语言指令和微调。
27 min read