-
Hume 论文精读:让 VLA 先思考,再流畅行动精读 Hume 的 value-guided System-2 thinking 与 cascaded action denoising,并对照官方代码分析双系统异步控制。
13 min read -
Helix 技术发布精读:快慢双系统 VLA精读 Figure Helix 技术发布:以 7–9Hz 的语义 VLM 和 200Hz 的视觉运动策略分工,在人形上半身连续控制中兼顾泛化与实时性。
21 min read -
HALO 论文精读:让 VLA 先思考、再想象、后行动精读 HALO:用 Mixture-of-Transformers 将文本推理、视觉子目标预测与动作生成统一为 Embodied Multimodal Chain-of-Thought,并分析其训练配方、实验和代码现状。
15 min read -
What Do VLAs Actually Inherit from VLMs? 论文精读精读 GrinningFace:用 emoji 桌面操作任务拆分 VLA 的执行能力与 VLM 视觉语义先验,比较 LoRA、冻结 VLM、协同训练、离散动作和 latent action。
20 min read -
GR-RL:面向长时域灵巧精密操作的强化学习专精化精读 ByteDance Seed 的 GR-RL:用分布式 critic 学习任务进度、过滤次优示范,再通过形态对称增强和 latent-space online RL,让 VLA 学会多眼孔鞋带穿线。
17 min read -
Genie Envisioner 论文精读:把世界模型、动作策略与模拟器合成一个闭环平台精读 Genie Envisioner:GE-Base 如何用多视角视频世界模型承载 GE-Act 动作解码、GE-Sim 闭环模拟与 EWMBench 评测。
26 min read -
FTP-1 论文精读:把异构触觉做成可迁移的基础策略FTP-1 用形态感知触觉 Token 空间和共享触觉专家,将 21 种传感器、26 个数据源的触觉经验迁移到接触密集操作。
21 min read -
ForceVLA2 论文精读:让 VLA 学会感知并控制接触力精读 ForceVLA2:用 Force Prompt、Cross-Scale MoE 与混合力位控制,把力觉从辅助观测变成接触丰富操作中的闭环控制信号。
20 min read -
FineVLA 论文精读:用细粒度语言让 VLA 真正听懂“怎么做”精读 FineVLA:从异构轨迹清洗、DTW 采样到 RoboFine-Bench 与 FG/Raw 混合训练,理解细粒度指令如何带来可操控的机器人行为。
19 min read -
FD-VLA 论文精读精读 FD-VLA:用视觉与机器人状态蒸馏出力觉 token,在不依赖力传感器的情况下提升接触丰富操作。
17 min read -
Fast-in-Slow 论文精读:把高速执行嵌入慢速推理的统一 VLA精读 Fast-in-Slow(FiS-VLA):通过共享 VLM 末端 Transformer、异步双系统、3D 点云与双感知协同训练,同时获得高频控制和语义推理能力。
18 min read -
Evo-0 论文精读:让 VLA 从 RGB 中获得隐式空间理解精读 Evo-0:用 VGGT 的几何 token 和轻量 Cross-Attention 融合模块,为现有 VLA 注入无需深度传感器的隐式 3D 先验。
14 min read -
dWorldEval 论文精读:用离散扩散世界模型规模化评估机器人策略精读 dWorldEval:把视觉、语言和动作放进同一离散 token 序列,以关键帧记忆和 progress token 实现可扩展的机器人策略评估。
20 min read -
dVLA 论文精读:用多模态 CoT 统一扩散式 VLA精读 dVLA:把视觉子目标、文本推理和机器人动作统一为离散扩散去噪,并用 Prefix Mask 与 KV Cache 将推理速度提升到约 2 倍。
22 min read -
DUST 论文精读:双流扩散增强 World-Model VLA精读 DUST:用双流 MMDiT、解耦噪声与异步采样,把未来视觉状态建模融入 VLA,并在仿真、真实机器人和跨 embodiment 数据上验证。
17 min read
Collection