-
MM-ACT 论文精读:Learn from Multimodal Parallel Generation to Act精读 MM-ACT:在共享离散 token 空间中统一生成任务规划、未来图像与动作,并用 Context-Shared Multimodal Learning 提升机器人控制。
18 min read -
LingBot-VA 论文精读:用因果世界模型驱动机器人控制精读 LingBot-VA:将视频世界建模与逆动力学动作生成交织为因果自回归序列,并以 MoT、KV Cache、部分去噪和 FDM 校正实现长时程闭环操控。
20 min read -
Learning while Deploying 论文精读:让机器人群在部署中持续学习精读 LWD:用 DIVL 分布式价值学习与 QAM 流策略提取,把 16 台双臂机器人部署产生的离线与在线经验闭环用于通用 VLA 持续改进。
21 min read -
InternVLA-A1 论文精读:把理解、想象与动作统一起来精读 InternVLA-A1:用 Mixture-of-Transformers 统一场景理解、视觉前瞻与 Flow Matching 动作,在动态双臂操作中提升泛化。
21 min read -
Hume 论文精读:让 VLA 先思考,再流畅行动精读 Hume 的 value-guided System-2 thinking 与 cascaded action denoising,并对照官方代码分析双系统异步控制。
13 min read -
Helix 技术发布精读:快慢双系统 VLA精读 Figure Helix 技术发布:以 7–9Hz 的语义 VLM 和 200Hz 的视觉运动策略分工,在人形上半身连续控制中兼顾泛化与实时性。
21 min read -
HALO 论文精读:让 VLA 先思考、再想象、后行动精读 HALO:用 Mixture-of-Transformers 将文本推理、视觉子目标预测与动作生成统一为 Embodied Multimodal Chain-of-Thought,并分析其训练配方、实验和代码现状。
15 min read -
What Do VLAs Actually Inherit from VLMs? 论文精读精读 GrinningFace:用 emoji 桌面操作任务拆分 VLA 的执行能力与 VLM 视觉语义先验,比较 LoRA、冻结 VLM、协同训练、离散动作和 latent action。
20 min read -
Genie Envisioner 论文精读:把世界模型、动作策略与模拟器合成一个闭环平台精读 Genie Envisioner:GE-Base 如何用多视角视频世界模型承载 GE-Act 动作解码、GE-Sim 闭环模拟与 EWMBench 评测。
26 min read -
Fast-in-Slow 论文精读:把高速执行嵌入慢速推理的统一 VLA精读 Fast-in-Slow(FiS-VLA):通过共享 VLM 末端 Transformer、异步双系统、3D 点云与双感知协同训练,同时获得高频控制和语义推理能力。
18 min read -
Evo-0 论文精读:让 VLA 从 RGB 中获得隐式空间理解精读 Evo-0:用 VGGT 的几何 token 和轻量 Cross-Attention 融合模块,为现有 VLA 注入无需深度传感器的隐式 3D 先验。
14 min read -
DUST 论文精读:双流扩散增强 World-Model VLA精读 DUST:用双流 MMDiT、解耦噪声与异步采样,把未来视觉状态建模融入 VLA,并在仿真、真实机器人和跨 embodiment 数据上验证。
17 min read -
DreamZero 论文精读:World Action Models are Zero-shot Policies精读 DreamZero:把 14B 视频扩散模型改造成同时预测未来视频与动作的 World Action Model,并分析其零样本泛化、跨本体迁移与 7Hz 实时控制。
19 min read -
Ctrl-World 论文精读:让世界模型在想象中评估和改进机器人策略精读 Ctrl-World:用多视角联合预测、位姿条件记忆检索和逐帧动作条件,把 Stable Video Diffusion 改造成可控的机器人世界模型。
24 min read -
BagelVLA 论文精读:用交错语言计划与视觉预见解决长时域操作精读 BagelVLA:在统一 MoT 模型中交错生成子任务文本、未来关键帧和动作,并用 Residual Flow Guidance 降低视觉预见延迟。
13 min read