-
ForceVLA2 论文精读:让 VLA 学会感知并控制接触力精读 ForceVLA2:用 Force Prompt、Cross-Scale MoE 与混合力位控制,把力觉从辅助观测变成接触丰富操作中的闭环控制信号。
20 min read -
FTP-1 论文精读:把异构触觉做成可迁移的基础策略FTP-1 用形态感知触觉 Token 空间和共享触觉专家,将 21 种传感器、26 个数据源的触觉经验迁移到接触密集操作。
21 min read -
Genie Envisioner 论文精读:把世界模型、动作策略与模拟器合成一个闭环平台精读 Genie Envisioner:GE-Base 如何用多视角视频世界模型承载 GE-Act 动作解码、GE-Sim 闭环模拟与 EWMBench 评测。
26 min read -
GR-RL:面向长时域灵巧精密操作的强化学习专精化精读 ByteDance Seed 的 GR-RL:用分布式 critic 学习任务进度、过滤次优示范,再通过形态对称增强和 latent-space online RL,让 VLA 学会多眼孔鞋带穿线。
17 min read -
What Do VLAs Actually Inherit from VLMs? 论文精读精读 GrinningFace:用 emoji 桌面操作任务拆分 VLA 的执行能力与 VLM 视觉语义先验,比较 LoRA、冻结 VLM、协同训练、离散动作和 latent action。
20 min read -
HALO 论文精读:让 VLA 先思考、再想象、后行动精读 HALO:用 Mixture-of-Transformers 将文本推理、视觉子目标预测与动作生成统一为 Embodied Multimodal Chain-of-Thought,并分析其训练配方、实验和代码现状。
15 min read -
Helix 技术发布精读:快慢双系统 VLA精读 Figure Helix 技术发布:以 7–9Hz 的语义 VLM 和 200Hz 的视觉运动策略分工,在人形上半身连续控制中兼顾泛化与实时性。
21 min read -
Hume 论文精读:让 VLA 先思考,再流畅行动精读 Hume 的 value-guided System-2 thinking 与 cascaded action denoising,并对照官方代码分析双系统异步控制。
13 min read -
InternVLA-A1 论文精读:把理解、想象与动作统一起来精读 InternVLA-A1:用 Mixture-of-Transformers 统一场景理解、视觉前瞻与 Flow Matching 动作,在动态双臂操作中提升泛化。
21 min read -
LA4VLA 论文精读:Learning to Act without Seeing精读 LA4VLA:从 DROID 轨迹构造 33K 个 vision-agnostic atomic action episode,用 Language-Action 预训练让 VLA 学会语言如何约束动作。
20 min read -
LaWAM 论文精读:用潜空间世界模型预测机器人动作的视觉子目标精读 LaWAM:把 Latent Action Model 的前向解码器复用为 Latent World Model,在 DINOv3 特征空间预测动作相关的未来视觉子目标,兼顾动力学预见与低延迟控制。
17 min read -
Learning while Deploying 论文精读:让机器人群在部署中持续学习精读 LWD:用 DIVL 分布式价值学习与 QAM 流策略提取,把 16 台双臂机器人部署产生的离线与在线经验闭环用于通用 VLA 持续改进。
21 min read -
LeRobot 论文精读:把机器人学习做成端到端开源基础设施精读 LeRobot:统一机器人中间件、LeRobotDataset、可异步推理栈与可复用策略实现,分析其如何降低真实机器人学习的工程门槛。
19 min read -
LingBot-VA 论文精读:用因果世界模型驱动机器人控制精读 LingBot-VA:将视频世界建模与逆动力学动作生成交织为因果自回归序列,并以 MoT、KV Cache、部分去噪和 FDM 校正实现长时程闭环操控。
20 min read -
LingBot-VA 2.0 论文精读:原生视频-动作预训练如何服务通用机器人控制精读 LingBot-VA 2.0:以语义视觉-动作 tokenizer、因果 MoE DiT、Multi-Chunk Prediction 与异步闭环推理,实现可泛化的 video-action robot control。
17 min read
Collection