-
LaWAM 论文精读:用潜空间世界模型预测机器人动作的视觉子目标精读 LaWAM:把 Latent Action Model 的前向解码器复用为 Latent World Model,在 DINOv3 特征空间预测动作相关的未来视觉子目标,兼顾动力学预见与低延迟控制。
17 min read -
villa-X 论文精读:用物理接地的 Latent Action 连接 VLA 规划与控制精读 villa-X:用 proprioceptive FDM 让 latent action 对齐机器人动力学,再以 joint diffusion 联合规划 latent action 与低层动作,实现跨 embodiment 的 VLA 迁移。
19 min read -
LAPA 论文精读:从无动作标签视频学习 Vision-Language-Action 模型精读 LAPA:用 VQ-VAE 从相邻视频帧学习离散 latent action,再让 VLM 预测它,最后用少量机器人动作标签完成真实控制映射。
25 min read -
CLAP 论文精读:从人类视频学习可执行的 Vision-Language-Action 模型精读 CLAP:用 Act-VAE 建立物理动作词表,再以 VD-VAE 对齐人类视频,训练 CLAP-NTP,并用 CLAP-RF 与 Knowledge Matching 实现快速控制。
22 min read