-
ACE-Ego-0 论文精读:把第一视角人类视频变成 VLA 的可用动作监督精读 ACE-Ego-0:用 camera-space action、形态条件、时间对齐和可靠性加权,把 1.48K 小时人类第一视角视频与机器人数据统一用于 VLA 预训练。
21 min read -
ActionCodec 论文精读:什么样的 Action Tokenizer 才适合 VLA?精读 ActionCodec:从 VLA 优化视角重新定义动作 token,分析 overlap、词表容量、多模态互信息与 token 独立性。
14 min read -
CAIP 论文精读:让视觉表征对动作有感觉精读 CAIP:用第一视角人类视频中的手部姿态作为动作代理,通过动作-图像对比预训练获得更适合灵巧操作的视觉表征。
22 min read -
CLAP 论文精读:从人类视频学习可执行的 Vision-Language-Action 模型精读 CLAP:用 Act-VAE 建立物理动作词表,再以 VD-VAE 对齐人类视频,训练 CLAP-NTP,并用 CLAP-RF 与 Knowledge Matching 实现快速控制。
22 min read -
CoT-VLA 论文精读:让机器人先想象目标,再执行动作精读 CoT-VLA:用未来子目标图像作为视觉 Chain-of-Thought,再通过混合注意力和 Action Chunking 生成闭环动作。
27 min read -
FAST 论文精读:高效的 Vision-Language-Action 动作 Tokenization精读 FAST:用 DCT 与 BPE 压缩高频机器人动作,把自回归 VLA 从“预测数百个冗余 token”变成高信息密度的动作序列。
22 min read -
FASTer 论文精读:用神经动作 Tokenization 加速自回归 VLA精读 FASTer:从 FASTerVQ 的二维动作压缩、RVQ 与 DCT 重建,到 FASTerVLA 的 Block-wise Autoregression 和 Action Expert。
15 min read -
G0.5 论文精读:One Autoregressive Stream for Robot Action精读 Galaxea G0.5:用跨形态 ActionCodec、原生 CoT 与视觉记忆,把 VLM 重新变成同时推理和行动的 autoregressive VLA。
25 min read -
GR00T N1 论文精读:面向通用人形机器人的开放基础模型精读 NVIDIA GR00T N1:双系统 VLA、Eagle-2、Flow Matching DiT 与数据金字塔如何共同支撑跨形态人形机器人策略。
23 min read -
HEX:跨形态人形全身操作论文精读精读 HEX:用 body-part 对齐状态、UPP-MoE、视觉历史缓存与 flow matching,让全尺寸人形机器人跨形态完成协调的全身操作。
20 min read -
InSpire:用内在空间推理提升 VLA 泛化能力精读 InSpire:在动作生成前插入目标物体相对机器人方向的 VQA 桥接,用粗粒度空间推理抑制 VLA 的 shortcut learning 与 spurious correlation。
24 min read -
InternVLA-M1 论文精读:用空间先验连接 VLM 推理与机器人动作精读 InternVLA-M1:通过 230 万条空间 grounding 数据、空间提示和双监督训练,让 Qwen2.5-VL 的空间推理迁移到 DiT 动作专家。
20 min read -
Knowledge Insulating Vision-Language-Action Models 论文精读精读 Knowledge Insulation:用离散动作学习保护 VLM 表征,再用无梯度回传的 Flow Matching action expert 实现快速、连续且更会听指令的 VLA。
22 min read -
LAP:Language-Action Pre-Training 论文精读精读 LAP-3B:把连续末端动作写成自然语言,再用 flow-matching action expert 实现零样本跨 embodiment 迁移。
19 min read -
LAPA 论文精读:从无动作标签视频学习 Vision-Language-Action 模型精读 LAPA:用 VQ-VAE 从相邻视频帧学习离散 latent action,再让 VLM 预测它,最后用少量机器人动作标签完成真实控制映射。
25 min read
Collection