-
AIM:带空间价值图的意图感知统一世界-动作模型论文精读精读 AIM:用空间价值图把视频世界建模与动作意图连接起来,并以 intent-causal attention 与 GRPO 提升 RoboTwin 操作成功率。
23 min read -
ASPIRE 论文精读:让机器人像软件工程师一样积累技能精读 ASPIRE:用闭环执行追踪、可持续技能库与进化式程序搜索,让 code-as-policy 机器人跨任务、跨场景持续变强。
16 min read -
BagelVLA 论文精读:用交错语言计划与视觉预见解决长时域操作精读 BagelVLA:在统一 MoT 模型中交错生成子任务文本、未来关键帧和动作,并用 Residual Flow Guidance 降低视觉预见延迟。
13 min read -
Cosmos Policy 论文精读:把视频扩散模型变成策略、世界模型与规划器精读 Cosmos Policy:无需改动视频模型架构,通过 latent frame injection 联合生成动作、未来状态和值,并用 rollout 数据实现模型式规划。
22 min read -
Ctrl-World 论文精读:让世界模型在想象中评估和改进机器人策略精读 Ctrl-World:用多视角联合预测、位姿条件记忆检索和逐帧动作条件,把 Stable Video Diffusion 改造成可控的机器人世界模型。
24 min read -
3D Diffusion Policy(DP3)论文精读:用稀疏点云提升少样本视觉运动泛化精读 RSS 2024 的 3D Diffusion Policy:从单目深度构建稀疏点云,用轻量 DP3 Encoder 条件化 Diffusion Policy,在 72 个仿真任务和 4 个真实任务中实现高效、可泛化的模仿学习。
16 min read -
DreamVLA 论文精读:让机器人先“做梦”再行动精读 DreamVLA:用动态区域、深度与语义构成的未来世界知识替代整帧预测,再由结构化注意力和 Diffusion Transformer 完成逆动力学控制。
19 min read -
DreamZero 论文精读:World Action Models are Zero-shot Policies精读 DreamZero:把 14B 视频扩散模型改造成同时预测未来视频与动作的 World Action Model,并分析其零样本泛化、跨本体迁移与 7Hz 实时控制。
19 min read -
DUST 论文精读:双流扩散增强 World-Model VLA精读 DUST:用双流 MMDiT、解耦噪声与异步采样,把未来视觉状态建模融入 VLA,并在仿真、真实机器人和跨 embodiment 数据上验证。
17 min read -
dVLA 论文精读:用多模态 CoT 统一扩散式 VLA精读 dVLA:把视觉子目标、文本推理和机器人动作统一为离散扩散去噪,并用 Prefix Mask 与 KV Cache 将推理速度提升到约 2 倍。
22 min read -
dWorldEval 论文精读:用离散扩散世界模型规模化评估机器人策略精读 dWorldEval:把视觉、语言和动作放进同一离散 token 序列,以关键帧记忆和 progress token 实现可扩展的机器人策略评估。
20 min read -
Evo-0 论文精读:让 VLA 从 RGB 中获得隐式空间理解精读 Evo-0:用 VGGT 的几何 token 和轻量 Cross-Attention 融合模块,为现有 VLA 注入无需深度传感器的隐式 3D 先验。
14 min read -
Fast-in-Slow 论文精读:把高速执行嵌入慢速推理的统一 VLA精读 Fast-in-Slow(FiS-VLA):通过共享 VLM 末端 Transformer、异步双系统、3D 点云与双感知协同训练,同时获得高频控制和语义推理能力。
18 min read -
FD-VLA 论文精读精读 FD-VLA:用视觉与机器人状态蒸馏出力觉 token,在不依赖力传感器的情况下提升接触丰富操作。
17 min read -
FineVLA 论文精读:用细粒度语言让 VLA 真正听懂“怎么做”精读 FineVLA:从异构轨迹清洗、DTW 采样到 RoboFine-Bench 与 FG/Raw 混合训练,理解细粒度指令如何带来可操控的机器人行为。
19 min read
Collection