-
MWM 论文精读:让世界模型预测真正影响机器人决策的东西精读 ICML 2026 的 Mask World Model:以未来语义 mask 而非 RGB 像素训练世界模型,并用预测特征驱动扩散策略,提升机器人对外观变化的鲁棒性。
15 min read -
MM-ACT 论文精读:Learn from Multimodal Parallel Generation to Act精读 MM-ACT:在共享离散 token 空间中统一生成任务规划、未来图像与动作,并用 Context-Shared Multimodal Learning 提升机器人控制。
18 min read -
MMaDA-VLA 论文精读:统一多模态指令与生成的离散扩散 VLA精读 MMaDA-VLA:把语言、图像、动作放进同一离散 token 空间,用并行迭代去噪共同生成目标观测与动作块。
20 min read -
μ₀:A Scalable 3D Interaction-Trace World Model 论文精读精读 μ₀ 如何用 TraceExtract 从视频构建事件级 3D 交互轨迹,再以 B-spline 与 Flow Matching 预训练可跨形态复用的世界模型。
23 min read -
多相机视角扩展论文精读:用同步视角提升模仿学习的数据效率精读 Multi-Camera View Scaling:把一条同步多相机示教展开为伪示范,并以相机坐标动作和多视角动作聚合提升机器人模仿学习的数据效率与泛化。
18 min read -
OmniVLA-RL 论文精读:空间理解与在线强化学习统一的 VLA精读 OmniVLA-RL:用 MoT 三专家与 Block-wise Causal Attention 融合空间、语义和动作,并以 Flow-GSPO 稳定优化 Flow Matching 策略。
16 min read -
OmniVTA 论文精读:视觉-触觉世界模型驱动的接触丰富操作精读 OmniVTA:从 21,879 条视觉-触觉-动作轨迹出发,用 TactileVAE、双流世界模型、接触感知融合与 60Hz 反射控制解决接触丰富操作。
24 min read -
πRL 论文精读:为 Flow-based VLA 打通 Online RL精读 πRL:将 flow matching 的去噪过程改写为可计算似然的随机策略,使 π0 与 π0.5 能以 PPO 从在线交互中继续提升。
16 min read -
PLD 论文精读:用残差强化学习让 VLA 自己生成训练数据精读 Probe, Learn, Distill:冻结 VLA 通才策略,用残差 RL 探测失败状态,再把分布对齐的恢复轨迹蒸馏回通才模型。
16 min read -
PriorVLA 论文精读:保留预训练先验的 VLA 适配PriorVLA 用冻结 Prior Expert 与 Expert Queries 保留 VLA 的场景和运动先验,在少样本与 OOD 机器人操作中提升适配性能。
18 min read -
RICL 论文精读:给预训练 VLA 注入 In-Context Adaptability精读 RICL:通过检索增强上下文、动作插值和少量 priming 数据,把原本不会 ICL 的 π₀-FAST 改造成可用 10–20 条示教适应新操作的 VLA。
21 min read -
RL-100 论文精读:用真实世界 RL 把扩散策略推向 100% 成功率精读 RL-100:在扩散视觉运动策略上统一模仿学习、迭代离线 RL 与在线 RL,并用一致性蒸馏实现一步控制。
16 min read -
RLinf-USER:真机在线策略学习系统 论文精读精读 RLinf-USER:将机器人作为一等硬件资源,以异步流水线、云边通信和持久回放缓冲区支撑长时程真机在线策略学习。
19 min read -
RLinf-VLA 论文精读:统一且高效的 VLA 强化学习框架精读 RLinf-VLA:用统一接口连接 VLA、PPO/GRPO 与多种模拟器,并通过混合 GPU 分配和细粒度流水线提升具身强化学习效率。
18 min read -
RT-1:Robotics Transformer 论文精读精读 RT-1 的实时多任务机器人策略。
10 min read
Collection