2026
200 posts
- WorldArena 论文精读
- UMI-Bench 1.0 论文精读:把 UMI 数据到真实机器人评测串成一条可审计流水线
- Universal Manipulation Interface 论文精读:让机器人从野外人类示教中学习
- TouchAnything 论文精读:从第一视角视频估计双手触觉
- SONIC 论文精读:自然人形机器人全身控制的规模化动作跟踪
- SIMPLER 论文精读:用仿真可靠评测真实机器人操作策略
- SIM1 论文精读:让变形物理模拟成为零样本数据扩展器
- RoboTwin 2.0 论文精读:用可规模化仿真数据提升双臂操作鲁棒性
- RoboDojo 论文精读:统一仿真与真实世界的通用机器人操作评测基准
- RoboChallenge 论文精读:用远端机器人做大规模 VLA 真实评测
- RoboCasa 论文精读:把日常机器人训练数据扩展到十万条轨迹
- Open X-Embodiment 论文精读:用跨机器人数据训练 RT-X 通用策略
- Open-H-Embodiment 论文精读:让医疗机器人也拥有可扩展的基础模型数据
- Open-AoE 论文精读:把智能手机第一视角视频变成具身学习基础设施
- OmniUMI 论文精读:让机器人从人类对接触的感觉中学习
- MimicGen 论文精读:用少量人类示教规模化生成机器人数据
- LIBERO-Plus 论文精读:VLA 鲁棒性的系统性体检
- LIBERO 论文精读:终身机器人学习知识迁移基准
- InternData-A1 论文精读:合成数据能否预训练通用机器人策略?
- HiFi-UMI 论文精读:仅用高保真 UMI 数据学习可部署操作策略
- FastUMI 论文精读:可扩展、硬件无关的通用操作接口
- EgoVerse:面向机器人学习的全球第一视角人类数据集论文精读
- EgoSteer 论文精读:从第一视角视频到可操控灵巧操作
- EgoScale 论文精读:用 2 万小时人类视频扩展灵巧操作
- EgoLive 论文精读:面向真实人类任务的大规模第一视角数据集
- EgoInfinity 论文精读:把任意视角网络视频编译成可执行机器人动作
- EBench 论文精读:通用移动操作能力诊断
- DreamControl-v2 论文精读:让人形机器人在自身空间里“做梦”
- DexUMI 论文精读:用人手作为通用灵巧操作接口
- BeyondMimic 论文精读:从动作跟踪到可组合的人形机器人控制
- A1 论文精读:Fully Transparent、Adaptive、Efficient 的 Truncated VLA
- WSA1 论文精读:3D World-Spatial-Action Robot Control
- Do World Action Models Generalize Better than VLAs? 论文精读
- What Matters for Latent Actions in Robot Learning 论文精读
- VTAM 论文精读:让机器人用触觉预测接触动力学
- VP-VLA 论文精读
- VLAC 论文精读:让 VLA 同时成为策略与过程奖励模型
- ViVa 论文精读:让视频生成模型成为机器人价值函数
- VideoVLA 论文精读:让视频生成器同时想象与执行
- TwinBrainVLA 论文精读:冻结通用大脑的双流 VLA
- Training-Time Action Conditioning 论文精读
- TraceVLA 论文精读:用视觉轨迹提示补上 VLA 的时空记忆
- TouchWorld 论文精读:让触觉既能预测未来,也能实时纠错
- ThinkAct 论文精读:用视觉潜变量让 VLA 先思考再行动
- TacVLA 论文精读:接触感知触觉融合 VLA
- T-Rex 论文精读:Tactile-Reactive Dexterous Manipulation
- StarVLA-α 论文精读
- StarVLA 论文精读:用可插拔骨干与动作头统一 VLA 研究
- SpatialVLA 论文精读:用 3D 空间表示统一跨机器人 VLA
- Spatial Traces 论文精读:把时间轨迹写进深度图的 ST-VLA
- SLIM-0.5B 论文精读:用 action-grounded predictive latents 做紧凑机器人策略
- SimpleVLA-RL 论文精读:用在线强化学习扩展 VLA 的数据与泛化能力
- RynnValue 论文精读:用时间距离训练可扩展的机器人价值基础模型
- RT-1:Robotics Transformer 论文精读
- RLinf-VLA 论文精读:统一且高效的 VLA 强化学习框架
- RLinf-USER:真机在线策略学习系统 论文精读
- RL-100 论文精读:用真实世界 RL 把扩散策略推向 100% 成功率
- RICL 论文精读:给预训练 VLA 注入 In-Context Adaptability
- PriorVLA 论文精读:保留预训练先验的 VLA 适配
- PLD 论文精读:用残差强化学习让 VLA 自己生成训练数据
- πRL 论文精读:为 Flow-based VLA 打通 Online RL
- OmniVTA 论文精读:视觉-触觉世界模型驱动的接触丰富操作
- OmniVLA-RL 论文精读:空间理解与在线强化学习统一的 VLA
- 多相机视角扩展论文精读:用同步视角提升模仿学习的数据效率
- μ₀:A Scalable 3D Interaction-Trace World Model 论文精读
- MMaDA-VLA 论文精读:统一多模态指令与生成的离散扩散 VLA
- MM-ACT 论文精读:Learn from Multimodal Parallel Generation to Act
- MWM 论文精读:让世界模型预测真正影响机器人决策的东西
- LingBot-VA 2.0 论文精读:原生视频-动作预训练如何服务通用机器人控制
- LingBot-VA 论文精读:用因果世界模型驱动机器人控制
- LeRobot 论文精读:把机器人学习做成端到端开源基础设施
- Learning while Deploying 论文精读:让机器人群在部署中持续学习
- LaWAM 论文精读:用潜空间世界模型预测机器人动作的视觉子目标
- LA4VLA 论文精读:Learning to Act without Seeing
- InternVLA-A1 论文精读:把理解、想象与动作统一起来
- Hume 论文精读:让 VLA 先思考,再流畅行动
- Helix 技术发布精读:快慢双系统 VLA
- HALO 论文精读:让 VLA 先思考、再想象、后行动
- What Do VLAs Actually Inherit from VLMs? 论文精读
- GR-RL:面向长时域灵巧精密操作的强化学习专精化
- Genie Envisioner 论文精读:把世界模型、动作策略与模拟器合成一个闭环平台
- FTP-1 论文精读:把异构触觉做成可迁移的基础策略
- ForceVLA2 论文精读:让 VLA 学会感知并控制接触力
- FineVLA 论文精读:用细粒度语言让 VLA 真正听懂“怎么做”
- FD-VLA 论文精读
- Fast-in-Slow 论文精读:把高速执行嵌入慢速推理的统一 VLA
- Evo-0 论文精读:让 VLA 从 RGB 中获得隐式空间理解
- dWorldEval 论文精读:用离散扩散世界模型规模化评估机器人策略
- dVLA 论文精读:用多模态 CoT 统一扩散式 VLA
- DUST 论文精读:双流扩散增强 World-Model VLA
- DreamZero 论文精读:World Action Models are Zero-shot Policies
- DreamVLA 论文精读:让机器人先“做梦”再行动
- 3D Diffusion Policy(DP3)论文精读:用稀疏点云提升少样本视觉运动泛化
- Ctrl-World 论文精读:让世界模型在想象中评估和改进机器人策略
- Cosmos Policy 论文精读:把视频扩散模型变成策略、世界模型与规划器
- BagelVLA 论文精读:用交错语言计划与视觉预见解决长时域操作
- ASPIRE 论文精读:让机器人像软件工程师一样积累技能
- AIM:带空间价值图的意图感知统一世界-动作模型论文精读
- Adaptive Action Chunking 论文精读:让 VLA 在推理时自己决定执行多长
- A2A 论文精读:用历史动作替代高斯噪声的 Flow Matching 策略
- WARP-RM 论文精读:用时间扭曲学习相对进度奖励
- VLA-OPD 论文精读:用 On-Policy Distillation 连接 VLA 的 SFT 与 RL
- VLA-0 论文精读:不改 VLM,直接把动作写成文本
- VISTA:Scaling World Model 论文精读
- villa-X 论文精读:用物理接地的 Latent Action 连接 VLA 规划与控制
- UniDex 论文精读:从第一视角人类视频到通用灵巧手控制
- π*₀.₆ 与 RECAP 论文精读:让 VLA 从真实经验中变强
- RDT2 论文精读:探索 UMI 数据规模化的跨本体零样本泛化极限
- RDT-1B 论文精读:用 Diffusion Transformer 学习双臂操作
- Qwen-VLA 论文精读:统一跨任务、环境与机器人形态的 VLA
- π₀.₇ 论文精读:用多模态提示把机器人基础模型变成可操控的通才
- OneTwoVLA 论文精读:让 VLA 在必要时思考、其余时间行动
- MolmoAct 论文精读:空间推理 Action Reasoning Model
- LAPA 论文精读:从无动作标签视频学习 Vision-Language-Action 模型
- LAP:Language-Action Pre-Training 论文精读
- Knowledge Insulating Vision-Language-Action Models 论文精读
- InternVLA-M1 论文精读:用空间先验连接 VLM 推理与机器人动作
- InSpire:用内在空间推理提升 VLA 泛化能力
- HEX:跨形态人形全身操作论文精读
- GR00T N1 论文精读:面向通用人形机器人的开放基础模型
- G0.5 论文精读:One Autoregressive Stream for Robot Action
- FASTer 论文精读:用神经动作 Tokenization 加速自回归 VLA
- FAST 论文精读:高效的 Vision-Language-Action 动作 Tokenization
- CoT-VLA 论文精读:让机器人先想象目标,再执行动作
- CLAP 论文精读:从人类视频学习可执行的 Vision-Language-Action 模型
- CAIP 论文精读:让视觉表征对动作有感觉
- ActionCodec 论文精读:什么样的 Action Tokenizer 才适合 VLA?
- ACE-Ego-0 论文精读:把第一视角人类视频变成 VLA 的可用动作监督
- X-VLA 论文精读:用 Soft Prompt 统一跨本体 Vision-Language-Action 学习
- SmolVLA 论文精读:面向低成本机器人的高效 Vision-Language-Action 模型
- Qwen-RobotManip 论文精读:对齐如何释放机器人规模化
- ChatVLA-2 论文精读:让 VLA 保留 VLM 的开放世界推理
- TinyVLA 论文精读:轻量 VLM 与扩散策略打造快速 VLA
- RT-2 论文精读:Vision-Language-Action Models
- RoboDual 论文精读:让通才 VLA 与扩散专家协同控制
- π₀.₅ 论文精读:面向开放世界泛化的 Vision-Language-Action 模型
- π₀ 论文精读:通用机器人控制的视觉-语言-动作流模型
- OpenVLA-OFT 论文精读:Fine-Tuning Vision-Language-Action Models
- OpenVLA 论文精读
- Diffusion Policy 论文精读:用动作扩散学习视觉运动策略
- CogACT 论文精读:让 VLM 负责认知,让 Diffusion Transformer 负责动作
- BAGEL 论文精读:交错多模态预训练中的涌现能力
- ACT 论文精读:Action Chunking with Transformers
- Robotic Grasp Detection (12): 执行感知评估与开放问题
- Robotic Grasp Detection (11): 夹爪感知与跨具身抓取检测
- Robotic Grasp Detection (10): 多模态感知与闭环抓取优化
- Robotic Grasp Detection (9): 目标、任务、部件与语言条件抓取
- Robotic Grasp Detection (8): 基于扩散模型与流模型的生成式抓取检测
- Robotic Grasp Detection (7): 不完整几何与主动感知
- Robotic Grasp Detection (6): 数据集与基准评测协议
- Robotic Grasp Detection (5): 稠密、接触中心与体素抓取表示
- Robotic Grasp Detection (4): 基于点云的采样式 6-DoF 抓取检测
- Robotic Grasp Detection (3): 平面与 2.5-D 抓取检测
- Robotic Grasp Detection (2): 抓取几何与质量评价
- Robotic Grasp Detection (1): 问题定义与分类体系
- Robotic Grasp Detection (0): 系列范围、发展脉络与抓取决策流程
- Paper Reading: Embodied AI 5
- Paper Reading: Embodied AI 4
- Paper Reading: VLM 2
- Paper Reading: VLM 1
- Paper Reading: Unify MLLM 1
- Paper Reading: Unify MLLM 1
- Paper Reading: MLLM 2
- Paper Reading: MLLM 1
- Paper Reading: MARL 1
- Paper Reading: LLM 2
- Paper Reading: LLM 1
- Paper Reading: Embodied AI 3
- Paper Reading: Embodied AI 2
- Paper Reading: Embodied AI 1
- Paper Reading: CV 3
- Paper Reading: CV 2
- Paper Reading: CV 1
- Paper Reading: Basic Method 1
- Ubuntu OpenSSH 远程服务器配置教程
- Vim 详细使用教程:从入门到高频操作
- 共享服务器下 Git 版本管理实战(Linux/macOS/Windows)
- 用 scp 向远程服务器传送文件
- 纯 SSH 服务器配置 RustDesk(命令行方案)
- Linux 无图形界面服务器代理配置(Clash Verge 方案)
- 在本地电脑上配置 GitHub 权限(SSH/HTTPS)
- Vibe Coding For AI 4: Gemini CLI 安装与使用指南
- Vibe Coding For AI 3: Codex CLI 安装与使用指南
- Vibe Coding For AI 2: Claude CLI 安装与使用指南
- SSH 断连不掉任务:tmux 入门教程
- 如何把本地项目上传到 GitHub 仓库(完整教程)
- Ubuntu 24.04 安装 MATLAB R2024a
- A800 服务器深度学习环境标准配置教程
- 在 VSCode 上配置 SSH 远程开发
- Vibe Coding For AI 1: Windows 上配置 Coding Agent 指南
- RL笔记(29):推理模型的崛起 (GRPO & PRM)
- RL笔记(28):大语言模型与强化学习 (LLM + RLHF)
- RL笔记(27):MARL 最后的波纹 (MAT & HASAC)
- RL笔记(26):异构智能体信任区域优化 (HAPPO & HATRPO)
- RL笔记(25):多智能体策略梯度 (MADDPG & MAPPO)
- RL笔记(24):超越单调性 (QTRAN, WQMIX, QPLEX)
- RL笔记(23):多智能体值分解 (VDN & QMIX)
- Slay the Spire: Silent Cards 评测
- Galgame 简评系列 2
- Galgame 简评系列 1
2025
22 posts
- RL笔记(22):初入多智能体强化学习 (MARL)
- RL笔记(21):目标导向的强化学习 (Goal-Conditioned RL)
- RL笔记(20):Decision Transformer
- RL笔记(19):离线强化学习 (Offline RL)
- RL笔记(18):基于模型的策略优化 (MBPO)
- RL笔记(17):模型预测控制 (MPC)
- RL笔记(16):模仿学习 (Imitation Learning)
- RL笔记(15):SAC
- RL笔记(14):SQL
- RL笔记(13):DDPG
- RL笔记(12):PPO
- RL笔记(11):TRPO
- RL笔记(10):Actor-Critic
- RL笔记(9):REINFORCE
- RL笔记(8):DQN
- RL笔记(7):Dyna-Q
- RL笔记(6):时序差分
- RL笔记(5):蒙特卡洛
- RL笔记(4):动态规划
- RL笔记(3):马尔可夫决策过程
- RL笔记(2):多臂老虎机
- RL笔记(1):初入强化学习