-
SONIC 论文精读:自然人形机器人全身控制的规模化动作跟踪精读 SONIC:以大规模物理动作跟踪为 humanoid foundation task,用多编码器与 FSQ universal token 统一遥操作、规划和 VLA 全身控制。
19 min read -
RoboChallenge 论文精读:用远端机器人做大规模 VLA 真实评测精读 RoboChallenge:以远端机器人、视觉任务复现和 Table30,探索可扩展、可复现的真实机器人 VLA 评测。
23 min read -
Open X-Embodiment 论文精读:用跨机器人数据训练 RT-X 通用策略精读 Open X-Embodiment:统一 22 种机器人、60 个数据集与 RLDS 格式,并分析 RT-1-X/RT-2-X 如何从跨具身数据中获得正迁移。
17 min read -
Open-H-Embodiment 论文精读:让医疗机器人也拥有可扩展的基础模型数据精读 Open-H-Embodiment:780 小时、20 种医疗机器人平台的数据基础设施,以及 GR00T-H 和 Cosmos-H-Surgical-Simulator 的跨具身验证。
20 min read -
LIBERO-Plus 论文精读:VLA 鲁棒性的系统性体检精读 LIBERO-Plus:在 7 类扰动、10,030 个任务上拆解 VLA 的脆弱性,解释位置偏置、语言忽略与组合泛化缺口。
18 min read -
InternData-A1 论文精读:合成数据能否预训练通用机器人策略?精读 InternData-A1:用可组合、高保真、跨 embodiment 的合成操控数据预训练 π₀,验证其能在仿真和真实机器人任务中匹敌闭源 π-dataset。
20 min read -
EgoSteer 论文精读:从第一视角视频到可操控灵巧操作精读 EgoSteer:EgoSmith 数据流水线、统一机器人栈与世界模型增强 VLA 如何共同实现 40+ 任务的可操控双手灵巧操作。
19 min read -
EgoScale 论文精读:用 2 万小时人类视频扩展灵巧操作精读 NVIDIA EgoScale:把大规模第一视角人类视频、动作缩放律与人机对齐 mid-training 组合起来,迁移到 22-DoF 灵巧手。
20 min read -
EBench 论文精读:通用移动操作能力诊断精读 EBench:用 26 个跨移动、长时程与灵巧精密操作的任务,把通用操作策略的单一成功率拆成五维能力画像和四类泛化诊断。
11 min read -
WSA1 论文精读:3D World-Spatial-Action Robot Control精读 WSA1:用 3D 世界预测、3D 一致视觉思考和 3D 逆动力学统一 VLA/WAM,并以 6,000 小时异构数据实现高效泛化。
19 min read -
Do World Action Models Generalize Better than VLAs? 论文精读精读 WAM 与 VLA 的鲁棒性对比:RoboTwin 2.0-Plus 和 LIBERO-Plus 如何用 7 类扰动检验视频时空先验、训练数据多样性与推理效率。
22 min read -
VP-VLA 论文精读精读 VP-VLA:以 crosshair 和 bounding box 作为 System 2 规划与 System 1 控制之间的原生视觉接口,提升 VLA 的空间 grounding 与 OOD 操作鲁棒性。
22 min read -
TwinBrainVLA 论文精读:冻结通用大脑的双流 VLA精读 TwinBrainVLA:冻结 Left Brain、训练 Right Brain,并用 AsyMoT 将通用视觉语义注入 Flow-Matching 控制器,缓解 VLA 的 catastrophic forgetting。
19 min read -
Training-Time Action Conditioning 论文精读精读 Training-Time Action Conditioning:用训练时模拟推理延迟和 action prefix 条件化,去掉 RTC 的推理时 inpainting 开销。
15 min read -
TraceVLA 论文精读:用视觉轨迹提示补上 VLA 的时空记忆精读 TraceVLA:用 Co-Tracker 把机器人和物体的历史运动叠加到当前图像,在不堆叠历史帧的情况下增强 VLA 的空间—时间感知。
18 min read