Hana's Blog
Robotic Grasp Detection (12): 执行感知评估与开放问题Blur image

检测分数与执行成功之间的距离(From Detection Score to Execution)#

抓取检测器输出的姿态要经过碰撞检查(Collision Checking)、逆运动学(Inverse Kinematics, IK)、轨迹规划(Trajectory Planning)、夹爪闭合、抬升和任务执行。每个阶段对应一个可记录的状态和失败标签。

设候选抓取为 g=(R,t,w)g=(R,\vec t,w),其中 RSO(3)R\in SO(3)tR3\vec t\in\mathbb R^3wR0w\in\mathbb R_{\geq0}。从检测到任务的评测链路为:

Algorithm 1 从抓取检测到执行结果的评测流程
输入:
场景观测、抓取候选集合、平行夹爪模型、机器人模型和执行协议
输出:
分阶段执行记录、失败标签和任务结果
  1. require 保存全部候选、检测分数和候选生成时间
  2. 执行夹爪终态、接近扫掠体积和场景碰撞检查
  3. 对几何可行候选求 IK,检查关节限制和自碰撞
  4. 规划预抓取到接触、闭合和抬升轨迹
  5. 执行闭合和抬升,记录接触、力、夹爪状态和物体高度
  6. 在保持和任务阶段检测稳定、滑移、放置与恢复状态
  7. 将失败归类到检测、几何、可达、接触、稳定或任务阶段
  8. return 分阶段指标和最终任务结果

离线平均精度(Offline Average Precision, AP)覆盖候选与标注的匹配;执行协议再测量几何、规划、接触、稳定和任务结果。


评价阶梯(Evaluation Ladder)#

1. 离线姿态评价(Offline Pose Evaluation)#

常见指标包括矩形交并比(Intersection over Union, IoU)、姿态距离、AP、前 kk 项召回率(Recall@kk)和候选覆盖率(Candidate Coverage)。每项结果同时注明标注集合、匹配阈值和候选预算。

空间姿态匹配通常分别计算平移与旋转误差:

dt=t^t2,dR=minSScos1 ⁣(tr((RS)TR^)12),d_t=\lVert\hat{\vec t}-\vec t^*\rVert_2, \qquad d_R=\min_{S\in\mathcal S} \cos^{-1}\!\left( \frac{\operatorname{tr}((R^*S)^{\mathsf T}\hat R)-1}{2} \right),

其中 t^,tR3\hat{\vec t},\vec t^*\in\mathbb R^3R^,RSO(3)\hat R,R^*\in SO(3)S\mathcal S 是夹爪对称集合,τt\tau_tτR\tau_R 是平移、旋转阈值。预测在 dt<τtd_t<\tau_tdR<τRd_R<\tau_R 时与真值匹配,并采用一对一匹配。

2. 几何与解析有效性(Geometric and Analytic Validity)#

力闭合(Force Closure)、对向条件(Antipodal Condition)和碰撞检测(Collision Checking)验证候选在给定摩擦、几何和夹爪模型下的解析有效性。

几何有效性拆成四个布尔量:闭合区是否有物体、夹指/手掌终点是否碰撞、预抓取到终点的扫掠体积是否碰撞、候选宽度是否在硬件范围。日志分别保存这四个结果,并记录摩擦系数、法线来源、质心和力矩归一化方式。

3. 仿真执行(Simulated Execution)#

物理仿真加入重力、动力学、碰撞和扰动,结果由网格、接触求解器、控制器和随机化范围共同决定。

仿真试验使用固定状态机:移动到预抓取位姿、沿接近轴进入、闭合到力/位置阈值、抬升指定高度、保持指定时间,并在每一步记录碰撞、接触和物体高度。初始位姿、摩擦、质量和控制噪声按固定分布随机化,接近路径与闭合控制纳入同一执行协议。

4. 物理抬升与清空(Physical Lift and Clearing)#

抬升成功率(Lift Success Rate)记录物体是否离开支撑面,清空率(Clearing Rate)记录杂乱场景中的连续抓取。AnyGrasp 在其动态场景协议中报告超过 300 个未见物体上的 93.3% 箱体清空成功率 [1];报告时同时给出机器人、传感器和场景设置。

5. 稳定、滑移与可达(Stability, Slip, and Reachability)#

稳定性关注物体在扰动或运动后是否仍被持有;滑移评价接触相对运动;可达性评价机器人是否存在合法关节配置和轨迹。它们比首次抬升更接近部署。

6. 任务成功与恢复(Task Success and Recovery)#

最终任务可能包括放置、递交、倾倒、清理指定目标或避开脆弱部件。任务成功率同时包含语义、抓取、规划和控制。恢复策略还允许机器人在失败后获取新信息并再次尝试。


保留失败归因(Preserving Failure Attribution)#

执行日志按阶段保留失败归因。记录内容包括:

  • 所有候选及原始分数;
  • 碰撞和可达性过滤结果;
  • 最终选择与运动规划结果;
  • 接触、夹紧力、滑移和抬升轨迹;
  • 目标或部件是否正确;
  • 失败类别与恢复动作。

检测正确而规划失败标记为规划/可达失败;规划成功而接触不稳定标记为接触/稳定失败。

日志最好为每个尝试分配唯一 attempt_id,并保存候选表而不是只保存最后姿态。候选表的每一行包含原始分数、NMS 前后索引、碰撞原因、IK 解、规划代价与是否被选中;执行表再保存时间戳、夹爪宽度/电流、腕部力矩、物体高度和失败标签。这样可以离线重放“如果使用另一排序器会选哪个候选”,而无需重新执行所有机器人试验。


执行感知数据集(Execution-Aware Benchmarks)#

Supermarket-6DoF 在 20 个物体、1,500 次真实尝试上分别标注抬升成功和抓取后稳定性 [2],将“拿起来”和“稳定拿住”分为两个指标。

GraspIT 提供滑移测试与可达性质量,报告约 316k 组红绿蓝—深度帧(Red–Green–Blue and Depth Frame, RGB-D Frame)、1,035 个仿真和 100 个真实场景,以及约 230 万个候选 [3]。数据同时包含仿真验证和真实场景记录,可用于分析候选生成、可达性和滑移阶段。

GCA-Bench 将语义理解、姿态检测、规划和任务结果分阶段评价,包含 102 个复杂任务场景 [4]。它把检测输出与任务执行日志放在同一评测链路中。

TARGO 将目标身份和遮挡程度加入真实与合成协议,用于研究目标驱动抓取随遮挡变化的性能 [5],对应目标选择、遮挡可见性和 6-DoF 抓取三个接口。


开放问题一:校准不确定性(Calibrated Uncertainty)#

模型需要区分:

  • 传感器噪声引起的偶然不确定性(Aleatoric Sensor Uncertainty);
  • 未见物体与分布偏移(Distribution Shift);
  • 隐藏形状的不确定性(Shape Uncertainty);
  • 姿态和接触不确定性(Pose and Contact Uncertainty);
  • 规划与执行不确定性(Planning and Execution Uncertainty)。

vMF-Contact 使用概率接触方向与证据学习处理噪声杂乱场景 [6];Shape Completion Uncertainty 将补全不确定性用于抓取质量 [7];ActiveGrasp 用校准能量模型和信息选择主动观测 [8]。

校准评价使用可靠性图(Reliability Diagram)、期望校准误差(Expected Calibration Error, ECE)和风险—覆盖曲线(Risk–Coverage Curve),并把置信度连接到真实执行结果。

把预测成功概率分成 MM 个置信区间 BmB_m,ECE 定义为:

ECE=m=1MBmnacc(Bm)conf(Bm).\operatorname{ECE}=\sum_{m=1}^{M} \frac{|B_m|}{n} \left| \operatorname{acc}(B_m)-\operatorname{conf}(B_m) \right|.

其中 acc\operatorname{acc} 是该桶真实执行成功率,conf\operatorname{conf} 是平均预测概率。实验同时报告分桶设置、可靠性图、负对数似然或 Brier 分数(Brier Score),并在碰撞/可达性过滤前后分别计算校准结果。


开放问题二:跨传感器与跨具身迁移(Cross-Sensor and Cross-Embodiment Transfer)#

Seen/Novel 物体划分通常固定相机、夹爪和机器人。部署变化还包括:

  • 深度相机类型与噪声;
  • 视角、安装高度和手眼标定;
  • 夹爪开口、指尖厚度和摩擦;
  • 机械臂工作空间和关节限制;
  • 场景尺度与运动速度。

迁移协议独立改变这些因素,并区分零样本(Zero-Shot)、少样本校准(Few-Shot Calibration)和完整微调(Full Fine-Tuning)。物体类别、传感器、夹爪和机器人分别作为测试变量。


开放问题三:语义与物理兼容(Semantic–Physical Compatibility)#

语言模型定位“把手”后,抓取候选继续经过:

  • 夹爪开口与指尖几何检查;
  • 遮挡物和接近扫掠体积碰撞检查;
  • 机械臂 IK 与轨迹可达性检查;
  • 重力下的接触稳定性检查;
  • 后续放置姿态和轨迹检查。

ThinkGrasp 使用视觉语言推理选择部件或清理动作,再调用几何抓取模块 [9]。PhyGrasp 将材料、质量、脆弱性和语言偏好加入部件级选择 [10]。语义条件进入目标区域、禁区、力限制和任务轨迹后,分别统计每一级的通过率。


开放问题四:透明、柔性与关节物体(Transparent, Deformable, and Articulated Objects)#

三类对象对应三种观测和状态变量:

  • 透明物体改变传感器观测;
  • 柔性物体使接触改变几何;
  • 关节物体让状态、部件和动作语义耦合。

共享协议分别控制材质、状态和遮挡,并记录改进来自专用相机、类别先验、几何补全或接触反馈。


开放问题五:统一检测到执行基准(Linked Detection-to-Execution Benchmark)#

统一基准在同一场景和候选集合上保存:

observationcandidatesfiltersplannercontact traceoutcome.\text{observation} \rightarrow \text{candidates} \rightarrow \text{filters} \rightarrow \text{planner} \rightarrow \text{contact trace} \rightarrow \text{outcome}.

利用这些记录,可以计算条件概率:

P(task success)=P(D)P(FD)P(PF,D)P(EP,F,D),P(\text{task success}) =P(D)P(F\mid D)P(P\mid F,D)P(E\mid P,F,D),

其中 DD 是检测正确,FF 是物理可行,PP 是规划成功,EE 是执行成功。该分解保留每个阶段在前置条件成立时的失败统计。

实际报告可以直接给出条件计数:

P^(FD)=nDFnD,P^(PD,F)=nDFPnDF,\hat P(F\mid D)=\frac{n_{D\cap F}}{n_D},\qquad \hat P(P\mid D,F)=\frac{n_{D\cap F\cap P}}{n_{D\cap F}},

以及 P^(ED,F,P)\hat P(E\mid D,F,P),并同时报告每个条件概率的分母。离线候选有效率和最高分候选的执行成功率分别记录。


开放问题六:闭环恢复与安全适应(Closed-Loop Recovery and Safe Adaptation)#

闭环恢复利用未接触、碰撞、滑移或场景变化等新证据。恢复策略报告:

  • 尝试次数与时间预算;
  • 每次失败获得的信息;
  • 累计成功率;
  • 是否改变候选分布;
  • 是否存在安全回退(Safe Fallback);
  • 对脆弱物体和环境的风险。

恢复策略根据新证据更新下一次候选或动作。

给定最多 KK 次尝试,可以报告经验累计成功率:

S^k=1Ni=1N1[第 i 个场景在前 k 次内成功],k=1,,K.\widehat S_k= \frac{1}{N}\sum_{i=1}^{N} \mathbf 1[\text{第 }i\text{ 个场景在前 }k\text{ 次内成功}], \qquad k=1,\ldots,K.

同时报告条件恢复率 P(success at kfailed before k)P(\text{success at }k\mid\text{failed before }k),区分首次成功能力和失败后的恢复能力。累计成功率直接由闭环试验统计,不从单次成功率推导。


可复现执行报告(Reproducible Execution Reporting)#

真实抓取报告记录:

类别必要信息
夹爪型号、开口、指尖、指垫、力限制
相机型号、视角、标定、深度过滤
候选数量、阈值、非极大值抑制(Non-Maximum Suppression, NMS)、碰撞模型
机器人IK、规划器、速度、加速度、工作空间
成功定义抬升高度、保持时间、稳定/滑移阈值
试验物体、重置方式、重复次数、置信区间(Confidence Interval)
失败感知、碰撞、不可达、未接触、滑移、任务错误
计算推理、过滤、规划和总循环时间

抓取检测结果同时由离线候选、几何有效性、规划、接触稳定和任务完成率构成;不确定性和约束在对应阶段记录。

成功率也需要不确定区间#

nn 次独立试验中成功 xx 次,点估计 p^=x/n\hat p=x/n 在小样本下很不稳定。95% Wilson 置信区间(Wilson Confidence Interval)为:

p^+z22n±zp^(1p^)n+z24n21+z2n,z=1.96.\frac{ \hat p+\frac{z^2}{2n} \pm z\sqrt{\frac{\hat p(1-\hat p)}{n}+\frac{z^2}{4n^2}} }{1+\frac{z^2}{n}}, \qquad z=1.96.

例如“10 次成功 9 次”和“100 次成功 90 次”点估计同为 90%,区间宽度不同。比较两个检测器时,在相同物体—场景重置上做配对试验(Paired Trial),随机化执行顺序,并用配对差异或自助法(Bootstrap)置信区间报告改进。


参考文献(References)#

  1. H.-S. Fang et al., “AnyGrasp: Robust and Efficient Grasp Perception in Spatial and Temporal Domains,” IEEE Transactions on Robotics, 2023. DOI
  2. J. Toskov and A. Cosgun, “Supermarket-6DoF: A Real-World Grasping Dataset and Grasp Pose Representation Analysis,” arXiv preprint arXiv:2502.16311, 2025. arXiv
  3. P. Koch, A. Karakurt, and A. Sers, “GraspIT: A Dataset Bridging the Sim-to-Real Gap and Back for Validated Grasping SE(3) Pose Generation,” arXiv preprint arXiv:2607.05869, 2026. arXiv
  4. H. Zhang et al., “Beyond Visual Grasping: Benchmarking Complex Grasping from Detection to Execution,” arXiv preprint arXiv:2607.14341, 2026. arXiv
  5. Y. Xia et al., “TARGO and TARGO-Net: Benchmarking Target-Driven Object Grasping under Occlusions,” International Journal of Computer Vision, 2026. DOI
  6. Y. Shi, E. Welte, M. Gilles, and R. Rayyes, “vMF-Contact: Uncertainty-Aware Evidential Learning for Probabilistic Contact-Grasp in Noisy Clutter,” 2025 IEEE International Conference on Robotics and Automation, 2025. DOI
  7. N. F. Duarte et al., “Measuring Uncertainty in Shape Completion to Improve Grasp Quality,” 2025 IEEE/RSJ International Conference on Intelligent Robots and Systems, 2025. DOI
  8. B. Lei, W. Jiang, and K. Daniilidis, “ActiveGrasp: Information-Guided Active Grasping with Calibrated Energy-Based Model,” arXiv preprint arXiv:2511.12795, 2025. arXiv
  9. Y. Qian et al., “ThinkGrasp: A Vision-Language System for Strategic Part Grasping in Clutter,” Proceedings of the 8th Conference on Robot Learning, 2024. PMLR
  10. D. Guo et al., “PhyGrasp: Generalizing Robotic Grasping with Physics-Informed Large Multimodal Models,” 2025 IEEE/RSJ International Conference on Intelligent Robots and Systems, 2025. DOI
Robotic Grasp Detection (12): 执行感知评估与开放问题
https://agusexp25.top/en/blog/robotic-grasp-detection-12
Author 菊花花
Published at August 14, 2026