Hana's Blog
Robotic Grasp Detection (7): 不完整几何与主动感知Blur image

抓取需要接触不可见区域(Grasping Requires Hidden Contact Geometry)#

单视角红绿蓝—深度观测(Red–Green–Blue and Depth, RGB-D)只测到朝向相机的表面。平行夹爪(Parallel-Jaw Gripper)的两个夹指需要在物体两侧形成接触,其中一侧可能被自遮挡(Self-Occlusion)或其他物体遮挡(Inter-Object Occlusion)。因此,抓取检测器面对的输入不是完整物体,而是带有系统性缺失的几何观测。

设真实表面为 SR3S\subset\mathbb R^3,观测点云为 PobsR3P_{\text{obs}}\subset\mathbb R^3,则单视角观测可以写成:

PobsS.P_{\text{obs}} \subset S.

缺失几何不是普通随机噪声。它与视角、材质、遮挡关系和传感器原理相关:

  • 背面因为视线不可达而缺失;
  • 透明或反光表面因为深度测量失效而缺失;
  • 薄结构和远距离小物体因分辨率不足而稀疏;
  • 杂乱场景中的接触区域可能完全不可见。

处理这类输入有两条路线:在固定观测下推断隐藏几何,或者移动传感器获取新的观测。前者对应形状补全和隐式重建,后者对应多视角融合和主动感知。

方法路线总览(Overview of Method Families)#

下表先给出各类方法的输入、输出和典型抓取接口。后文再解释每种表示如何训练,以及它怎样进入抓取候选生成和排序。

方法路线主要输入主要输出典型代表抓取接口
点云补全(Point Completion)单视角点云补全点集或完整点表示Beyond Top-Grasps、CompletePoints、PCF-Grasp在补全几何上生成或评分 6-DoF 抓取
隐式联合重建(Implicit Reconstruction)RGB-D / 物体裁剪Occupancy、SDF 或抓取场CenterGrasp、Local Occupancy-Enhanced Grasping查询局部几何并解码抓取
神经渲染(Neural Rendering)多视角 RGB / RGB-D辐射场、表面和三维特征GraspNeRF、Any-View从三维表示生成或优化抓取
主动视角规划(Active View Planning)当前观测与候选视角下一相机位姿和更新观测VISO-Grasp、Cross-View Fusion以抓取收益选择下一视角
不确定性传播(Uncertainty Propagation)多个几何假设或模型预测抓取质量分布和碰撞概率采样式补全、网络集成对候选执行风险感知排序

场景与点云补全(Scene and Point-Cloud Completion)#

形状补全(Shape Completion)学习条件分布:

p(ShiddenPobs),ShiddenR3.p(S_{\text{hidden}}\mid P_{\text{obs}}), \qquad S_{\text{hidden}}\subset\mathbb R^3.

实际系统通常先输出一个确定性补全结果 S^\hat S,再把它送入抓取检测器。Beyond Top-Grasps Through Scene Completion 使用场景补全支持非顶抓姿态 [1];CompletePoints 通过模拟完整点表示改善单视角六自由度(Six Degrees of Freedom, 6-DoF)检测 [2]。

补全表示决定了训练目标和后端如何查询几何,常见形式有点集、占据场和符号距离场。

**点集补全(Point-Set Completion)**直接预测点集 P^R3\hat P\subset\mathbb R^3。给定完整点集 PR3P^*\subset\mathbb R^3,常用双向倒角距离(Chamfer Distance, CD)为:

LCD=1P^xP^minyPxy22+1PyPminxP^yx22.\mathcal L_{\text{CD}}= \frac{1}{|\hat P|}\sum_{x\in\hat P}\min_{y\in P^*}\lVert x-y\rVert_2^2 +\frac{1}{|P^*|}\sum_{y\in P^*}\min_{x\in\hat P}\lVert y-x\rVert_2^2.

第一项让预测点靠近真实表面,第二项让预测点覆盖真实点集。训练时,网络编码 PobsP_{\text{obs}},解码器逐步生成缺失点或完整点集;推理时,补全点与观测点合并,再进入法线估计、候选生成和碰撞检测。CD 只比较点到点的距离,因此工程实现通常还会关注法线、薄结构和夹爪闭合区域的局部几何。

**占据场(Occupancy Field)**对查询点 xR3x\in\mathbb R^3 和观测编码 zRdz\in\mathbb R^d 输出占据概率 oθ(x,z)[0,1]o_\theta(x,z)\in[0,1]。训练样本由空间查询点和内外标签组成,二元交叉熵(Binary Cross-Entropy, BCE)可以写成:

Locc=1Kk=1K[yklogoθ(xk,z)+(1yk)log(1oθ(xk,z))],\mathcal L_{\text{occ}} =-\frac{1}{K}\sum_{k=1}^{K} \left[y_k\log o_\theta(x_k,z) +(1-y_k)\log(1-o_\theta(x_k,z))\right],

其中 KK 是查询点数量,xkR3x_k\in\mathbb R^3yk{0,1}y_k\in\{0,1\} 表示该点位于物体内部还是外部。推理时,在三维网格上查询 oθo_\theta,再用阈值提取表面;在接触区域直接查询占据值,则可以判断夹爪指尖或闭合通道是否进入物体内部。训练查询点不能全部均匀采样,因为大多数点会远离表面,通常还要加入表面附近的扰动点。**截断符号距离场(Truncated Signed Distance Field, TSDF)**则为每个查询点提供到表面的有符号距离,适合碰撞检查和梯度优化。

点集补全的后端处理通常可以分成四步:

  1. 将观测点与补全点变换到同一坐标系;
  2. 从表面法线、局部邻域或隐式场查询中生成抓取候选;
  3. 在夹爪闭合区域和接近通道中执行碰撞检查;
  4. 用抓取质量、碰撞结果和机器人可达性对候选排序。

PCF-Grasp 将点云补全结果转换为几何特征,作为 6-DoF 抓取检测器的辅助输入,而不是直接把补全点作为唯一几何来源 [6]。这类接口让网络同时利用观测几何和补全先验。


联合重建与抓取(Joint Reconstruction and Grasping)#

CenterGrasp 使用对象中心隐式表示(Object-Centric Implicit Representation)同时进行形状重建和六自由度抓取估计 [3]。它先从 RGB-D 观测中提取对象级特征,再在对象坐标系中查询几何和抓取相关信息。

可以用下面的抽象形式理解这类网络:

fθ(x,z)(oθ(x,z),dθ(x,z),hθ(x,z)),f_\theta(x,z)\rightarrow (o_\theta(x,z),d_\theta(x,z),h_\theta(x,z)),

其中 xR3x\in\mathbb R^3 是对象坐标系中的查询位置,zRdz\in\mathbb R^d 是观测编码,oθo_\theta 是占据预测,dθd_\theta 是距离或表面相关量,hθh_\theta 是用于抓取预测的局部特征。抓取姿态仍可统一写为 g=(R,t,w)g=(R,\boldsymbol t,w),其中 RSO(3)R\in SO(3)tR3\boldsymbol t\in\mathbb R^3wR0w\in\mathbb R_{\geq0} 分别表示夹爪旋转、位置和开口宽度。

连续隐式表示的推理过程是:估计对象坐标系,在三维查询点上计算占据和特征,再从高响应区域解码 gg,最后进行碰撞与可达性检查。它不需要把完整物体固定成相同数量的点,但查询分辨率和对象坐标估计会直接影响候选质量。

Local Occupancy-Enhanced Grasping 使用多平面投影(Multiple Triplanar Projection)编码局部占据几何 [7]。三张相互正交的二维特征平面分别存储局部空间信息,查询点投影到各平面后取样并融合特征,再预测抓取。相比直接在稀疏点上回归,它为接触区域提供了连续局部表示;全局场景关系仍由前端分割、坐标变换和后端碰撞检查处理。


神经渲染与多视角几何(Neural Rendering and Multi-View Geometry)#

神经辐射场(Neural Radiance Field, NeRF)和相关神经表面表示可以融合多张 RGB 图像,从不同视角恢复几何与外观。GraspNeRF 使用可泛化 NeRF 处理透明和高反光物体的多视角六自由度抓取 [4]。

NeRF 沿相机射线查询场函数。设射线原点 oR3o\in\mathbb R^3,单位方向 dR3d\in\mathbb R^3,则 r(t)=o+tdr(t)=o+td;在采样位置 tit_i 处,网络输出密度 σiR0\sigma_i\in\mathbb R_{\geq0} 和颜色 ciR3c_i\in\mathbb R^3。离散体渲染(Volume Rendering)为:

C^(r)=iTiαici,Ti=j<i(1αj),αi=1eσiδi.\hat C(r)=\sum_i T_i\alpha_i c_i, \qquad T_i=\prod_{j<i}(1-\alpha_j), \qquad \alpha_i=1-e^{-\sigma_i\delta_i}.

其中 δi=ti+1ti\delta_i=t_{i+1}-t_i 是相邻采样点的距离,TiT_i 是光线到达第 ii 个采样点时仍未被吸收的透射率,αi\alpha_i 是该区间的不透明度。期望深度可写成 D^(r)=iTiαiti\hat D(r)=\sum_iT_i\alpha_i t_i。抓取系统通常从密度场提取网格或点云,也可以直接读取三维特征来评价候选。实际解码时还要进行尺度标定、表面阈值选择和夹爪碰撞检查。

Any-View 6DoF Grasping 通过神经表面渲染,使模型能够从不同观察视角推断抓取 [5]。NeRF Grasp Pose Optimization 则利用 NeRF 特征评价和优化已有候选 [8]。

多视角抓取的实现通常包含以下环节:

  1. 通过相机外参标定(Extrinsic Calibration)将各视角变换到统一坐标系;
  2. 编码每张图像并聚合跨视角特征;
  3. 由聚合特征预测密度、表面或三维抓取特征;
  4. 提取候选抓取 g=(R,t,w)g=(R,\boldsymbol t,w),执行碰撞过滤和机器人可达性检查。

You Only Scan Once 面向动态场景构建一次扫描与重建流水线,再生成六自由度抓取 [9];这类方法还需要在扫描期间维护相机、物体和机器人之间的时空关系。


透明与高反光物体(Transparent and Specular Objects)#

普通结构光或双目深度相机可能在玻璃、透明塑料和高反光金属上产生孔洞或错误深度。此时物体在 RGB 中可见,但深度图中缺少稳定的接触表面。

主动立体(Active Stereo)相机投射红外纹理并通过左右图匹配估计视差。设焦距为 ff、双目基线为 bb、视差为 dd,相机坐标系中的深度近似为:

z=fbd,f,b,d,zR>0.z=\frac{fb}{d}, \qquad f,b,d,z\in\mathbb R_{>0}.

透明表面会折射投影纹理,使匹配位置不再对应同一物理表面;高反光表面则可能造成饱和或错误匹配。因此,透明物体方法通常结合 RGB 轮廓、多视角一致性、主动照明或神经渲染来恢复几何。

这类实验需要同时记录:

  • 光照与背景;
  • 相机类型和主动投射设置;
  • 视角数量;
  • 重建误差与抓取成功分别如何测量;
  • 方法在普通不透明物体上的表现。

透明性改变的是观测模型(Observation Model):同一个抓取检测器在输入端接收到的深度证据不同。GraspNeRF 通过多视角神经渲染恢复透明/高反光几何 [4];ASGrasp 使用 RGB-D 主动立体相机(Active Stereo Camera)进行可泛化透明物体重建和抓取 [10]。


主动视角选择(Active View Selection)#

形状补全在固定观测下推断隐藏几何;主动感知(Active Perception)通过相机或机器人动作获得新证据。设历史观测为 HtH_t,候选相机位姿为 vVv\in\mathcal V,新观测为 ot+1(v)o_{t+1}(v),主动策略可以选择最大化预期抓取收益的视角:

v=argmaxvE[U(GHt,ot+1(v))C(v)],v^*=\arg\max_v \mathbb{E}\left[U(G\mid H_t,o_{t+1}(v))-C(v)\right],

其中 UU 是观测更新后的抓取效用,C(v)C(v) 是移动时间、路径长度和碰撞风险组成的成本。

下一最佳视角(Next-Best View, NBV)的目标是减少抓取相关的不确定性,例如暴露目标把手、被遮挡接触面或夹爪接近通道。实际系统通常从有限位姿集合 V\mathcal V 中选择视角,并在评分前删除机器人不可达或相机将与场景碰撞的位姿。

ZZ 表示待估计的三维占据状态,H()H(\cdot) 表示其熵。对每个 vVv\in\mathcal V,可以用当前占据模型预测新观测带来的信息增益(Information Gain, IG):

IG(v)=H(ZHt)Eot+1p(ov,Ht)[H(ZHt,ot+1)].\operatorname{IG}(v)= H(Z\mid H_t)- \mathbb E_{o_{t+1}\sim p(o\mid v,H_t)} [H(Z\mid H_t,o_{t+1})].

抓取相关策略可以只统计候选接触区和接近通道内的熵,或者直接估计观测后最高可行抓取分数的提升。一个具体的视角效用为:

J(v)=IG(v)λtT(v)λmCmotion(v),J(v)=\operatorname{IG}(v)-\lambda_tT(v)-\lambda_mC_{\text{motion}}(v),

其中 T(v)T(v) 是预计采集时间,Cmotion(v)C_{\text{motion}}(v) 是机器人运动成本,λt,λm0\lambda_t,\lambda_m\geq0 是权重。

Algorithm 1 不完整几何下的主动抓取流程
输入:
当前 RGB-D 观测、候选视角集合、几何重建模型、抓取检测器和机器人运动模型
输出:
最终抓取姿态,或下一步需要获取的相机视角
  1. require

    初始化历史观测 HtH_t 和待评估视角集合 V\mathcal V

  2. for 在当前观测历史下循环
  3. 估计可见几何、补全几何及其不确定性
  4. 生成抓取候选,并计算抓取质量、碰撞概率和机器人可达性
  5. 若存在满足执行约束的候选,则返回质量最高的抓取
  6. 否则,计算每个可行视角的预期信息增益、抓取收益和运动成本
  7. 选择效用最高的视角,获取新观测并更新 HtH_t
  8. end for 直到返回抓取或达到观测预算
  9. return 最终抓取姿态或失败状态

VISO-Grasp 将视觉语言目标、对象中心空间表示、主动视角规划和六自由度抓取结合起来,用于杂乱与不可见目标 [11]。Cross-View Fusion 则通过跨视角融合增强姿态估计,目前仍是 arXiv 预印本 [12]。


不确定性应当传递到候选(Propagating Uncertainty to Grasps)#

补全和主动观测都会改变后端候选的置信度。需要分别考虑:

  • 传感器噪声(Sensor Noise);
  • 未观测区域的不确定性(Occlusion Uncertainty);
  • 补全模型不确定性(Model Uncertainty);
  • 多视角标定误差(Calibration Error);
  • 执行过程中的姿态误差(Execution Error)。

如果多个隐藏形状都合理,可以保留多个几何假设,并将每个假设分别送入抓取评分和碰撞检测。

设补全模型产生 MM 个表面样本 {S^m}m=1M\{\hat S_m\}_{m=1}^{M},同一候选抓取为 g=(R,t,w)g=(R,\boldsymbol t,w)。分别计算质量与碰撞,再得到期望质量和碰撞概率:

qˉ(g)=1Mm=1Mq(g;S^m),pcoll(g)=1Mm=1M1[collision(g,S^m)].\bar q(g)=\frac{1}{M}\sum_{m=1}^{M}q(g;\hat S_m), \qquad p_{\text{coll}}(g)=\frac{1}{M}\sum_{m=1}^{M} \mathbf 1[\operatorname{collision}(g,\hat S_m)].

选择时可以要求 pcoll(g)<δp_{\text{coll}}(g)<\delta,再按 qˉ(g)\bar q(g) 排序。样本可以来自显式生成模型、网络集成(Deep Ensemble)或测试时随机失活(Monte Carlo Dropout)。这样,隐藏表面改变的不只是网络分数,也会反映在候选的碰撞统计中。

方法如何进入抓取系统(Methods in the Grasping Pipeline)#

方法观测策略几何表示抓取接口主要计算
Beyond Top-Grasps单视角场景补全非顶向抓取候选补全 + 抓取规划
CompletePoints单视角完整点表示6-DoF 检测器模拟完整点 + 检测
CenterGrasp单视角 RGB-D对象中心隐式场6-DoF 抓取估计重建 + 抓取联合学习
GraspNeRF多视角 RGB可泛化 NeRF透明/高反光物体抓取神经渲染 + 几何查询
Any-View 6DoF多视角神经表面表示6-DoF 抓取跨视角融合 + 解码
ASGraspRGB-D 主动立体透明物体重建6-DoF 抓取主动立体 + 重建
VISO-Grasp腕部 RGB-D + 语言对象中心空间表示目标条件抓取视角规划 + 抓取检测
PCF-Grasp单视角点云补全几何特征6-DoF 抓取补全特征 + 检测器

从系统角度看,方法的差别可以归结为两个接口:它是改变几何输入,还是改变观测过程;它是直接生成抓取,还是为抓取检测器提供特征和候选。评价时应同时记录观测数量、重建/检测耗时、有效候选覆盖率、碰撞过滤后的候选数和最终执行成功率。


参考文献(References)#

  1. J. Lundell, F. Verdoja, and V. Kyrki, “Beyond Top-Grasps through Scene Completion,” 2020 IEEE International Conference on Robotics and Automation, 2020. DOI
  2. Z. Liu, Z. Chen, and W.-S. Zheng, “Simulating Complete Points Representations for Single-View 6-DoF Grasp Detection,” IEEE Robotics and Automation Letters, 2024. DOI
  3. E. Chisari, N. Heppert, T. Welschehold, W. Burgard, and A. Valada, “CenterGrasp: Object-Aware Implicit Representation Learning for Simultaneous Shape Reconstruction and 6-DoF Grasp Estimation,” IEEE Robotics and Automation Letters, 2024. DOI
  4. Q. Dai et al., “GraspNeRF: Multiview-Based 6-DoF Grasp Detection for Transparent and Specular Objects Using Generalizable NeRF,” 2023 IEEE International Conference on Robotics and Automation, 2023. DOI
  5. S. Jauhri, I. Lunawat, and G. Chalvatzaki, “Learning Any-View 6DoF Robotic Grasping in Cluttered Scenes via Neural Surface Rendering,” Robotics: Science and Systems XX, 2024. DOI
  6. Y. Cheng et al., “PCF-Grasp: Converting Point Completion to Geometry Feature to Enhance 6-DoF Grasp,” IEEE Transactions on Systems, Man, and Cybernetics: Systems, 2025. DOI
  7. K. Ma, H. Dong, and Y. Mu, “Local Occupancy-Enhanced Object Grasping with Multiple Triplanar Projection,” Computer Vision – ECCV 2024, 2024. DOI
  8. G. Soti, X. Huang, C. Wurll, and B. Hein, “6-DoF Grasp Pose Evaluation and Optimization via Transfer Learning from NeRFs,” 2024 IEEE International Conference on Robotics and Automation, 2024. DOI
  9. L. Zhou et al., “You Only Scan Once: A Dynamic Scene Reconstruction Pipeline for 6-DoF Robotic Grasping of Novel Objects,” 2024 IEEE International Conference on Robotics and Automation, 2024. DOI
  10. J. Shi et al., “ASGrasp: Generalizable Transparent Object Reconstruction and 6-DoF Grasp Detection from RGB-D Active Stereo Camera,” 2024 IEEE International Conference on Robotics and Automation, 2024. DOI
  11. Y. Shi et al., “VISO-Grasp: Vision-Language Informed Spatial Object-Centric 6-DoF Active View Planning and Grasping in Clutter and Invisibility,” 2025 IEEE/RSJ International Conference on Intelligent Robots and Systems, 2025. DOI
  12. K. Zhu, H. Jiang, J. Qian, and J. Xie, “A Cross-View Fusion Framework for Robust 6-DoF Grasp Pose Estimation,” arXiv preprint arXiv:2606.06878, 2026. arXiv
Robotic Grasp Detection (7): 不完整几何与主动感知
https://agusexp25.top/blog/robotic-grasp-detection-7
Author 菊花花
Published at August 14, 2026