

Robotic Grasp Detection (7): 不完整几何与主动感知
分析单视角点云缺失、形状补全、隐式重建、多视角融合、透明物体深度失效与主动视角选择,并区分推断几何和获取新观测。
抓取需要接触不可见区域(Grasping Requires Hidden Contact Geometry)#
单视角红绿蓝—深度观测(Red–Green–Blue and Depth, RGB-D)只测到朝向相机的表面。平行夹爪(Parallel-Jaw Gripper)的两个夹指需要在物体两侧形成接触,其中一侧可能被自遮挡(Self-Occlusion)或其他物体遮挡(Inter-Object Occlusion)。因此,抓取检测器面对的输入不是完整物体,而是带有系统性缺失的几何观测。
设真实表面为 ,观测点云为 ,则单视角观测可以写成:
缺失几何不是普通随机噪声。它与视角、材质、遮挡关系和传感器原理相关:
- 背面因为视线不可达而缺失;
- 透明或反光表面因为深度测量失效而缺失;
- 薄结构和远距离小物体因分辨率不足而稀疏;
- 杂乱场景中的接触区域可能完全不可见。
处理这类输入有两条路线:在固定观测下推断隐藏几何,或者移动传感器获取新的观测。前者对应形状补全和隐式重建,后者对应多视角融合和主动感知。
方法路线总览(Overview of Method Families)#
下表先给出各类方法的输入、输出和典型抓取接口。后文再解释每种表示如何训练,以及它怎样进入抓取候选生成和排序。
| 方法路线 | 主要输入 | 主要输出 | 典型代表 | 抓取接口 |
|---|---|---|---|---|
| 点云补全(Point Completion) | 单视角点云 | 补全点集或完整点表示 | Beyond Top-Grasps、CompletePoints、PCF-Grasp | 在补全几何上生成或评分 6-DoF 抓取 |
| 隐式联合重建(Implicit Reconstruction) | RGB-D / 物体裁剪 | Occupancy、SDF 或抓取场 | CenterGrasp、Local Occupancy-Enhanced Grasping | 查询局部几何并解码抓取 |
| 神经渲染(Neural Rendering) | 多视角 RGB / RGB-D | 辐射场、表面和三维特征 | GraspNeRF、Any-View | 从三维表示生成或优化抓取 |
| 主动视角规划(Active View Planning) | 当前观测与候选视角 | 下一相机位姿和更新观测 | VISO-Grasp、Cross-View Fusion | 以抓取收益选择下一视角 |
| 不确定性传播(Uncertainty Propagation) | 多个几何假设或模型预测 | 抓取质量分布和碰撞概率 | 采样式补全、网络集成 | 对候选执行风险感知排序 |
场景与点云补全(Scene and Point-Cloud Completion)#
形状补全(Shape Completion)学习条件分布:
实际系统通常先输出一个确定性补全结果 ,再把它送入抓取检测器。Beyond Top-Grasps Through Scene Completion 使用场景补全支持非顶抓姿态 [1];CompletePoints 通过模拟完整点表示改善单视角六自由度(Six Degrees of Freedom, 6-DoF)检测 [2]。
补全表示决定了训练目标和后端如何查询几何,常见形式有点集、占据场和符号距离场。
**点集补全(Point-Set Completion)**直接预测点集 。给定完整点集 ,常用双向倒角距离(Chamfer Distance, CD)为:
第一项让预测点靠近真实表面,第二项让预测点覆盖真实点集。训练时,网络编码 ,解码器逐步生成缺失点或完整点集;推理时,补全点与观测点合并,再进入法线估计、候选生成和碰撞检测。CD 只比较点到点的距离,因此工程实现通常还会关注法线、薄结构和夹爪闭合区域的局部几何。
**占据场(Occupancy Field)**对查询点 和观测编码 输出占据概率 。训练样本由空间查询点和内外标签组成,二元交叉熵(Binary Cross-Entropy, BCE)可以写成:
其中 是查询点数量,, 表示该点位于物体内部还是外部。推理时,在三维网格上查询 ,再用阈值提取表面;在接触区域直接查询占据值,则可以判断夹爪指尖或闭合通道是否进入物体内部。训练查询点不能全部均匀采样,因为大多数点会远离表面,通常还要加入表面附近的扰动点。**截断符号距离场(Truncated Signed Distance Field, TSDF)**则为每个查询点提供到表面的有符号距离,适合碰撞检查和梯度优化。
点集补全的后端处理通常可以分成四步:
- 将观测点与补全点变换到同一坐标系;
- 从表面法线、局部邻域或隐式场查询中生成抓取候选;
- 在夹爪闭合区域和接近通道中执行碰撞检查;
- 用抓取质量、碰撞结果和机器人可达性对候选排序。
PCF-Grasp 将点云补全结果转换为几何特征,作为 6-DoF 抓取检测器的辅助输入,而不是直接把补全点作为唯一几何来源 [6]。这类接口让网络同时利用观测几何和补全先验。
联合重建与抓取(Joint Reconstruction and Grasping)#
CenterGrasp 使用对象中心隐式表示(Object-Centric Implicit Representation)同时进行形状重建和六自由度抓取估计 [3]。它先从 RGB-D 观测中提取对象级特征,再在对象坐标系中查询几何和抓取相关信息。
可以用下面的抽象形式理解这类网络:
其中 是对象坐标系中的查询位置, 是观测编码, 是占据预测, 是距离或表面相关量, 是用于抓取预测的局部特征。抓取姿态仍可统一写为 ,其中 、, 分别表示夹爪旋转、位置和开口宽度。
连续隐式表示的推理过程是:估计对象坐标系,在三维查询点上计算占据和特征,再从高响应区域解码 ,最后进行碰撞与可达性检查。它不需要把完整物体固定成相同数量的点,但查询分辨率和对象坐标估计会直接影响候选质量。
Local Occupancy-Enhanced Grasping 使用多平面投影(Multiple Triplanar Projection)编码局部占据几何 [7]。三张相互正交的二维特征平面分别存储局部空间信息,查询点投影到各平面后取样并融合特征,再预测抓取。相比直接在稀疏点上回归,它为接触区域提供了连续局部表示;全局场景关系仍由前端分割、坐标变换和后端碰撞检查处理。
神经渲染与多视角几何(Neural Rendering and Multi-View Geometry)#
神经辐射场(Neural Radiance Field, NeRF)和相关神经表面表示可以融合多张 RGB 图像,从不同视角恢复几何与外观。GraspNeRF 使用可泛化 NeRF 处理透明和高反光物体的多视角六自由度抓取 [4]。
NeRF 沿相机射线查询场函数。设射线原点 ,单位方向 ,则 ;在采样位置 处,网络输出密度 和颜色 。离散体渲染(Volume Rendering)为:
其中 是相邻采样点的距离, 是光线到达第 个采样点时仍未被吸收的透射率, 是该区间的不透明度。期望深度可写成 。抓取系统通常从密度场提取网格或点云,也可以直接读取三维特征来评价候选。实际解码时还要进行尺度标定、表面阈值选择和夹爪碰撞检查。
Any-View 6DoF Grasping 通过神经表面渲染,使模型能够从不同观察视角推断抓取 [5]。NeRF Grasp Pose Optimization 则利用 NeRF 特征评价和优化已有候选 [8]。
多视角抓取的实现通常包含以下环节:
- 通过相机外参标定(Extrinsic Calibration)将各视角变换到统一坐标系;
- 编码每张图像并聚合跨视角特征;
- 由聚合特征预测密度、表面或三维抓取特征;
- 提取候选抓取 ,执行碰撞过滤和机器人可达性检查。
You Only Scan Once 面向动态场景构建一次扫描与重建流水线,再生成六自由度抓取 [9];这类方法还需要在扫描期间维护相机、物体和机器人之间的时空关系。
透明与高反光物体(Transparent and Specular Objects)#
普通结构光或双目深度相机可能在玻璃、透明塑料和高反光金属上产生孔洞或错误深度。此时物体在 RGB 中可见,但深度图中缺少稳定的接触表面。
主动立体(Active Stereo)相机投射红外纹理并通过左右图匹配估计视差。设焦距为 、双目基线为 、视差为 ,相机坐标系中的深度近似为:
透明表面会折射投影纹理,使匹配位置不再对应同一物理表面;高反光表面则可能造成饱和或错误匹配。因此,透明物体方法通常结合 RGB 轮廓、多视角一致性、主动照明或神经渲染来恢复几何。
这类实验需要同时记录:
- 光照与背景;
- 相机类型和主动投射设置;
- 视角数量;
- 重建误差与抓取成功分别如何测量;
- 方法在普通不透明物体上的表现。
透明性改变的是观测模型(Observation Model):同一个抓取检测器在输入端接收到的深度证据不同。GraspNeRF 通过多视角神经渲染恢复透明/高反光几何 [4];ASGrasp 使用 RGB-D 主动立体相机(Active Stereo Camera)进行可泛化透明物体重建和抓取 [10]。
主动视角选择(Active View Selection)#
形状补全在固定观测下推断隐藏几何;主动感知(Active Perception)通过相机或机器人动作获得新证据。设历史观测为 ,候选相机位姿为 ,新观测为 ,主动策略可以选择最大化预期抓取收益的视角:
其中 是观测更新后的抓取效用, 是移动时间、路径长度和碰撞风险组成的成本。
下一最佳视角(Next-Best View, NBV)的目标是减少抓取相关的不确定性,例如暴露目标把手、被遮挡接触面或夹爪接近通道。实际系统通常从有限位姿集合 中选择视角,并在评分前删除机器人不可达或相机将与场景碰撞的位姿。
设 表示待估计的三维占据状态, 表示其熵。对每个 ,可以用当前占据模型预测新观测带来的信息增益(Information Gain, IG):
抓取相关策略可以只统计候选接触区和接近通道内的熵,或者直接估计观测后最高可行抓取分数的提升。一个具体的视角效用为:
其中 是预计采集时间, 是机器人运动成本, 是权重。
- require
初始化历史观测 和待评估视角集合
- for 在当前观测历史下循环
- 估计可见几何、补全几何及其不确定性
- 生成抓取候选,并计算抓取质量、碰撞概率和机器人可达性
- 若存在满足执行约束的候选,则返回质量最高的抓取
- 否则,计算每个可行视角的预期信息增益、抓取收益和运动成本
- 选择效用最高的视角,获取新观测并更新
- end for 直到返回抓取或达到观测预算
- return 最终抓取姿态或失败状态
VISO-Grasp 将视觉语言目标、对象中心空间表示、主动视角规划和六自由度抓取结合起来,用于杂乱与不可见目标 [11]。Cross-View Fusion 则通过跨视角融合增强姿态估计,目前仍是 arXiv 预印本 [12]。
不确定性应当传递到候选(Propagating Uncertainty to Grasps)#
补全和主动观测都会改变后端候选的置信度。需要分别考虑:
- 传感器噪声(Sensor Noise);
- 未观测区域的不确定性(Occlusion Uncertainty);
- 补全模型不确定性(Model Uncertainty);
- 多视角标定误差(Calibration Error);
- 执行过程中的姿态误差(Execution Error)。
如果多个隐藏形状都合理,可以保留多个几何假设,并将每个假设分别送入抓取评分和碰撞检测。
设补全模型产生 个表面样本 ,同一候选抓取为 。分别计算质量与碰撞,再得到期望质量和碰撞概率:
选择时可以要求 ,再按 排序。样本可以来自显式生成模型、网络集成(Deep Ensemble)或测试时随机失活(Monte Carlo Dropout)。这样,隐藏表面改变的不只是网络分数,也会反映在候选的碰撞统计中。
方法如何进入抓取系统(Methods in the Grasping Pipeline)#
| 方法 | 观测策略 | 几何表示 | 抓取接口 | 主要计算 |
|---|---|---|---|---|
| Beyond Top-Grasps | 单视角 | 场景补全 | 非顶向抓取候选 | 补全 + 抓取规划 |
| CompletePoints | 单视角 | 完整点表示 | 6-DoF 检测器 | 模拟完整点 + 检测 |
| CenterGrasp | 单视角 RGB-D | 对象中心隐式场 | 6-DoF 抓取估计 | 重建 + 抓取联合学习 |
| GraspNeRF | 多视角 RGB | 可泛化 NeRF | 透明/高反光物体抓取 | 神经渲染 + 几何查询 |
| Any-View 6DoF | 多视角 | 神经表面表示 | 6-DoF 抓取 | 跨视角融合 + 解码 |
| ASGrasp | RGB-D 主动立体 | 透明物体重建 | 6-DoF 抓取 | 主动立体 + 重建 |
| VISO-Grasp | 腕部 RGB-D + 语言 | 对象中心空间表示 | 目标条件抓取 | 视角规划 + 抓取检测 |
| PCF-Grasp | 单视角点云 | 补全几何特征 | 6-DoF 抓取 | 补全特征 + 检测器 |
从系统角度看,方法的差别可以归结为两个接口:它是改变几何输入,还是改变观测过程;它是直接生成抓取,还是为抓取检测器提供特征和候选。评价时应同时记录观测数量、重建/检测耗时、有效候选覆盖率、碰撞过滤后的候选数和最终执行成功率。
参考文献(References)#
- J. Lundell, F. Verdoja, and V. Kyrki, “Beyond Top-Grasps through Scene Completion,” 2020 IEEE International Conference on Robotics and Automation, 2020. DOI ↗
- Z. Liu, Z. Chen, and W.-S. Zheng, “Simulating Complete Points Representations for Single-View 6-DoF Grasp Detection,” IEEE Robotics and Automation Letters, 2024. DOI ↗
- E. Chisari, N. Heppert, T. Welschehold, W. Burgard, and A. Valada, “CenterGrasp: Object-Aware Implicit Representation Learning for Simultaneous Shape Reconstruction and 6-DoF Grasp Estimation,” IEEE Robotics and Automation Letters, 2024. DOI ↗
- Q. Dai et al., “GraspNeRF: Multiview-Based 6-DoF Grasp Detection for Transparent and Specular Objects Using Generalizable NeRF,” 2023 IEEE International Conference on Robotics and Automation, 2023. DOI ↗
- S. Jauhri, I. Lunawat, and G. Chalvatzaki, “Learning Any-View 6DoF Robotic Grasping in Cluttered Scenes via Neural Surface Rendering,” Robotics: Science and Systems XX, 2024. DOI ↗
- Y. Cheng et al., “PCF-Grasp: Converting Point Completion to Geometry Feature to Enhance 6-DoF Grasp,” IEEE Transactions on Systems, Man, and Cybernetics: Systems, 2025. DOI ↗
- K. Ma, H. Dong, and Y. Mu, “Local Occupancy-Enhanced Object Grasping with Multiple Triplanar Projection,” Computer Vision – ECCV 2024, 2024. DOI ↗
- G. Soti, X. Huang, C. Wurll, and B. Hein, “6-DoF Grasp Pose Evaluation and Optimization via Transfer Learning from NeRFs,” 2024 IEEE International Conference on Robotics and Automation, 2024. DOI ↗
- L. Zhou et al., “You Only Scan Once: A Dynamic Scene Reconstruction Pipeline for 6-DoF Robotic Grasping of Novel Objects,” 2024 IEEE International Conference on Robotics and Automation, 2024. DOI ↗
- J. Shi et al., “ASGrasp: Generalizable Transparent Object Reconstruction and 6-DoF Grasp Detection from RGB-D Active Stereo Camera,” 2024 IEEE International Conference on Robotics and Automation, 2024. DOI ↗
- Y. Shi et al., “VISO-Grasp: Vision-Language Informed Spatial Object-Centric 6-DoF Active View Planning and Grasping in Clutter and Invisibility,” 2025 IEEE/RSJ International Conference on Intelligent Robots and Systems, 2025. DOI ↗
- K. Zhu, H. Jiang, J. Qian, and J. Xie, “A Cross-View Fusion Framework for Robust 6-DoF Grasp Pose Estimation,” arXiv preprint arXiv:2606.06878, 2026. arXiv ↗