

Robotic Grasp Detection (9): 目标、任务、部件与语言条件抓取
从目标选择、关系推理、部件可供性到材料与任务兼容性,分析语言和视觉语言模型如何约束抓取,以及语义与物理可行性的接口。
“能抓”与“应该抓”是两个问题(Graspability vs. Compatibility)#
对象无关抓取(Object-Agnostic Grasping)寻找场景中任意稳定抓取;条件抓取(Conditional Grasping)还要回答抓哪个物体、抓哪个部件,以及该抓取是否适合后续任务。
设平行夹爪候选为 ,其中 、、;场景观测为 ,条件为 。一个便于实现的候选分数可以分解为:
其中 可以是目标身份、部件、自然语言或任务; 评价接触、碰撞与可达性, 评价目标和任务兼容性, 控制语义偏好在排序中的权重。
安全条件和排序偏好需要不同的接口。若“不要触碰刀刃”是安全条件,它直接进入可行集合;“更偏向把手中部”则作为候选排序项:
- 硬约束(Hard Constraint):目标身份、禁止接触区、夹爪宽度和碰撞,直接形成可行集合 ;
- 软偏好(Soft Preference):更喜欢把手中部、减少腕部旋转或保留放置余量,用于集合内部排序。
选择问题写成:
如果语义模型输出场景点 属于目标或部件的概率 ,可计算候选闭合区 的语义一致性:
接触点概率与闭合区平均概率共同使用,可以区分“夹爪中心位于目标附近”和“两侧接触确实落在目标上”。
条件抓取的方法路线(Conditional Grasping Map)#
| 条件层级 | 模型输出 | 进入抓取检测器的方式 | 代表方法 |
|---|---|---|---|
| 目标条件(Target-Conditioned) | 实例掩码或目标查询 | 裁剪目标点云、调制点特征 | REGRAD、TARGO-Net |
| 部件条件(Part-Conditioned) | 部件掩码或可供性场 | 限制接触区域 | Fine-Grained Grasp Detection |
| 任务条件(Task-Conditioned) | 任务兼容分数或姿态偏好 | 与物理质量联合排序 | Task-Oriented Grasp Detection、GraspGPT |
| 语言条件(Language-Conditioned) | 文本—几何相似度 | 目标检索、交叉注意力或查询选择 | Language-Driven Grasp Detection、OVGNet |
| 物理属性条件(Physical-Property-Conditioned) | 材料、质量、脆弱性和力限制 | 禁区、安全余量与夹紧力约束 | PhyGrasp |
条件层级(Conditioning Levels)#
目标条件(Target-Conditioned)#
目标条件抓取要求从杂乱场景中抓取指定对象,而不是任意清空。REGRAD 将对象关系、目标身份与安全抓取共同标注 [1]。目标分割、对象识别和姿态生成由此成为相互依赖的阶段。
部件条件(Part-Conditioned)#
任务经常要求抓把手、边缘、瓶身或工具末端。部件可供性(Part Affordance)表示某个部件支持何种动作。细粒度部件抓取方法将语言或部件标签映射到三维区域,再在区域内生成六自由度(Six Degrees of Freedom, 6-DoF)姿态 [5]。
任务条件(Task-Conditioned)#
同一物体的稳定抓取不一定适合所有任务。倒水要保留杯口与手腕旋转空间,递交工具要暴露功能端,放置任务可能约束物体最终朝向。Task-Oriented Grasp Detection 将视觉可供性与隐式质量结合,使“好抓取”随任务改变 [4]。
物理属性条件(Physical-Property-Conditioned)#
材料、质量、摩擦和脆弱性会改变接触位置与夹持力。PhyGrasp 使用三维几何、语言与物理属性描述选择部件级抓取 [12]。模型把这些属性转换为禁止接触区域、力限制或稳定性偏好,再参与候选过滤与排序。
自然语言如何进入抓取系统(How Language Enters a Grasping System)#
自然语言指令(Natural-Language Command)可以在不同阶段发挥作用:
- 目标检索(Target Retrieval):找到“红色杯子”;
- 部件定位(Part Grounding):找到“杯子的把手”;
- 可供性推理(Affordance Reasoning):判断“倒水时不要堵住杯口”;
- 约束生成(Constraint Generation):产生目标区域、禁区或姿态偏好;
- 场景策略(Scene Strategy):决定先移开哪个遮挡物。
早期联合语言抓取网络直接将命令与图像特征融合,预测语言条件的平面抓取 [2]。Language-Driven Grasp Detection 使用大规模语言与视觉先验进行开放词汇平面抓取 [3]。若系统最终执行 6-DoF 抓取,二维目标区域还需要通过深度反投影为三维点,并在三维场景中检查接近路径。
语言特征如何与几何对齐#
给定文本编码 与像素或点特征 ,线性投影 、 将二者映射到相同的 维空间。目标注意力可以由归一化相似度产生:
是第 个位置与指令的匹配权重,温度 控制分布尖锐程度。Transformer 方法让语言词元(Token)与图像或点云 Token 做交叉注意力(Cross-Attention),输出目标掩码、部件掩码或抓取查询。
若输入是像素掩码,对像素 和深度 使用相机内参 反投影:
每个三维点同时保留掩码概率 ,供后续硬裁剪或软特征调制使用。
语义掩码有两种进入检测器的方式。硬裁剪只把 的点送入抓取网络,减少背景计算;软调制使用 ,或把 作为额外通道,使边界不确定性保留到抓取头。给定真值掩码与使用预测掩码的两组结果,分别测量姿态检测上限和完整语义接口的性能。
交互式目标消歧(Interactive Grounding)#
指令可能含糊,例如“拿那个杯子”对应多个实例。INVIGORATE 将视觉指代消解(Visual Grounding)、遮挡关系、提问与抓取动作组织为部分可观测决策过程(Partially Observable Markov Decision Process, POMDP)[6]。
系统维护目标状态的信念分布(Belief State)。得到回答或新视觉观测 后,按贝叶斯更新:
“提问”与“抓取”都是动作:提问消耗时间但降低目标歧义,错误抓取具有更高代价。策略比较提问后的期望信息价值与直接执行效用,并记录目标后验、提问次数和错误对象抓取率。
系统可以在目标后验分散或错误抓取代价较高时先提问,在目标明确时直接生成抓取。目标识别、阻挡判断、提问次数和物理执行构成四个可分别统计的阶段。
从语言知识到任务抓取(From Language Knowledge to Task Grasps)#
GraspGPT 利用大语言模型(Large Language Model, LLM)的语义知识,为未见对象和任务产生抓取先验 [7]。FoundationGrasp 进一步结合基础模型(Foundation Model)的语义与几何先验,研究可泛化任务抓取 [10]。
这类系统通常包含两个层次:
- 高层语义模型推断目标、部件和用途;
- 低层几何模型生成接触稳定、无碰撞的平行夹爪姿态。
高层模型输出掩码(Mask)、目标点、部件概率、正负区域或候选偏好;几何生成器再据此产生平行夹爪姿态,运动规划器负责碰撞和可达性验证。这个接口把语言推理结果转换成可查询的三维约束。
对象中心多任务抓取(Object-Centric Multi-Task Grasping)#
多任务掩码 Transformer(Multi-Task Masked Transformer, M2T2)从杂乱点云中预测对象中心接触掩码、抓取与放置姿态,并可接受目标或语言条件 [8]。它把抓取与放置视为相关低层技能,而不是只输出单次抓取。
对象查询(Object Query)先与场景点特征交互,产生每个查询对应的对象/接触掩码;抓取头只在该查询聚合的点特征上解码姿态,放置头则预测物体在目标区域中的姿态。查询索引因此保持对象身份的一致性:目标条件从同一个查询读取掩码和抓取结果。训练时对预测查询与真值对象做二分图匹配(Bipartite Matching),再计算掩码、接触和姿态损失。
对象中心表示(Object-Centric Representation)有利于保持目标身份,但依赖点云分辨率、实例结构和对象边界。小目标或严重遮挡会同时影响语义选择与姿态预测。
开放词汇与三维语义场(Open-Vocabulary and 3D Semantic Fields)#
开放词汇抓取(Open-Vocabulary Grasping)要求识别训练标签之外的对象或部件。OVGNet 统一视觉语言特征与抓取预测 [9];GaussianGrasper 将语言语义写入三维高斯泼溅表示(3D Gaussian Splatting, 3DGS)[11]。
一个三维高斯由中心 、协方差 、不透明度 、颜色与语义特征 描述。多视角图像优化后,语言查询与 的相似度形成三维目标概率场。抓取检测器可从高斯场提取深度或占据,也可以把语义概率投影到传感器点云,然后在该几何上生成接触与检查碰撞。
开放词汇能力通常来自大规模视觉语言预训练,三维抓取头则用深度、尺度、夹爪宽度和碰撞模型把“哪里是把手”转换成“哪些姿态可以夹住把手”。
Open-Vocabulary Part-Based Grasping 将对象—部件提示、分割与六自由度抓取串联起来 [13]。模块化结构可以分别评价开放词汇定位、部件分割和姿态生成。
场景策略与遮挡处理(Strategic Clearing under Occlusion)#
当目标不可见或不可达时,系统先规划清理动作。ThinkGrasp 使用视觉语言模型(Vision-Language Model, VLM)判断应抓取目标的哪个部件,或先移走哪个遮挡物,再调用低层六自由度生成器 [14]。
TARGO 则把目标遮挡程度变成可控基准变量,评价目标驱动抓取随可见性变化的性能 [15]。两者分别关注策略和测量:前者决定动作顺序,后者建立遮挡条件下的统一测试。
场景策略使“抓取检测”扩展为多步决策。此时最终成功率同时受到语义推理、遮挡估计、每一步姿态检测和执行误差影响,需要保留阶段指标。
语义到物理的接口(Semantic-to-Physical Interface)#
语言结果可以转换为以下物理约束:
| 语义要求 | 低层物理表示 |
|---|---|
| “抓杯子的把手” | 目标部件掩码与允许接触区域 |
| “不要碰易碎表面” | 禁止接触区域与安全余量 |
| “为了倒水” | 手腕朝向、杯口净空和后续轨迹 |
| “拿最重的物体” | 目标身份、质心与夹紧力要求 |
| “目标被挡住了” | 遮挡关系与清理动作序列 |
评测沿接口分解为:
- 目标/部件定位是否正确;
- 在正确定位条件下,可行姿态生成率是多少;
- 候选是否满足碰撞、宽度与可达性;
- 真实抓取是否稳定;
- 最终任务是否完成。
在候选级实现这些约束时,设预测接触点 ,夹爪扫掠体积为 ,允许接触区域和禁止接触区域分别为 :
其中场景占据区域 ,安全余量 。概率掩码可以进一步计算候选与禁止区域的期望重叠。任务约束还可延伸到放置:把抓取后物体变换 与目标放置 组合,检查该抓取是否允许末端到达目标朝向。
- require 编码文本与视觉/点云特征,并计算跨模态对应关系
- 预测目标实例、部件区域及其概率,反投影到统一三维坐标系
- 将语言条件解析为允许接触区、禁止接触区、姿态偏好和任务约束
- 在目标三维区域内生成平行夹爪候选集合
- for 对每个候选
- 计算物理质量、接触语义一致性和任务兼容分数
- 检查夹爪宽度、扫掠碰撞、机器人可达性和后续任务姿态
- end for 完成候选评价
- 按硬约束过滤,再按软偏好排序和去重
- return 最高分可行抓取 ,或清理/询问动作
参考文献(References)#
- H. Zhang et al., “REGRAD: A Large-Scale Relational Grasp Dataset for Safe and Object-Specific Robotic Grasping in Clutter,” IEEE Robotics and Automation Letters, 2022. DOI ↗
- Y. Chen, R. Xu, Y. Lin, and P. A. Vela, “A Joint Network for Grasp Detection Conditioned on Natural Language Commands,” 2021 IEEE International Conference on Robotics and Automation, 2021. DOI ↗
- A. D. Vuong et al., “Language-Driven Grasp Detection,” 2024 IEEE/CVF Conference on Computer Vision and Pattern Recognition, 2024. DOI ↗
- W. Chen et al., “Learning 6-DoF Task-Oriented Grasp Detection via Implicit Estimation and Visual Affordance,” 2022 IEEE/RSJ International Conference on Intelligent Robots and Systems, 2022. DOI ↗
- Y. Song et al., “Learning 6-DoF Fine-Grained Grasp Detection Based on Part Affordance Grounding,” IEEE Transactions on Automation Science and Engineering, 2025. DOI ↗
- H. Zhang et al., “INVIGORATE: Interactive Visual Grounding and Grasping in Clutter,” Robotics: Science and Systems XVII, 2021. DOI ↗
- C. Tang et al., “GraspGPT: Leveraging Semantic Knowledge from a Large Language Model for Task-Oriented Grasping,” IEEE Robotics and Automation Letters, 2023. DOI ↗
- W. Yuan, A. Murali, A. Mousavian, and D. Fox, “M2T2: Multi-Task Masked Transformer for Object-Centric Pick and Place,” Proceedings of the 7th Conference on Robot Learning, 2023. PMLR ↗
- M. Li et al., “OVGNet: A Unified Visual-Linguistic Framework for Open-Vocabulary Robotic Grasping,” 2024 IEEE/RSJ International Conference on Intelligent Robots and Systems, 2024. DOI ↗
- C. Tang et al., “FoundationGrasp: Generalizable Task-Oriented Grasping with Foundation Models,” IEEE Transactions on Automation Science and Engineering, 2025. DOI ↗
- Y. Zheng et al., “GaussianGrasper: 3D Language Gaussian Splatting for Open-Vocabulary Robotic Grasping,” IEEE Robotics and Automation Letters, 2024. DOI ↗
- D. Guo et al., “PhyGrasp: Generalizing Robotic Grasping with Physics-Informed Large Multimodal Models,” 2025 IEEE/RSJ International Conference on Intelligent Robots and Systems, 2025. DOI ↗
- T. van Oort et al., “Open-Vocabulary Part-Based Grasping,” arXiv preprint arXiv:2406.05951, 2024. arXiv ↗
- Y. Qian et al., “ThinkGrasp: A Vision-Language System for Strategic Part Grasping in Clutter,” Proceedings of the 8th Conference on Robot Learning, 2024. PMLR ↗
- Y. Xia et al., “TARGO and TARGO-Net: Benchmarking Target-Driven Object Grasping under Occlusions,” International Journal of Computer Vision, 2026. DOI ↗