Hana's Blog
Robotic Grasp Detection (9): 目标、任务、部件与语言条件抓取Blur image

“能抓”与“应该抓”是两个问题(Graspability vs. Compatibility)#

对象无关抓取(Object-Agnostic Grasping)寻找场景中任意稳定抓取;条件抓取(Conditional Grasping)还要回答抓哪个物体、抓哪个部件,以及该抓取是否适合后续任务。

设平行夹爪候选为 g=(R,t,w)g=(R,\vec t,w),其中 RSO(3)R\in SO(3)tR3\vec t\in\mathbb R^3wR0w\in\mathbb R_{\geq0};场景观测为 oo,条件为 cc。一个便于实现的候选分数可以分解为:

Q(go,c)=Qphysical(go)+λQsemantic(go,c),Q(g\mid o,c) =Q_{\text{physical}}(g\mid o) +\lambda Q_{\text{semantic}}(g\mid o,c),

其中 cc 可以是目标身份、部件、自然语言或任务;QphysicalQ_{\text{physical}} 评价接触、碰撞与可达性,QsemanticQ_{\text{semantic}} 评价目标和任务兼容性,λ0\lambda\geq0 控制语义偏好在排序中的权重。

安全条件和排序偏好需要不同的接口。若“不要触碰刀刃”是安全条件,它直接进入可行集合;“更偏向把手中部”则作为候选排序项:

  • 硬约束(Hard Constraint):目标身份、禁止接触区、夹爪宽度和碰撞,直接形成可行集合 Fc\mathcal F_c
  • 软偏好(Soft Preference):更喜欢把手中部、减少腕部旋转或保留放置余量,用于集合内部排序。

选择问题写成:

g=argmaxgGFc[Qphysical(g)+λQpreference(g,c)].g^*=\arg\max_{g\in\mathcal G\cap\mathcal F_c} \left[Q_{\text{physical}}(g)+\lambda Q_{\text{preference}}(g,c)\right].

如果语义模型输出场景点 xiR3\vec x_i\in\mathbb R^3 属于目标或部件的概率 pi[0,1]p_i\in[0,1],可计算候选闭合区 C(g)\mathcal C(g) 的语义一致性:

Qtarget(g)=1C(g)xiC(g)pi.Q_{\text{target}}(g)= \frac{1}{|\mathcal C(g)|} \sum_{x_i\in\mathcal C(g)}p_i.

接触点概率与闭合区平均概率共同使用,可以区分“夹爪中心位于目标附近”和“两侧接触确实落在目标上”。

条件抓取的方法路线(Conditional Grasping Map)#

条件层级模型输出进入抓取检测器的方式代表方法
目标条件(Target-Conditioned)实例掩码或目标查询裁剪目标点云、调制点特征REGRAD、TARGO-Net
部件条件(Part-Conditioned)部件掩码或可供性场限制接触区域Fine-Grained Grasp Detection
任务条件(Task-Conditioned)任务兼容分数或姿态偏好与物理质量联合排序Task-Oriented Grasp Detection、GraspGPT
语言条件(Language-Conditioned)文本—几何相似度目标检索、交叉注意力或查询选择Language-Driven Grasp Detection、OVGNet
物理属性条件(Physical-Property-Conditioned)材料、质量、脆弱性和力限制禁区、安全余量与夹紧力约束PhyGrasp

条件层级(Conditioning Levels)#

目标条件(Target-Conditioned)#

目标条件抓取要求从杂乱场景中抓取指定对象,而不是任意清空。REGRAD 将对象关系、目标身份与安全抓取共同标注 [1]。目标分割、对象识别和姿态生成由此成为相互依赖的阶段。

部件条件(Part-Conditioned)#

任务经常要求抓把手、边缘、瓶身或工具末端。部件可供性(Part Affordance)表示某个部件支持何种动作。细粒度部件抓取方法将语言或部件标签映射到三维区域,再在区域内生成六自由度(Six Degrees of Freedom, 6-DoF)姿态 [5]。

任务条件(Task-Conditioned)#

同一物体的稳定抓取不一定适合所有任务。倒水要保留杯口与手腕旋转空间,递交工具要暴露功能端,放置任务可能约束物体最终朝向。Task-Oriented Grasp Detection 将视觉可供性与隐式质量结合,使“好抓取”随任务改变 [4]。

物理属性条件(Physical-Property-Conditioned)#

材料、质量、摩擦和脆弱性会改变接触位置与夹持力。PhyGrasp 使用三维几何、语言与物理属性描述选择部件级抓取 [12]。模型把这些属性转换为禁止接触区域、力限制或稳定性偏好,再参与候选过滤与排序。


自然语言如何进入抓取系统(How Language Enters a Grasping System)#

自然语言指令(Natural-Language Command)可以在不同阶段发挥作用:

  1. 目标检索(Target Retrieval):找到“红色杯子”;
  2. 部件定位(Part Grounding):找到“杯子的把手”;
  3. 可供性推理(Affordance Reasoning):判断“倒水时不要堵住杯口”;
  4. 约束生成(Constraint Generation):产生目标区域、禁区或姿态偏好;
  5. 场景策略(Scene Strategy):决定先移开哪个遮挡物。

早期联合语言抓取网络直接将命令与图像特征融合,预测语言条件的平面抓取 [2]。Language-Driven Grasp Detection 使用大规模语言与视觉先验进行开放词汇平面抓取 [3]。若系统最终执行 6-DoF 抓取,二维目标区域还需要通过深度反投影为三维点,并在三维场景中检查接近路径。

语言特征如何与几何对齐#

给定文本编码 ecRdee_c\in\mathbb R^{d_e} 与像素或点特征 fiRdff_i\in\mathbb R^{d_f},线性投影 WeRd×deW_e\in\mathbb R^{d\times d_e}WfRd×dfW_f\in\mathbb R^{d\times d_f} 将二者映射到相同的 dd 维空间。目标注意力可以由归一化相似度产生:

αi=exp(Wffi,Weec/τ)jexp(Wffj,Weec/τ).\alpha_i=\frac{ \exp(\langle W_f f_i,W_e e_c\rangle/\tau) }{ \sum_j\exp(\langle W_f f_j,W_e e_c\rangle/\tau) }.

αi[0,1]\alpha_i\in[0,1] 是第 ii 个位置与指令的匹配权重,温度 τ>0\tau>0 控制分布尖锐程度。Transformer 方法让语言词元(Token)与图像或点云 Token 做交叉注意力(Cross-Attention),输出目标掩码、部件掩码或抓取查询。

若输入是像素掩码,对像素 (u,v)(u,v) 和深度 zz 使用相机内参 (fx,fy,cx,cy)(f_x,f_y,c_x,c_y) 反投影:

x(u,v)=[(ucx)z/fx(vcy)z/fyz]R3.\vec x(u,v)= \begin{bmatrix} (u-c_x)z/f_x\\ (v-c_y)z/f_y\\ z \end{bmatrix} \in\mathbb R^3.

每个三维点同时保留掩码概率 pip_i,供后续硬裁剪或软特征调制使用。

语义掩码有两种进入检测器的方式。硬裁剪只把 pi>ηp_i>\eta 的点送入抓取网络,减少背景计算;软调制使用 fi=pifif_i'=p_i f_i,或把 pip_i 作为额外通道,使边界不确定性保留到抓取头。给定真值掩码与使用预测掩码的两组结果,分别测量姿态检测上限和完整语义接口的性能。


交互式目标消歧(Interactive Grounding)#

指令可能含糊,例如“拿那个杯子”对应多个实例。INVIGORATE 将视觉指代消解(Visual Grounding)、遮挡关系、提问与抓取动作组织为部分可观测决策过程(Partially Observable Markov Decision Process, POMDP)[6]。

系统维护目标状态的信念分布(Belief State)bt(s)b_t(s)。得到回答或新视觉观测 ot+1o_{t+1} 后,按贝叶斯更新:

bt+1(s)p(ot+1s,at)sp(ss,at)bt(s).b_{t+1}(s)\propto p(o_{t+1}\mid s,a_t) \sum_{s'}p(s\mid s',a_t)b_t(s').

“提问”与“抓取”都是动作:提问消耗时间但降低目标歧义,错误抓取具有更高代价。策略比较提问后的期望信息价值与直接执行效用,并记录目标后验、提问次数和错误对象抓取率。

系统可以在目标后验分散或错误抓取代价较高时先提问,在目标明确时直接生成抓取。目标识别、阻挡判断、提问次数和物理执行构成四个可分别统计的阶段。


从语言知识到任务抓取(From Language Knowledge to Task Grasps)#

GraspGPT 利用大语言模型(Large Language Model, LLM)的语义知识,为未见对象和任务产生抓取先验 [7]。FoundationGrasp 进一步结合基础模型(Foundation Model)的语义与几何先验,研究可泛化任务抓取 [10]。

这类系统通常包含两个层次:

  • 高层语义模型推断目标、部件和用途;
  • 低层几何模型生成接触稳定、无碰撞的平行夹爪姿态。

高层模型输出掩码(Mask)、目标点、部件概率、正负区域或候选偏好;几何生成器再据此产生平行夹爪姿态,运动规划器负责碰撞和可达性验证。这个接口把语言推理结果转换成可查询的三维约束。


对象中心多任务抓取(Object-Centric Multi-Task Grasping)#

多任务掩码 Transformer(Multi-Task Masked Transformer, M2T2)从杂乱点云中预测对象中心接触掩码、抓取与放置姿态,并可接受目标或语言条件 [8]。它把抓取与放置视为相关低层技能,而不是只输出单次抓取。

对象查询(Object Query)先与场景点特征交互,产生每个查询对应的对象/接触掩码;抓取头只在该查询聚合的点特征上解码姿态,放置头则预测物体在目标区域中的姿态。查询索引因此保持对象身份的一致性:目标条件从同一个查询读取掩码和抓取结果。训练时对预测查询与真值对象做二分图匹配(Bipartite Matching),再计算掩码、接触和姿态损失。

对象中心表示(Object-Centric Representation)有利于保持目标身份,但依赖点云分辨率、实例结构和对象边界。小目标或严重遮挡会同时影响语义选择与姿态预测。


开放词汇与三维语义场(Open-Vocabulary and 3D Semantic Fields)#

开放词汇抓取(Open-Vocabulary Grasping)要求识别训练标签之外的对象或部件。OVGNet 统一视觉语言特征与抓取预测 [9];GaussianGrasper 将语言语义写入三维高斯泼溅表示(3D Gaussian Splatting, 3DGS)[11]。

一个三维高斯由中心 μiR3\vec\mu_i\in\mathbb R^3、协方差 ΣiR3×3\Sigma_i\in\mathbb R^{3\times3}、不透明度 αi[0,1]\alpha_i\in[0,1]、颜色与语义特征 fiRdf_i\in\mathbb R^d 描述。多视角图像优化后,语言查询与 fif_i 的相似度形成三维目标概率场。抓取检测器可从高斯场提取深度或占据,也可以把语义概率投影到传感器点云,然后在该几何上生成接触与检查碰撞。

开放词汇能力通常来自大规模视觉语言预训练,三维抓取头则用深度、尺度、夹爪宽度和碰撞模型把“哪里是把手”转换成“哪些姿态可以夹住把手”。

Open-Vocabulary Part-Based Grasping 将对象—部件提示、分割与六自由度抓取串联起来 [13]。模块化结构可以分别评价开放词汇定位、部件分割和姿态生成。


场景策略与遮挡处理(Strategic Clearing under Occlusion)#

当目标不可见或不可达时,系统先规划清理动作。ThinkGrasp 使用视觉语言模型(Vision-Language Model, VLM)判断应抓取目标的哪个部件,或先移走哪个遮挡物,再调用低层六自由度生成器 [14]。

TARGO 则把目标遮挡程度变成可控基准变量,评价目标驱动抓取随可见性变化的性能 [15]。两者分别关注策略和测量:前者决定动作顺序,后者建立遮挡条件下的统一测试。

场景策略使“抓取检测”扩展为多步决策。此时最终成功率同时受到语义推理、遮挡估计、每一步姿态检测和执行误差影响,需要保留阶段指标。


语义到物理的接口(Semantic-to-Physical Interface)#

语言结果可以转换为以下物理约束:

语义要求低层物理表示
“抓杯子的把手”目标部件掩码与允许接触区域
“不要碰易碎表面”禁止接触区域与安全余量
“为了倒水”手腕朝向、杯口净空和后续轨迹
“拿最重的物体”目标身份、质心与夹紧力要求
“目标被挡住了”遮挡关系与清理动作序列

评测沿接口分解为:

  1. 目标/部件定位是否正确;
  2. 在正确定位条件下,可行姿态生成率是多少;
  3. 候选是否满足碰撞、宽度与可达性;
  4. 真实抓取是否稳定;
  5. 最终任务是否完成。

在候选级实现这些约束时,设预测接触点 c1,c2R3\vec c_1,\vec c_2\in\mathbb R^3,夹爪扫掠体积为 V(g)R3V(g)\subset\mathbb R^3,允许接触区域和禁止接触区域分别为 Rallowed,RforbiddenR3\mathcal R_{\text{allowed}},\mathcal R_{\text{forbidden}}\subset\mathbb R^3

c1,c2Rallowed,dist(c1,Rforbidden)>m,V(g)Oscene=,\begin{aligned} \vec c_1,\vec c_2 &\in \mathcal R_{\text{allowed}},\\ \operatorname{dist}(\vec c_1,\mathcal R_{\text{forbidden}})&>m,\\ V(g)\cap\mathcal O_{\text{scene}}&=\varnothing, \end{aligned}

其中场景占据区域 OsceneR3\mathcal O_{\text{scene}}\subset\mathbb R^3,安全余量 mR>0m\in\mathbb R_{>0}。概率掩码可以进一步计算候选与禁止区域的期望重叠。任务约束还可延伸到放置:把抓取后物体变换 GTOSE(3){}^{G}T_O\in SE(3) 与目标放置 WTOgoalSE(3){}^{W}T_O^{\text{goal}}\in SE(3) 组合,检查该抓取是否允许末端到达目标朝向。

Algorithm 1 语言条件的 6-DoF 抓取检测
输入:
RGB-D / 点云观测、自然语言指令、平行夹爪模型和机器人状态
输出:
满足目标、部件和任务条件的抓取姿态 gg^*
  1. require 编码文本与视觉/点云特征,并计算跨模态对应关系
  2. 预测目标实例、部件区域及其概率,反投影到统一三维坐标系
  3. 将语言条件解析为允许接触区、禁止接触区、姿态偏好和任务约束
  4. 在目标三维区域内生成平行夹爪候选集合 G\mathcal G
  5. for 对每个候选 gGg\in\mathcal G
  6. 计算物理质量、接触语义一致性和任务兼容分数
  7. 检查夹爪宽度、扫掠碰撞、机器人可达性和后续任务姿态
  8. end for 完成候选评价
  9. 按硬约束过滤,再按软偏好排序和去重
  10. return 最高分可行抓取 gg^*,或清理/询问动作

参考文献(References)#

  1. H. Zhang et al., “REGRAD: A Large-Scale Relational Grasp Dataset for Safe and Object-Specific Robotic Grasping in Clutter,” IEEE Robotics and Automation Letters, 2022. DOI
  2. Y. Chen, R. Xu, Y. Lin, and P. A. Vela, “A Joint Network for Grasp Detection Conditioned on Natural Language Commands,” 2021 IEEE International Conference on Robotics and Automation, 2021. DOI
  3. A. D. Vuong et al., “Language-Driven Grasp Detection,” 2024 IEEE/CVF Conference on Computer Vision and Pattern Recognition, 2024. DOI
  4. W. Chen et al., “Learning 6-DoF Task-Oriented Grasp Detection via Implicit Estimation and Visual Affordance,” 2022 IEEE/RSJ International Conference on Intelligent Robots and Systems, 2022. DOI
  5. Y. Song et al., “Learning 6-DoF Fine-Grained Grasp Detection Based on Part Affordance Grounding,” IEEE Transactions on Automation Science and Engineering, 2025. DOI
  6. H. Zhang et al., “INVIGORATE: Interactive Visual Grounding and Grasping in Clutter,” Robotics: Science and Systems XVII, 2021. DOI
  7. C. Tang et al., “GraspGPT: Leveraging Semantic Knowledge from a Large Language Model for Task-Oriented Grasping,” IEEE Robotics and Automation Letters, 2023. DOI
  8. W. Yuan, A. Murali, A. Mousavian, and D. Fox, “M2T2: Multi-Task Masked Transformer for Object-Centric Pick and Place,” Proceedings of the 7th Conference on Robot Learning, 2023. PMLR
  9. M. Li et al., “OVGNet: A Unified Visual-Linguistic Framework for Open-Vocabulary Robotic Grasping,” 2024 IEEE/RSJ International Conference on Intelligent Robots and Systems, 2024. DOI
  10. C. Tang et al., “FoundationGrasp: Generalizable Task-Oriented Grasping with Foundation Models,” IEEE Transactions on Automation Science and Engineering, 2025. DOI
  11. Y. Zheng et al., “GaussianGrasper: 3D Language Gaussian Splatting for Open-Vocabulary Robotic Grasping,” IEEE Robotics and Automation Letters, 2024. DOI
  12. D. Guo et al., “PhyGrasp: Generalizing Robotic Grasping with Physics-Informed Large Multimodal Models,” 2025 IEEE/RSJ International Conference on Intelligent Robots and Systems, 2025. DOI
  13. T. van Oort et al., “Open-Vocabulary Part-Based Grasping,” arXiv preprint arXiv:2406.05951, 2024. arXiv
  14. Y. Qian et al., “ThinkGrasp: A Vision-Language System for Strategic Part Grasping in Clutter,” Proceedings of the 8th Conference on Robot Learning, 2024. PMLR
  15. Y. Xia et al., “TARGO and TARGO-Net: Benchmarking Target-Driven Object Grasping under Occlusions,” International Journal of Computer Vision, 2026. DOI
Robotic Grasp Detection (9): 目标、任务、部件与语言条件抓取
https://agusexp25.top/blog/robotic-grasp-detection-9
Author 菊花花
Published at August 14, 2026