Hana's Blog
Robotic Grasp Detection (11): 夹爪感知与跨具身抓取检测Blur image

抓取姿态只对特定硬件有效(A Grasp Is Embodiment-Relative)#

大多数抓取数据集固定一个平行夹爪(Parallel-Jaw Gripper),因此模型学到的候选隐含了该夹爪的开口、指尖厚度、手掌长度和碰撞体。把同一三维特殊欧氏群(Special Euclidean Group, SE(3)SE(3))位姿发送给另一副夹爪,可能出现:

  • 开口不足,无法容纳物体;
  • 指尖更厚,接近时发生碰撞;
  • 手掌更长,扫到桌面或邻物体;
  • 指垫摩擦不同,原接触不再稳定;
  • 手腕安装和机械臂不同,姿态不可达。

设场景观测为 P={pi}i=1NP=\{\vec p_i\}_{i=1}^{N}piR3\vec p_i\in\mathbb R^3;抓取为 g=(R,t,w)g=(R,\vec t,w),其中 RSO(3)R\in SO(3)tR3\vec t\in\mathbb R^3wR0w\in\mathbb R_{\geq0}。抓取可以写成具身条件分布(Embodiment-Conditioned Distribution):

p(gP,h,r),p(g\mid P,h,r),

其中 hh 描述夹爪几何与物理属性,rr 描述机器人、安装方式和工作空间,PP 是场景点云。

具身条件进入网络的位置(Where Embodiment Enters the Network)#

条件接口输入网络处理输出变化
标量条件(Scalar Conditioning)开口、指长、指厚、夹紧力特征调制或条件归一化候选宽度、姿态和质量
几何条件(Geometric Conditioning)夹爪点云、体素或 SDF三维编码器提取形状特征接近通道与碰撞感知候选
扫掠条件(Swept-Volume Conditioning)接近到闭合的夹爪占据与场景几何融合终态和路径同时过滤
机器人条件(Robot Conditioning)基座、关节限制和工作空间可达性评分或规划后处理可执行姿态集合

夹爪描述包含什么(What Describes a Gripper?)#

用于抓取检测的夹爪描述包含:

  • 最小/最大开口(Jaw-Width Range);
  • 指尖长度、厚度和形状(Finger Geometry);
  • 指垫材料与摩擦(Pad Friction);
  • 手掌与腕部碰撞网格(Palm and Wrist Collision Mesh);
  • 闭合方向和速度(Closing Direction and Speed);
  • 夹紧力范围(Force Limit);
  • 从预抓取到闭合的扫掠体积(Swept Volume)。

最大开口只描述夹爪的一项尺度。指尖厚度、掌深和扫掠体积共同决定狭窄空间中的可行性,因此跨具身(Cross-Embodiment)实验需要明确实际输入的属性。

对参数化模型,可以把夹爪描述拆成连续向量与几何场:

hscalar=[wmin,wmax,lf,tf,dp,Fmax,vclose]TR7,h_{\text{scalar}}= [w_{\min},w_{\max},l_f,t_f,d_p,F_{\max},v_{\text{close}}]^{\mathsf T} \in\mathbb R^7,

其中 wmin,wmax,lf,tf,dp,Fmax,vcloseRw_{\min},w_{\max},l_f,t_f,d_p,F_{\max},v_{\text{close}}\in\mathbb R 分别表示开口范围、夹指长度、厚度、掌深、最大夹紧力和闭合速度。复杂形状则用点云、体素占据或符号距离场(Signed Distance Field, SDF)编码。标量向量用于调制网络特征,几何场用于碰撞查询。

若训练时把夹爪归一化到同一规范尺度,网络输出后要执行反变换:位置偏移、宽度、指长和碰撞盒一起恢复到目标夹爪尺度。


平行夹爪的旋转对称性(Rotational Symmetry)#

平行夹爪绕接近轴旋转 180180^\circ 后,两个夹指交换位置,物理抓取通常等价。这使同一动作在标签中出现两个旋转表示。

Planar-Symmetric SO(3) Representation 显式处理三维特殊正交群(Special Orthogonal Group, SO(3)SO(3))中的平面对称,使旋转损失不再惩罚等价姿态 [1]。若 RRRSRS 等价,其中 SS180180^\circ 对称旋转,则损失可以写成:

dsym(R,R^)=min{d(R,R^),d(RS,R^)}.d_{\text{sym}}(R,\hat R) =\min\{d(R,\hat R),d(RS,\hat R)\}.

OrbitGrasp 使用 SE(3)SE(3) 等变学习(SE(3)-Equivariant Learning)表示不同旋转下的一致抓取结构 [2]。对称性属于输出空间的几何性质,等变网络则把刚体变换关系写入特征计算。

等变性要求输入场景经过刚体变换 ASE(3)A\in SE(3) 后,预测候选同步变换:

F(AP)=AF(P).F(AP)=A\,F(P).

不变分类器满足 q(AP,Ag)=q(P,g)q(AP,Ag)=q(P,g)。数据增强可以提供额外姿态样本;对于平行夹爪,输出位于商空间 SO(3)/SSO(3)/\mathcal S,其中 S\mathcal S 是夹爪对称群,损失、NMS 和评价使用同一等价关系。


参数化夹爪检测(Parameterized Gripper Detection)#

REGNet V2 面向不同尺寸夹爪,将夹爪尺度作为区域式点云检测的一部分 [3]。这种方法比固定夹爪多一个条件轴:同一场景点可能对窄夹爪可抓,对宽厚夹爪发生碰撞。

一种常见条件化方式是用夹爪嵌入 eh=ϕ(h)e_h=\phi(h) 调制场景特征 fif_i

fi=γ(eh)fi+β(eh),f_i'=\gamma(e_h)\odot f_i+\beta(e_h),

再从 fif_i' 预测区域、姿态和质量。这种特征线性调制(Feature-Wise Linear Modulation, FiLM)让同一场景在不同夹爪条件下产生不同热图。训练批次将同一对象与多个夹爪配对,使网络学习夹爪几何与场景几何的交互。

XGrasp 进一步研究夹爪感知检测与多夹爪数据生成 [4]。参数化模型把夹爪标识(Identifier, ID)替换为连续几何描述后,可以测试训练夹爪之间的插值(Interpolation)和未见夹爪的外推(Extrapolation)。


数据规模与夹爪多样性(Data Scale and Gripper Diversity)#

GraspFactory 报告超过 109M 个对象中心平行夹爪抓取,其中覆盖 Robotiq 2F-85 和 Franka Panda 两种几何 [5]。大规模多夹爪仿真扩大对象与姿态覆盖,数据中仍需要分别记录:

  • 物体模型和仿真产生的抓取标签;
  • 场景杂乱、传感器噪声和机器人轨迹设置;
  • 训练夹爪与测试夹爪的几何范围。

MultiGraspNet 的共享三维特征也包含平行夹爪分支 [6];本文范围只统计该分支的候选、碰撞和执行结果。


扩散模型中的具身条件(Embodiment Conditioning in Diffusion)#

GraspGen-X 使用夹爪扫掠体积表示和程序化夹爪数据(Procedurally Generated Gripper Data),让扩散生成器根据目标夹爪产生姿态 [7]。扫掠体积比单一宽度更接近执行过程:它描述夹爪从接近到闭合会占据的空间。

设闭合参数 s[0,1]s\in[0,1],夹爪占据几何为 H(s)R3H(s)\subset\mathbb R^3,从预抓取到最终位姿的刚体变换为 T(s)SE(3)T(s)\in SE(3),扫掠体积是:

Vsweep=0s1T(s)H(s).V_{\text{sweep}}=\bigcup_{0\le s\le 1}T(s)H(s).

实现中把 ss 离散成 LL 个闭合状态,将每步夹爪网格体素化后取并集,或查询夹爪 SDF 与场景点的最小距离。LL 和体素分辨率共同决定扫掠体积的近似精度。将该体积编码成条件输入后,生成器同时感知目标夹爪的接近通道和终态几何。

GraspGen-X 当前为 arXiv 预印本;真实执行时还要记录碰撞网格、指垫压缩、闭合控制和安装标定。

Algorithm 1 夹爪条件的抓取候选生成与过滤
输入:
场景点云 PP、目标平行夹爪描述 hh、机器人描述 rr 和候选预算 KK
输出:
经过夹爪几何和机器人可达性过滤的抓取集合 G^h\widehat{\mathcal G}_h
  1. require 编码场景点云、夹爪标量/几何描述和机器人工作空间
  2. 生成或采样 KK 个夹爪条件抓取候选
  3. for 对每个候选 gGhg\in\mathcal G_h
  4. 将候选解码到目标夹爪尺度,并检查开口范围
  5. 计算夹爪终态与从预抓取到闭合的扫掠体积碰撞
  6. 求多组 IK 解,检查关节限制、自碰撞、环境碰撞和轨迹
  7. end for 完成候选过滤
  8. 按抓取质量、可操作性和运动代价排序,并执行对称感知 NMS
  9. return 可执行抓取集合 G^h\widehat{\mathcal G}_h

从夹爪可行到机器人可达(From Gripper Feasibility to Robot Reachability)#

给定抓取 gg,机器人还要找到关节配置 qRnqq\in\mathbb R^{n_q} 和无碰撞轨迹 τ\tau

FK(q)=g,qQlimit,τCobs=.\operatorname{FK}(q)=g, \qquad q\in\mathcal{Q}_{\text{limit}}, \qquad \tau\cap\mathcal{C}_{\text{obs}}=\varnothing.

其中 FK\operatorname{FK} 是正运动学(Forward Kinematics),QlimitRnq\mathcal{Q}_{\text{limit}}\subset\mathbb R^{n_q} 是关节限制集合,Cobs\mathcal{C}_{\text{obs}} 是障碍碰撞空间。

逆运动学并非只有“有解/无解”。同一末端位姿可能对应多个关节解 qjq_j,选择时还要考虑关节限位余量、奇异性与路径长度。局部可操作性(Manipulability)可由雅可比矩阵(Jacobian Matrix)J(q)J(q) 衡量:

m(q)=det(J(q)J(q)T).m(q)=\sqrt{\det(J(q)J(q)^{\mathsf T})}.

m(q)m(q) 接近零表示邻近奇异位形。候选过滤为每个 gg 求多组 IK 解,删除自碰撞和环境碰撞解,再按关节余量、m(q)m(q) 与轨迹代价排序。

MVB-Grasp 使用最小体积包围盒(Minimum-Volume Box)与正面工作空间约束过滤扩散候选 [8]。它展示了通用生成器可能产生几何稳定但不适合特定机器人接近方向的姿态;当前为预印本。


移动操作与大物体(Mobile Manipulation and Large Objects)#

大物体可能超出固定机械臂的局部工作空间。SuperQ-GRASP 使用超二次曲面(Superquadric)表示大物体,并为移动操作机器人选择接近且可达的部位 [9]。

此时抓取检测与基座位置、相机视角和机械臂可达域共同决定候选。对象坐标系中的抓取需要经过基座变换、IK 和环境轨迹检查后才能进入执行集合。

QuickGrasp 使用轻量对向点云规划减少生成开销 [10]。部署比较同时记录候选数、碰撞检查时间、规划时间和真实执行周期。


抓取与放置的具身耦合(Grasp–Placement Coupling)#

ROG-Grasp 使用根部朝向几何(Root-Oriented Geometry)同时约束抓取和放置方向 [11]。它面向农产品等具有明确根部/朝向结构的对象。

这种方法把后续放置方向加入抓取条件。抓取姿态需要与物体放置状态和机器人运动空间共同优化。


跨具身评价(Cross-Embodiment Evaluation)#

跨具身实验按以下因素组合:

  1. 已见夹爪 + 未见物体;
  2. 未见夹爪 + 已见物体;
  3. 未见夹爪 + 未见物体;
  4. 同夹爪跨机器人;
  5. 同机器人跨相机与工作空间;
  6. 零样本(Zero-Shot)、少样本校准(Few-Shot Calibration)与完整微调(Full Fine-Tuning)。

需要报告的结果包括:

层级指标
几何宽度满足率、夹爪/手掌碰撞率
姿态对称感知旋转误差、候选覆盖率
机器人逆运动学(Inverse Kinematics, IK)成功率、轨迹规划成功率、路径代价
物理抬升、稳定、滑移和硬件碰撞
任务放置朝向、循环时间和最终完成率

训练多个仿真夹爪并在固定真实机器人上测试,测量的是夹爪条件对迁移的贡献;改变夹爪、机器人、相机和工作空间后再测试,测量完整跨具身泛化。

跨具身实验还应冻结信息边界。若测试新夹爪时重新采集大量成功/失败并微调整个网络,这属于完整适配,不是零样本。更清晰的三级协议是:

  1. 零样本(Zero-Shot):只提供新夹爪几何、标定和硬件限制,不提供抓取结果;
  2. 少样本校准(Few-Shot Calibration):冻结生成器,只用少量物理试验校准宽度、碰撞余量或分数;
  3. 完整微调(Full Fine-Tuning):允许更新表示与生成器,并单独报告所用样本数。

每一级同时报告候选覆盖、几何碰撞、IK 可达和物理成功。零样本中候选覆盖正常而碰撞率上升,说明夹爪几何条件需要改进;几何有效而 IK 失败率上升,说明机器人工作空间条件需要改进。


参考文献(References)#

  1. T. Ko, T. Ikeda, H. Sato, and K. Nishiwaki, “A Planar-Symmetric SO(3) Representation for Learning Grasp Detection,” Proceedings of the 8th Conference on Robot Learning, 2024. PMLR
  2. B. Hu et al., “OrbitGrasp: SE(3)-Equivariant Grasp Learning,” Proceedings of the 8th Conference on Robot Learning, 2024. PMLR
  3. B. Zhao et al., “REGNet V2: End-to-End Region-Based Grasp Detection Network for Grippers of Different Sizes in Point Clouds,” arXiv preprint arXiv:2410.09431, 2024. arXiv
  4. Y. Lee et al., “XGrasp: Gripper-Aware Grasp Detection with Multi-Gripper Data Generation,” arXiv preprint arXiv:2510.11036, 2025. arXiv
  5. S. K. Srinivas, Y. Shukla, A. Arnold, and S. Chitta, “GraspFactory: A Large Object-Centric Grasping Dataset,” arXiv preprint arXiv:2509.20550, 2025. arXiv
  6. S. Ortuno-Chanelo et al., “MultiGraspNet: A Multitask 3D Vision Model for Multi-Gripper Robotic Grasping,” arXiv preprint arXiv:2602.06504, 2026. arXiv
  7. B. Han et al., “GraspGen-X: Cross-Embodiment 6-DOF Diffusion-Based Grasping,” arXiv preprint arXiv:2606.00998, 2026. arXiv
  8. B. Poudel, A. Basit, and M. Shafique, “MVB-Grasp: Minimum-Volume-Box Filtering of Diffusion-Based Grasps for Frontal Manipulation,” arXiv preprint arXiv:2605.09672, 2026. arXiv
  9. X. Tu and K. Desingh, “SuperQ-GRASP: Superquadrics-Based Grasp Pose Estimation on Larger Objects for Mobile-Manipulation,” 2025 IEEE International Conference on Robotics and Automation, 2025. DOI
  10. N. S. Ravie, K. Vasan M, A. Thondiyath, and B. Sebastian, “QuickGrasp: Lightweight Antipodal Grasp Planning with Point Clouds,” 2025 IEEE International Conference on Robotics and Automation, 2025. DOI
  11. Z. An et al., “ROG-Grasp: Root-Oriented Geometry for Robotic Grasping and Placement,” arXiv preprint arXiv:2606.00449, 2026. arXiv
Robotic Grasp Detection (11): 夹爪感知与跨具身抓取检测
https://agusexp25.top/blog/robotic-grasp-detection-11
Author 菊花花
Published at August 14, 2026