

Robotic Grasp Detection (8): 基于扩散模型与流模型的生成式抓取检测
从 VAE 到潜空间扩散、SE(3) 代价场、约束引导和 MeanFlow,解释生成式抓取如何表示多解姿态,以及覆盖率、质量和推理成本的关系。
为什么抓取是多解问题(Why Grasping Is Multimodal)#
一个杯子可以抓杯身、杯沿或把手;同一接触位置也可能存在多个接近方向。若训练数据中包含多种正确抓取,使用均方误差(Mean Squared Error, MSE)回归单一姿态,模型会把多个模式压缩到一个平均输出,而该输出可能落在低质量区域。
设观测点云为 ,其中 ;平行夹爪抓取写为:
其中 、 和 分别是夹爪旋转、参考点位置与开口宽度。生成式抓取检测(Generative Grasp Detection)学习条件分布:
其中 可以是目标、任务或夹爪条件。推理时从分布中采样多个 ,再进行质量评价、碰撞检查、对称感知非极大值抑制(Symmetry-Aware Non-Maximum Suppression, NMS)和机器人可达性过滤。
生成器的目标是用有限候选覆盖多个高质量模式。多样性(Diversity)、有效率(Validity)、覆盖率(Coverage)与推理成本因此需要放在同一候选预算下分析。
生成式方法的技术路线(Generative Method Map)#
| 方法路线 | 训练对象 | 推理方式 | 代表方法 | 主要特点 |
|---|---|---|---|---|
| 变分生成(Variational Generation) | 条件潜变量分布 | 一次解码一个潜变量 | 6-DOF GraspNet | 采样速度快 |
| 潜空间扩散(Latent Diffusion) | 抓取潜向量上的去噪过程 | 多步潜变量去噪后解码 | GraspLDM | 用自编码器约束姿态结构 |
| 扩散场(Diffusion Field) | 姿态分布的分数或能量 | 采样或梯度优化 | SE(3)-DiffusionFields | 可与轨迹代价联合优化 |
| 约束引导(Constraint Guidance) | 生成器与约束分类器 | 在去噪过程中修改分数 | Constrained Generative Sampling | 可注入任务和碰撞约束 |
| 流匹配(Flow Matching) | 从先验到抓取分布的速度场 | 积分常微分方程 | GraspMeanFlow | 减少网络评估步数 |
变分抓取生成(Variational Grasp Generation)#
6-DOF GraspNet 使用变分自编码器(Variational Autoencoder, VAE)学习物体点云条件下的六自由度(Six Degrees of Freedom, 6-DoF)抓取 [1]。训练时,编码器接收点云 与真值抓取 ,输出潜变量分布 ,其中 ;解码器根据 和点云特征重建抓取 。推理时不再需要真值 ,而是从先验 采样。
典型证据下界(Evidence Lower Bound, ELBO)包含重建项和 Kullback–Leibler 散度(Kullback–Leibler Divergence, KL Divergence):
第一项训练解码器重建抓取,第二项让后验接近推理时使用的标准高斯先验; 控制两者权重。采样不同 可以产生多个姿态。实际重建损失通常分别计算平移、旋转与开口宽度,并对平行夹爪的 对称姿态取较小旋转误差。
扩散模型的基本机制(Diffusion Model Basics)#
扩散模型(Diffusion Model)先对数据逐步加噪,再学习逆向去噪 [13]。先把一个抓取编码为欧氏向量 ; 取决于旋转表示,例如平移、六维旋转表示和宽度拼接后得到 。前向过程可写成:
其中 是噪声步, 是噪声调度, 是单位矩阵。网络可以预测噪声、分数函数(Score Function)或去噪样本,再从随机噪声迭代生成抓取。
把每步噪声记为 、,就可以一步采样任意噪声级:
噪声预测网络 的基本训练损失是:
其中噪声 ,去噪网络还接收点云特征和条件 。训练时随机抽取 ,一次前向传播学习一个噪声层级;推理时从 开始,按调度器(Scheduler)反复计算 。以去噪扩散概率模型(Denoising Diffusion Probabilistic Model, DDPM)为例,其均值更新为:
再按后验方差加入噪声。若一次批量生成 个候选,去噪网络需要处理 个“候选—时间步”组合;批量并行可以缩短墙钟时间。
抓取姿态位于三维特殊欧氏群(Special Euclidean Group, )。旋转表示可以使用四元数(Quaternion)、旋转矩阵、李代数(Lie Algebra),或直接在流形(Manifold)上定义噪声与更新;表示方式决定归一化、对称性处理和插值路径。
若使用李代数,把局部姿态增量写成 ,其中 分别表示平移与旋转增量,再通过指数映射更新齐次变换 :
这样旋转始终留在 上。平行夹爪具有 等价旋转,训练时可把标签映射到统一代表,或在损失中对等价集合取最小值。平移、旋转和夹爪宽度使用不同单位,进入网络前通常分别标准化。
潜空间扩散(Latent Diffusion)#
GraspLDM 先把六自由度抓取编码到潜空间,再执行扩散生成 [2]。潜空间扩散(Latent Diffusion)减少高维迭代成本,并让解码器学习姿态结构。
训练通常分两步。第一步训练姿态自编码器:
并用平移、对称感知旋转、宽度和有效性损失重建抓取。第二步冻结或联合微调编码器,在 上训练条件扩散。推理时先采样 、去噪得到 ,再用 解码成姿态;解码器末端将旋转投影到 ,将开口截断到夹爪范围,随后调用场景碰撞检查。
这种分解包含两个连续接口:
- 潜空间是否保留所有有效抓取模式;
- 扩散模型是否覆盖潜空间中的高质量区域。
因此可以先独立测量自编码器的重建覆盖率,再测量扩散模型在固定潜空间中的采样覆盖率。
把抓取分布变成可优化代价(Diffusion as an Optimizable Cost Field)#
SE(3)-DiffusionFields 将扩散分数转化为平滑代价函数,并将抓取与运动联合优化 [3]。这使姿态不只由生成器采样,还能与轨迹、碰撞或机器人状态共同调整。
分数网络近似:
其中 输出位于姿态切空间中的局部修正方向。在低噪声层级, 可以作为平滑抓取代价。联合优化时,抓取位姿 与机器人轨迹控制点 交替或同时更新;每一步把旋转增量映射回流形,并用多个初始抓取覆盖不同模式。
可以把最终目标写成:
其中 是扩散场给出的抓取代价, 是轨迹平滑与关节运动代价, 是夹爪和机械臂碰撞代价,。这样,姿态和运动可达性在同一个优化问题中更新。
约束引导与后验修正(Constraint Guidance and Posterior Refinement)#
通用生成器从训练数据学习抓取分布,部署条件还包括接近方向、无碰撞、目标部件和机器人可达性。
Constrained Generative Sampling 在生成过程中加入约束,使候选向满足条件的区域移动 [4]。Refining 6-DoF Grasps with Context-Specific Classifiers 使用场景特定分类器梯度修正已有候选 [5]。统一形式可以写成:
第二项是引导(Guidance),可以表达任务、碰撞或接触偏好。引导权重 控制条件服从程度与样本多样性。
实现中常在每个去噪步修改分数:
可以随噪声降低而增大:早期建立全局模式,后期满足精细约束。碰撞是非光滑二值函数,训练和引导阶段常用符号距离场(Signed Distance Field, SDF)、穿透深度或可微分占据网络构造软代价;最终再用真实夹爪网格执行离散碰撞检查。
质量—多样性采样(Quality–Diversity Sampling)#
只最大化质量容易反复得到同一抓取;只最大化多样性会保留大量低质量候选。质量—多样性(Quality–Diversity, QD)方法同时维护不同特征区域中的高质量解。
Speeding up 6-DoF Grasp Sampling with Quality-Diversity 将姿态覆盖和质量共同纳入搜索 [6],QDGset 则将这套思想扩展为大规模抓取数据生成 [7]。
QD 的关键是行为描述符(Behavior Descriptor)如何定义,例如接近方向、接触区域、夹爪宽度或物体部件。描述符不同,“多样性”的物理含义也不同。
任务与具身条件扩散(Task- and Embodiment-Conditioned Diffusion)#
HGDiffuser 使用人体接触和手腕线索引导任务导向抓取 [8]。这里的条件不再只是物体几何,而是“为了某个用途,哪里应该被保留或接触”。
GraspGen-X 将夹爪扫掠体积和几何作为条件,研究跨平行夹爪生成 [10]。同一物体和姿态在不同夹爪条件下会得到不同分数,因为最大开口、指尖厚度和闭合扫掠体积共同决定可行性。
更少步数的流模型(Few-Step Flow Models)#
扩散生成通常需要多次网络评估。流匹配(Flow Matching)学习一个连续速度场,将简单先验分布沿常微分方程(Ordinary Differential Equation, ODE)运输到数据分布:
设 是 上的时间参数化抓取, 输出对应切空间速度:
GraspMeanFlow 使用 等变 MeanFlow 实现少步六自由度生成 [11]。少步推理降低机器人在线循环中的网络调用次数,固定候选预算下的覆盖率可以衡量加速后的模式保留情况。
在欧氏空间的直线路径中,可从噪声 与数据 构造:
并训练 拟合目标速度 。推理通过数值积分 ODE 获得样本;一步或少步方法进一步学习跨时间区间的平均速度。对 ,直线插值替换成平移插值与旋转测地线,速度位于切空间。
生成式抓取应如何评价(Evaluating Generative Grasps)#
生成式方法的评测以固定候选预算和推理时间为基础,主要指标如下:
| 指标 | 含义 |
|---|---|
| 有效率(Validity) | 样本满足接触与基本几何约束的比例 |
| 覆盖率(Coverage) | 标注或可执行模式中有多少被候选覆盖 |
| 多样性(Diversity) | 候选在接近方向、接触和部件上的差异 |
| 碰撞率(Collision Rate) | 候选与物体外部、桌面或场景碰撞比例 |
| 条件一致性(Condition Consistency) | 是否符合目标、任务或夹爪条件 |
| 校准(Calibration) | 模型分数是否对应真实成功概率 |
| 推理成本(Inference Cost) | 固定候选数所需时间与网络调用次数 |
| 物理成功(Physical Success) | 经规划后真实执行的结果 |
近期 GraspGen、Equivariant Volumetric Grasping 和 GraspMeanFlow 分别探索生成器内训练、等变体素分布和少步流 [9,11,12]。这些方向分别改变训练数据进入生成器的方式、三维表示和采样步数。
- require 编码点云和条件,得到共享场景特征
- 采样 个初始噪声或潜变量,并记录随机种子
- for 从生成步 迭代到
- 预测去噪方向或流速度,并施加任务、碰撞或夹爪条件
- 更新平移、旋转和开口表示
- end for 完成生成
- 解码抓取,将旋转投影到 ,并限制开口宽度
- 执行夹爪终态与接近扫掠碰撞检查,删除不可达候选
- 使用统一评分器重排,并执行对称感知 NMS
- return 保留前 个候选组成
比较生成器时,固定候选数 、网络评估次数、碰撞器、重排器和最终 top-。同时报告过滤前后的有效率与覆盖率,可以分辨改进来自生成分布还是后处理。
参考文献(References)#
- A. Mousavian, C. Eppner, and D. Fox, “6-DOF GraspNet: Variational Grasp Generation for Object Manipulation,” 2019 IEEE/CVF International Conference on Computer Vision, 2019. DOI ↗
- K. R. Barad et al., “GraspLDM: Generative 6-DoF Grasp Synthesis Using Latent Diffusion Models,” IEEE Access, 2024. DOI ↗
- J. Urain, N. Funk, J. Peters, and G. Chalvatzaki, “SE(3)-DiffusionFields: Learning Smooth Cost Functions for Joint Grasp and Motion Optimization through Diffusion,” 2023 IEEE International Conference on Robotics and Automation, 2023. DOI ↗
- J. Lundell et al., “Constrained Generative Sampling of 6-DoF Grasps,” 2023 IEEE/RSJ International Conference on Intelligent Robots and Systems, 2023. DOI ↗
- T. Taunyazov et al., “Refining 6-DoF Grasps with Context-Specific Classifiers,” 2023 IEEE/RSJ International Conference on Intelligent Robots and Systems, 2023. DOI ↗
- J. Huber et al., “Speeding up 6-DoF Grasp Sampling with Quality-Diversity,” 2024 IEEE/RSJ International Conference on Intelligent Robots and Systems, 2024. DOI ↗
- J. Huber et al., “QDGset: A Large Scale Grasping Dataset Generated with Quality-Diversity,” 2025 IEEE International Conference on Robotics and Automation, 2025. DOI ↗
- D. Huang, W. Dong, C. Tang, and H. Zhang, “HGDiffuser: Efficient Task-Oriented Grasp Generation via Human-Guided Grasp Diffusion Models,” 2025 IEEE/RSJ International Conference on Intelligent Robots and Systems, 2025. DOI ↗
- A. Murali et al., “GraspGen: A Diffusion-Based Framework for 6-DOF Grasping with On-Generator Training,” arXiv preprint arXiv:2507.13097, 2025. arXiv ↗
- B. Han et al., “GraspGen-X: Cross-Embodiment 6-DOF Diffusion-Based Grasping,” arXiv preprint arXiv:2606.00998, 2026. arXiv ↗
- J. Kwon et al., “GraspMeanFlow: SE(3)-Equivariant MeanFlow for Few-Step 6-DoF Grasp Generation,” arXiv preprint arXiv:2608.03295, 2026. arXiv ↗
- P. Song, Y. Hu, P. Li, and R. Detry, “Equivariant Volumetric Grasping,” arXiv preprint arXiv:2507.18847, 2025. arXiv ↗
- J. Ho, A. Jain, and P. Abbeel, “Denoising Diffusion Probabilistic Models,” Advances in Neural Information Processing Systems 33, 2020. arXiv ↗