Hana's Blog
Robotic Grasp Detection (8): 基于扩散模型与流模型的生成式抓取检测Blur image

为什么抓取是多解问题(Why Grasping Is Multimodal)#

一个杯子可以抓杯身、杯沿或把手;同一接触位置也可能存在多个接近方向。若训练数据中包含多种正确抓取,使用均方误差(Mean Squared Error, MSE)回归单一姿态,模型会把多个模式压缩到一个平均输出,而该输出可能落在低质量区域。

设观测点云为 P={pi}i=1NP=\{\vec p_i\}_{i=1}^{N},其中 piR3\vec p_i\in\mathbb R^3;平行夹爪抓取写为:

g=(R,t,w),RSO(3),tR3,wR0,g=(R,\vec t,w), \qquad R\in SO(3),\quad \vec t\in\mathbb R^3,\quad w\in\mathbb R_{\geq0},

其中 RRt\vec tww 分别是夹爪旋转、参考点位置与开口宽度。生成式抓取检测(Generative Grasp Detection)学习条件分布:

p(gP,c),p(g\mid P,c),

其中 cc 可以是目标、任务或夹爪条件。推理时从分布中采样多个 gg,再进行质量评价、碰撞检查、对称感知非极大值抑制(Symmetry-Aware Non-Maximum Suppression, NMS)和机器人可达性过滤。

生成器的目标是用有限候选覆盖多个高质量模式。多样性(Diversity)、有效率(Validity)、覆盖率(Coverage)与推理成本因此需要放在同一候选预算下分析。

生成式方法的技术路线(Generative Method Map)#

方法路线训练对象推理方式代表方法主要特点
变分生成(Variational Generation)条件潜变量分布一次解码一个潜变量6-DOF GraspNet采样速度快
潜空间扩散(Latent Diffusion)抓取潜向量上的去噪过程多步潜变量去噪后解码GraspLDM用自编码器约束姿态结构
SE(3)SE(3) 扩散场(Diffusion Field)姿态分布的分数或能量采样或梯度优化SE(3)-DiffusionFields可与轨迹代价联合优化
约束引导(Constraint Guidance)生成器与约束分类器在去噪过程中修改分数Constrained Generative Sampling可注入任务和碰撞约束
流匹配(Flow Matching)从先验到抓取分布的速度场积分常微分方程GraspMeanFlow减少网络评估步数

变分抓取生成(Variational Grasp Generation)#

6-DOF GraspNet 使用变分自编码器(Variational Autoencoder, VAE)学习物体点云条件下的六自由度(Six Degrees of Freedom, 6-DoF)抓取 [1]。训练时,编码器接收点云 PP 与真值抓取 gg,输出潜变量分布 qϕ(zg,P)q_\phi(z\mid g,P),其中 zRdz\in\mathbb R^d;解码器根据 zz 和点云特征重建抓取 g^\hat g。推理时不再需要真值 gg,而是从先验 p(z)=N(0,Id)p(z)=\mathcal N(0,I_d) 采样。

典型证据下界(Evidence Lower Bound, ELBO)包含重建项和 Kullback–Leibler 散度(Kullback–Leibler Divergence, KL Divergence):

LVAE=Eqϕ(zg,P)[logpθ(gz,P)]+βDKL(qϕ(zg,P)p(z)).\mathcal{L}_{\text{VAE}} =\mathbb{E}_{q_\phi(z\mid g,P)}[-\log p_\theta(g\mid z,P)] +\beta D_{\mathrm{KL}}(q_\phi(z\mid g,P)\|p(z)).

第一项训练解码器重建抓取,第二项让后验接近推理时使用的标准高斯先验;β0\beta\geq0 控制两者权重。采样不同 zz 可以产生多个姿态。实际重建损失通常分别计算平移、旋转与开口宽度,并对平行夹爪的 180180^\circ 对称姿态取较小旋转误差。


扩散模型的基本机制(Diffusion Model Basics)#

扩散模型(Diffusion Model)先对数据逐步加噪,再学习逆向去噪 [13]。先把一个抓取编码为欧氏向量 x0RDx_0\in\mathbb R^DDD 取决于旋转表示,例如平移、六维旋转表示和宽度拼接后得到 D=10D=10。前向过程可写成:

q(xtxt1)=N(1βtxt1,βtID).q(x_t\mid x_{t-1}) =\mathcal{N}(\sqrt{1-\beta_t}x_{t-1},\beta_t I_D).

其中 t{1,,T}t\in\{1,\ldots,T\} 是噪声步,βt(0,1)\beta_t\in(0,1) 是噪声调度,IDRD×DI_D\in\mathbb R^{D\times D} 是单位矩阵。网络可以预测噪声、分数函数(Score Function)或去噪样本,再从随机噪声迭代生成抓取。

把每步噪声记为 αt=1βt\alpha_t=1-\beta_tαˉt=s=1tαs\bar\alpha_t=\prod_{s=1}^{t}\alpha_s,就可以一步采样任意噪声级:

xt=αˉtx0+1αˉtϵ,ϵN(0,ID).x_t=\sqrt{\bar\alpha_t}x_0 +\sqrt{1-\bar\alpha_t}\,\epsilon, \qquad \epsilon\sim\mathcal N(0,I_D).

噪声预测网络 ϵθ(xt,t,P,c)\epsilon_\theta(x_t,t,P,c) 的基本训练损失是:

Ldiff=Ex0,t,ϵ[ϵϵθ(xt,t,P,c)22].\mathcal L_{\text{diff}} =\mathbb E_{x_0,t,\epsilon} \left[ \lVert\epsilon-\epsilon_\theta(x_t,t,P,c)\rVert_2^2 \right].

其中噪声 ϵRD\epsilon\in\mathbb R^D,去噪网络还接收点云特征和条件 cc。训练时随机抽取 tt,一次前向传播学习一个噪声层级;推理时从 xTN(0,ID)x_T\sim\mathcal N(0,I_D) 开始,按调度器(Scheduler)反复计算 xt1x_{t-1}。以去噪扩散概率模型(Denoising Diffusion Probabilistic Model, DDPM)为例,其均值更新为:

μθ(xt,t)=1αt(xtβt1αˉtϵθ(xt,t,P,c)),\mu_\theta(x_t,t)=\frac{1}{\sqrt{\alpha_t}} \left( x_t-\frac{\beta_t}{\sqrt{1-\bar\alpha_t}} \epsilon_\theta(x_t,t,P,c) \right),

再按后验方差加入噪声。若一次批量生成 KK 个候选,去噪网络需要处理 K×TK\times T 个“候选—时间步”组合;批量并行可以缩短墙钟时间。

抓取姿态位于三维特殊欧氏群(Special Euclidean Group, SE(3)SE(3))。旋转表示可以使用四元数(Quaternion)、旋转矩阵、李代数(Lie Algebra),或直接在流形(Manifold)上定义噪声与更新;表示方式决定归一化、对称性处理和插值路径。

若使用李代数,把局部姿态增量写成 ξ=(v,ω)R6se(3)\xi=(\vec v,\vec\omega)\in\mathbb R^6\simeq\mathfrak{se}(3),其中 v,ωR3\vec v,\vec\omega\in\mathbb R^3 分别表示平移与旋转增量,再通过指数映射更新齐次变换 TtSE(3)T_t\in SE(3)

Tt1=Ttexp(Δξt^).T_{t-1}=T_t\exp(\widehat{\Delta\xi_t}).

这样旋转始终留在 SO(3)SO(3) 上。平行夹爪具有 180180^\circ 等价旋转,训练时可把标签映射到统一代表,或在损失中对等价集合取最小值。平移、旋转和夹爪宽度使用不同单位,进入网络前通常分别标准化。


潜空间扩散(Latent Diffusion)#

GraspLDM 先把六自由度抓取编码到潜空间,再执行扩散生成 [2]。潜空间扩散(Latent Diffusion)减少高维迭代成本,并让解码器学习姿态结构。

训练通常分两步。第一步训练姿态自编码器:

z=Eϕ(g,P),g^=Dψ(z,P),z=E_\phi(g,P),\qquad \hat g=D_\psi(z,P),

并用平移、对称感知旋转、宽度和有效性损失重建抓取。第二步冻结或联合微调编码器,在 zz 上训练条件扩散。推理时先采样 zTz_T、去噪得到 z0z_0,再用 DψD_\psi 解码成姿态;解码器末端将旋转投影到 SO(3)SO(3),将开口截断到夹爪范围,随后调用场景碰撞检查。

这种分解包含两个连续接口:

  • 潜空间是否保留所有有效抓取模式;
  • 扩散模型是否覆盖潜空间中的高质量区域。

因此可以先独立测量自编码器的重建覆盖率,再测量扩散模型在固定潜空间中的采样覆盖率。


把抓取分布变成可优化代价(Diffusion as an Optimizable Cost Field)#

SE(3)-DiffusionFields 将扩散分数转化为平滑代价函数,并将抓取与运动联合优化 [3]。这使姿态不只由生成器采样,还能与轨迹、碰撞或机器人状态共同调整。

分数网络近似:

sθ(g,t,P)glogpt(gP).s_\theta(g,t,P)\approx\nabla_g\log p_t(g\mid P).

其中 sθs_\theta 输出位于姿态切空间中的局部修正方向。在低噪声层级,logpt(gP)-\log p_t(g\mid P) 可以作为平滑抓取代价。联合优化时,抓取位姿 gg 与机器人轨迹控制点 τ\tau 交替或同时更新;每一步把旋转增量映射回流形,并用多个初始抓取覆盖不同模式。

可以把最终目标写成:

J(g,τ)=Jgrasp(g)+λmotionJmotion(τ)+λcollisionJcollision(g,τ),J(g,\tau) =J_{\text{grasp}}(g) +\lambda_{\text{motion}}J_{\text{motion}}(\tau) +\lambda_{\text{collision}}J_{\text{collision}}(g,\tau),

其中 JgraspJ_{\text{grasp}} 是扩散场给出的抓取代价,JmotionJ_{\text{motion}} 是轨迹平滑与关节运动代价,JcollisionJ_{\text{collision}} 是夹爪和机械臂碰撞代价,λmotion,λcollision0\lambda_{\text{motion}},\lambda_{\text{collision}}\geq0。这样,姿态和运动可达性在同一个优化问题中更新。


约束引导与后验修正(Constraint Guidance and Posterior Refinement)#

通用生成器从训练数据学习抓取分布,部署条件还包括接近方向、无碰撞、目标部件和机器人可达性。

Constrained Generative Sampling 在生成过程中加入约束,使候选向满足条件的区域移动 [4]。Refining 6-DoF Grasps with Context-Specific Classifiers 使用场景特定分类器梯度修正已有候选 [5]。统一形式可以写成:

glogp(gP,c)=glogp(gP)+λglogp(cg,P).\nabla_g \log p(g\mid P,c) =\nabla_g \log p(g\mid P) +\lambda\nabla_g \log p(c\mid g,P).

第二项是引导(Guidance),可以表达任务、碰撞或接触偏好。引导权重 λ\lambda 控制条件服从程度与样本多样性。

实现中常在每个去噪步修改分数:

s~(gt)=sθ(gt,t,P)+λtgtlogpφ(cgt,P).\tilde s(g_t)=s_\theta(g_t,t,P) +\lambda_t\nabla_{g_t}\log p_\varphi(c\mid g_t,P).

λt\lambda_t 可以随噪声降低而增大:早期建立全局模式,后期满足精细约束。碰撞是非光滑二值函数,训练和引导阶段常用符号距离场(Signed Distance Field, SDF)、穿透深度或可微分占据网络构造软代价;最终再用真实夹爪网格执行离散碰撞检查。


质量—多样性采样(Quality–Diversity Sampling)#

只最大化质量容易反复得到同一抓取;只最大化多样性会保留大量低质量候选。质量—多样性(Quality–Diversity, QD)方法同时维护不同特征区域中的高质量解。

Speeding up 6-DoF Grasp Sampling with Quality-Diversity 将姿态覆盖和质量共同纳入搜索 [6],QDGset 则将这套思想扩展为大规模抓取数据生成 [7]。

QD 的关键是行为描述符(Behavior Descriptor)如何定义,例如接近方向、接触区域、夹爪宽度或物体部件。描述符不同,“多样性”的物理含义也不同。


任务与具身条件扩散(Task- and Embodiment-Conditioned Diffusion)#

HGDiffuser 使用人体接触和手腕线索引导任务导向抓取 [8]。这里的条件不再只是物体几何,而是“为了某个用途,哪里应该被保留或接触”。

GraspGen-X 将夹爪扫掠体积和几何作为条件,研究跨平行夹爪生成 [10]。同一物体和姿态在不同夹爪条件下会得到不同分数,因为最大开口、指尖厚度和闭合扫掠体积共同决定可行性。


更少步数的流模型(Few-Step Flow Models)#

扩散生成通常需要多次网络评估。流匹配(Flow Matching)学习一个连续速度场,将简单先验分布沿常微分方程(Ordinary Differential Equation, ODE)运输到数据分布:

gtg_tSE(3)SE(3) 上的时间参数化抓取,vθv_\theta 输出对应切空间速度:

dgtdt=vθ(gt,t,P,c).\frac{dg_t}{dt}=v_\theta(g_t,t,P,c).

GraspMeanFlow 使用 SE(3)SE(3) 等变 MeanFlow 实现少步六自由度生成 [11]。少步推理降低机器人在线循环中的网络调用次数,固定候选预算下的覆盖率可以衡量加速后的模式保留情况。

在欧氏空间的直线路径中,可从噪声 x0RDx_0\in\mathbb R^D 与数据 x1RDx_1\in\mathbb R^D 构造:

xt=(1t)x0+tx1,ut=x1x0,x_t=(1-t)x_0+tx_1, \qquad u_t=x_1-x_0,

并训练 vθ(xt,t,P,c)v_\theta(x_t,t,P,c) 拟合目标速度 utRDu_t\in\mathbb R^D。推理通过数值积分 ODE 获得样本;一步或少步方法进一步学习跨时间区间的平均速度。对 SE(3)SE(3),直线插值替换成平移插值与旋转测地线,速度位于切空间。


生成式抓取应如何评价(Evaluating Generative Grasps)#

生成式方法的评测以固定候选预算和推理时间为基础,主要指标如下:

指标含义
有效率(Validity)样本满足接触与基本几何约束的比例
覆盖率(Coverage)标注或可执行模式中有多少被候选覆盖
多样性(Diversity)候选在接近方向、接触和部件上的差异
碰撞率(Collision Rate)候选与物体外部、桌面或场景碰撞比例
条件一致性(Condition Consistency)是否符合目标、任务或夹爪条件
校准(Calibration)模型分数是否对应真实成功概率
推理成本(Inference Cost)固定候选数所需时间与网络调用次数
物理成功(Physical Success)经规划后真实执行的结果

近期 GraspGen、Equivariant Volumetric Grasping 和 GraspMeanFlow 分别探索生成器内训练、等变体素分布和少步流 [9,11,12]。这些方向分别改变训练数据进入生成器的方式、三维表示和采样步数。

Algorithm 1 条件生成式抓取检测
输入:
场景点云 PP、条件 cc、候选数 KK、生成步数 TT、平行夹爪几何
输出:
经排序与去重的 6-DoF 抓取集合 G^\widehat{\mathcal G}
  1. require 编码点云和条件,得到共享场景特征
  2. 采样 KK 个初始噪声或潜变量,并记录随机种子
  3. for 从生成步 TT 迭代到 11
  4. 预测去噪方向或流速度,并施加任务、碰撞或夹爪条件
  5. 更新平移、旋转和开口表示
  6. end for 完成生成
  7. 解码抓取,将旋转投影到 SO(3)SO(3),并限制开口宽度
  8. 执行夹爪终态与接近扫掠碰撞检查,删除不可达候选
  9. 使用统一评分器重排,并执行对称感知 NMS
  10. return 保留前 kk 个候选组成 G^\widehat{\mathcal G}

比较生成器时,固定候选数 KK、网络评估次数、碰撞器、重排器和最终 top-kk。同时报告过滤前后的有效率与覆盖率,可以分辨改进来自生成分布还是后处理。


参考文献(References)#

  1. A. Mousavian, C. Eppner, and D. Fox, “6-DOF GraspNet: Variational Grasp Generation for Object Manipulation,” 2019 IEEE/CVF International Conference on Computer Vision, 2019. DOI
  2. K. R. Barad et al., “GraspLDM: Generative 6-DoF Grasp Synthesis Using Latent Diffusion Models,” IEEE Access, 2024. DOI
  3. J. Urain, N. Funk, J. Peters, and G. Chalvatzaki, “SE(3)-DiffusionFields: Learning Smooth Cost Functions for Joint Grasp and Motion Optimization through Diffusion,” 2023 IEEE International Conference on Robotics and Automation, 2023. DOI
  4. J. Lundell et al., “Constrained Generative Sampling of 6-DoF Grasps,” 2023 IEEE/RSJ International Conference on Intelligent Robots and Systems, 2023. DOI
  5. T. Taunyazov et al., “Refining 6-DoF Grasps with Context-Specific Classifiers,” 2023 IEEE/RSJ International Conference on Intelligent Robots and Systems, 2023. DOI
  6. J. Huber et al., “Speeding up 6-DoF Grasp Sampling with Quality-Diversity,” 2024 IEEE/RSJ International Conference on Intelligent Robots and Systems, 2024. DOI
  7. J. Huber et al., “QDGset: A Large Scale Grasping Dataset Generated with Quality-Diversity,” 2025 IEEE International Conference on Robotics and Automation, 2025. DOI
  8. D. Huang, W. Dong, C. Tang, and H. Zhang, “HGDiffuser: Efficient Task-Oriented Grasp Generation via Human-Guided Grasp Diffusion Models,” 2025 IEEE/RSJ International Conference on Intelligent Robots and Systems, 2025. DOI
  9. A. Murali et al., “GraspGen: A Diffusion-Based Framework for 6-DOF Grasping with On-Generator Training,” arXiv preprint arXiv:2507.13097, 2025. arXiv
  10. B. Han et al., “GraspGen-X: Cross-Embodiment 6-DOF Diffusion-Based Grasping,” arXiv preprint arXiv:2606.00998, 2026. arXiv
  11. J. Kwon et al., “GraspMeanFlow: SE(3)-Equivariant MeanFlow for Few-Step 6-DoF Grasp Generation,” arXiv preprint arXiv:2608.03295, 2026. arXiv
  12. P. Song, Y. Hu, P. Li, and R. Detry, “Equivariant Volumetric Grasping,” arXiv preprint arXiv:2507.18847, 2025. arXiv
  13. J. Ho, A. Jain, and P. Abbeel, “Denoising Diffusion Probabilistic Models,” Advances in Neural Information Processing Systems 33, 2020. arXiv
Robotic Grasp Detection (8): 基于扩散模型与流模型的生成式抓取检测
https://agusexp25.top/en/blog/robotic-grasp-detection-8
Author 菊花花
Published at August 14, 2026