行业资讯

联系我们 Contact Us

电话:010-82488500

传真:010-82488501

E-mail:znj@bjrobot.com

您现在的位置:主页 > 新闻资讯 > 行业资讯 >

SERNF:在 Orca 机器人上实现样本高效的真实世界灵

作者: bjrobot 时间:2026-06-22 来源:未知
摘要:SERNF 是一种基于标准化流的强化学习算法,专为灵巧操作设计,具有极高的样本效率。它将标准化流策略(能够为多模态动作块提供精确似然度)与动作分块评论家(与分块执行对齐的

SERNF 是一种基于标准化流的强化学习算法,专为灵巧操作设计,具有极高的样本效率。它将标准化流策略(能够为多模态动作块提供精确似然度)与动作分块评论家(与分块执行对齐的价值学习)相结合。这使得在有限的交互预算下,依然能够在真实机器人上实现从离线到在线的稳定自适应。

视频清观看B站:https://www.bilibili.com/video/BV1AD7w6ZEVu/


摘要
 
于真实世界的交互预算有限,且动作分布具有高度的多模态特性,灵巧操作策略在真实世界中的微调一直是一项极具挑战性的任务。基于扩散(Diffusion-based)的策略虽然表达能力强,但由于无法计算动作概率,导致在微调阶段无法进行基于似然的保守更新。相比之下,传统的高斯策略在面对多模态时会发生坍塌,尤其是在以“动作块”(chunks)形式执行动作时;此外,标准的单步评论家(per-step critics)无法与分块执行相匹配,从而导致奖励分配(credit assignment)效果不佳。
 
为此,我们提出了 SERNF,一种基于标准化流的样本高效强化学习算法,旨在解决上述挑战。该标准化流策略能够为多模态动作块提供精确的似然度,从而允许通过似然正则化进行保守且稳定的策略更新,进而提升了样本效率。同时,其动作分块评论家能够对完整的动作序列进行评估,使价值估计与策略的时间结构保持一致,并改善了长跨度任务的奖励分配。我们在两项极具挑战性的真实世界灵巧操作任务上对 SERNF 进行了评估:剪刀取回与胶带切割,以及掌内倒立立方体旋转。在这些任务中,SERNF 均实现了稳定且样本高效的自适应。
 
 
 
概述
 
于真实世界的交互预算有限,且动作分布具有高度的多模态特性,灵巧操作策略在真实世界中的微调一直是一项极具挑战性的任务。基于扩散(Diffusion-based)的策略虽然表达能力强,但由于无法计算动作概率,导致在微调阶段无法进行基于似然的保守更新。相比之下,传统的高斯策略在面对多模态时会发生坍塌,尤其是在以“动作块”(chunks)形式执行动作时;此外,标准的单步评论家(per-step critics)无法与分块执行相匹配,从而导致奖励分配(credit assignment)效果不佳。
 
核心思路: 在保持策略表达能力(即多模态动作块)的同时,确保其易于计算(拥有精确的对数似然度),并且让价值学习与相同的时间抽象层级保持对齐。
· 标准化流执行器(Actor): 对动作块进行建模,并提供精确的似然度,从而实现保守的策略更新。
· 动作分块评论家(Critic): 评估整个动作序列,以改善长跨度任务中的奖励分配(credit assignment)。
· 面向有限真机数据的实用流水线: 模仿/蒸馏 → 评论家预热 → 离线强化学习 → 在线强化学习。




方法概览
 
标准化流策略
通过以观测值为条件的可逆变换来对动作块进行建模,从而实现精确的对数似然度计算,并具备表达多模态行为的能力。
 
动作分块评论家
对整个动作块进行价值评估,这不仅与控制接口完美匹配,还有效改善了长跨度任务中的奖励分配(credit assignment)。
 
离线到在线微调
从模仿学习(或仿真到现实的蒸馏)起步,接着对评论家(critic)进行热启动(warm-start),然后运行离线强化学习,最后使用有限的推演预算(rollout budget)进行在线强化学习。






视频
 
标记成功的推演(rollout)完成与失败情况。
 
最终结果(在线强化学习后)



真实世界:剪刀取用与胶带切割

真实世界:掌心朝下手持立方体旋转





其他真实世界任务
 
小黄鸭抓取与放置

这项任务仅使用了30次人工遥操作的演示数据。机器人必须从小黄鸭在桌面上不同的摆放姿态中将其抓起,并准确地放入碗中,这使得低数据量下的适应任务变得极具挑战性。






结果
 
剪刀抓取与胶带切割
从模仿学习起步,SERNF(这里应该是他们提出的算法或框架名称)通过离线强化学习提升了抓取能力,并在经过有限的在线微调后,成功实现了切割动作。在论文的总结表中,SERNF 在最终设定下达到了 70% 的抓取成功率和 70% 的切割成功率。




掌心朝下手持立方体旋转
在线微调将经过蒸馏的仿真策略优化为了鲁棒的真实世界旋转能力。据报道,在收集了大约 105 分钟的真实世界数据后,其峰值性能达到了每分钟 6.25 次旋转。




小黄鸭抓取与放置
小黄鸭任务仅使用了30次人工遥操作演示,属于极具挑战性的低数据量设定。即使在抓取位置和朝向各不相同的情况下,离线强化学习仍达到了 68.75% 的成功率;而随后仅用 15 次额外的推演(rollouts)进行在线强化学习,就将成功率进一步提升到了 87.5%,相比之下,单纯的模仿学习成功率仅为 75%。在三个策略都能成功的推演子集中,强化学习还加快了执行速度:平均完成时间从模仿学习的 8.86 秒,缩短至离线强化学习后的 7.08 秒,以及在线强化学习后的 6.91 秒。



任务 阶段 总结
剪刀与胶带 NF 模仿学习 50% 抓取成功率,10% 切割成功率。
剪刀与胶带 SOFT-FLOW(仅离线) 80% 抓取成功率,但切割尚未解决。
剪刀与胶带 SOFT-FLOW(完整) 经过在线强化学习后,70% 抓取成功率,70% 切割成功率。
立方体旋转 蒸馏 -> 在线强化学习 性能逐步提升,最终达到每分钟 6.25 次旋转的峰值,且能保持稳定的连续转动。
小黄鸭抓取与放置 NF 模仿学习 75% 成功率,平均完成时间 8.86 秒。
小黄鸭抓取与放置 SOFT-FLOW(仅离线) 68.75% 成功率,平均完成时间 7.08 秒。
小黄鸭抓取与放置 SOFT-FLOW(完整) 经过在线强化学习后,87.5% 成功率,平均完成时间 6.91 秒。

产品名称

购买链接

智能佳(ZNJ)Leap Hand 机械手 灵巧手 XL330 XC330舵机 触摸 力反馈 低成本 人工智能拟人手机械手 机器学习

https://item.jd.com/10135137641265.html

智能佳(ZNJ)ORCA开源仿人灵巧手 低成本 17自由度 工业级耐久 仿真到现实 持续灵巧任务学习 教育与研究 ORCA Hand

https://item.jd.com/10155690496802.html

智能佳Manus Metagloves Pro 专业版手套 动作捕捉 量子追踪技术 毫米级指尖捕捉 模块化设计 0.1秒响应

https://item.jd.com/10171887340566.html

智能佳Manus手套 QuantumMetagloves 动作捕捉 LEAP Hand灵巧手控制 量子触感手套 量子传感技术

https://item.jd.com/10159882364446.html


智能佳机器人
 
400 099 1872
010-82488500/82488501
www.bjrobot.com
 
京东店铺:智能佳机器人专营店 - 京东 (jd.com)
淘宝店铺:首页-智能佳机器人-淘宝网 (taobao.com)
企业淘宝:首页-智能佳机器人官方店铺-淘宝网 (taobao.com)


电话邮箱

电话:010-82488500
传真:010-82488501
E-mail: znj@bjrobot.com

网站首页 产品中心 解决方案 联系我们

Copyright © 2006-2026 bjrobot 智能佳科技 京ICP备13001844号

在线客服

点击这里给我发消息 点击这里给我发消息 点击这里给我发消息