更多精彩 >

灵初智能发布端到端VLA模型PsiR0.5,仅需两小时数据实现物品、场景全面泛化

2025-03-03 16:16:46    来源:华夏晚报  作者: 

摘要:近日,Figure发布的端到端VLA具身大模型Helix,采用分层架构同时实现高频控制和高泛化能力,引起了业内广泛关注。

近日,Figure 发布的端到端 VLA 具身大模型  Helix,采用分层架构同时实现高频控制和高泛化能力,引起了业内广泛关注。几乎同期,中国具身智能团队灵初智能发布了基于强化学习的增强版分层架构端到端 VLA  模型 Psi R0.5,这距离灵初智能团队去年底发布的 Psi R0 仅 2 个月。

  本次发布的新模型重大升级,对于复杂场景的泛化性、灵巧性、CoT、长程任务能力上均有显著提升,同时完成泛化抓取训练所需的数据量仅需  Helix 数据量的 0.4%!在全球范围内实现了泛化灵巧操作与训练效率的双重领先。

  此外,灵初智能团队连发四篇高质量论文,将团队在高效实现泛化抓取、堆叠场景的物品检索、利用外部环境配合抓取、VLA  安全对齐方面的最新成果悉数公开,展现了中国团队在具身智能领域的强悍战斗力。

1.png

Psi R0.5 路径演进图

DexGraspVLA仅需两小时灵巧手抓取数据

轻松实现物品、灯光、场景泛化并实现真正  CoT

  DexGraspVLA 是首个用于灵巧手通用抓取的  VLA(Vision-Language-Action)框架,通过少量的训练,即刻在多变环境下智能涌现灵巧操作能力,能够像人类一样快速、准确地拾取各种物品。

  DexGraspVLA 是一个融合视觉,语言和动作的层次化框架:

  · High-level  Planner:高层规划由预训练的大型视觉语言模型(VLM)实现,可理解多样化指令、自主决定抓取策略。

  · Low-level  Controller:低层扩散策略通过实时视觉反馈,闭环掌握目标物体,智能涌现出灵巧操作能力。

  整个框架的核心在于将多样化的图像输入数据通过现有的 Foundation Model 转换成 Domain-invariance  的表征,并端到端地训练下层控制模型。

2.png

DexGraspVLA 框架图

  从实验结果看,灵初智能仅使用了约 2 小时的灵巧手抓取数据(2094 条轨迹 × 3.5 秒 / 条 ÷ 60 秒  / 分钟 ÷ 60 分钟 / 小时 ≈ 2 小时),泛化到上千种不同物体,位置,堆叠,灯光,背景下成功抓取,而这个数据量仅仅是 Figure 的  0.4%,数据利用效率提高 250 倍!

  同时,DexGraspVLA 相比现有方案还具有几项优势:

  · 根据语言指令分辨出目标物体,处理堆叠场景下的目标物体的检索并抓取

  · 抓取速度快(所有视频无加速,同类工作中节拍较快),闭环姿态矫正与重抓取能力(ReGrasp)

  · 大脑具有 CoT 长程推理能力:自主推理抓取顺序并将所有物体依次抓取

  DexGraspVLA  展现出对光照变化、背景干扰和物体姿态的强大鲁棒性和泛化性,让机器人的灵巧抓取达到人类级别。

  基于预训练的大模型:使用自然语言与人类交互,具有高智能的长程推理能力,能够自主理解人类话语并推理任务。因此可以一次设定多个抓取目标,通过 CoT  实现复杂流程下的自动分拣或清理。

  DexGraspVLA  仍然会自动分析当前姿态偏差,通过细微调整腕关节和手部角度重新尝试抓取,实现非常鲁棒且高效的抓取能力,达到极强的泛化能力。

3.png

Retrieval Dexterity

堆叠场景中的高效物体检索策略

  强化学习底层驱动,简单 reward 涌现复杂动作

  在大多数实际场景中,物品往往以无规则、堆叠的方式摆放。传统方法要求机器人逐件搬开遮挡物,不仅耗时,还对机器人自身抓取能力提出了很高的要求。

  为了解决这一难题,灵初智能开发了一套基于强化学习的物体检索策略 ——Retrieval  Dexterity,解决了堆叠场景中物体检索识别效率低的问题。

  Retrieval Dexterity  系统中未用真机数据,灵初团队没有采用真机数据进行训练,而是直接在仿真环境中通过强化学习进行训练。通过在仿真环境中大规模生成复杂的堆叠场景,训练模型直至涌现出合适的检索操作,随后再将这些操作零样本迁移至现实机器人和复杂环境中。

4.png

Retrieval Dexterity 框架图

  从杂乱堆叠物体中快速取出目标物体

  在超过 10 种不同形状、大小的生活物品测试中,Retrieval Dexterity  展现出了优秀的性能,不仅能够高效完成训练过的物体的检索任务,还能将检索能力泛化到未见过的新物体上。

  效率对比传统方法提升明显

  与人为设定的动作相比,Retrieval Dexterity 在所有场景中平均减少了 38%  的操作步骤。与模拟的 “将所有物体抓起来并放开” 相比,该方法更是平均减少了 90%  的步骤数量。这种效率提升主要得益于多指灵巧手能够直接与遮挡物进行交互,并随时移动它们,而不需要逐个移除。

5.png

ExDex:借力外部环境

抓取 “不可能” 物体

  外部灵巧性解决物品超过机器人末端执行器的最大开度问题

  当物体的底面尺寸超过机器人末端执行器的最大开度时,传统方法往往无法直接对物体进行抓取,这种情况在商场等商业场景尤为常见。为了解决这一难题,灵初智能推出了  ExDex—— 一种基于外部灵巧性(extrinsic dexterity)抓取的创新解决方案。

  ExDex 能够利用环境特征进行非夹持式操作,凭借多指灵巧手的灵活性和操作能力,实现更丰富的环境交互。

  强化学习带来超越人类遥操作水平的灵巧操作

  通过强化学习,ExDex  涌现出自主制定策略的能力,借助周围环境抓取那些无法直接抓取的物体。例如,机器人可以将物体先推到桌面边缘或墙体边缘,再利用这些环境特征完成抓取任务。这种操作通过传统的遥操作方式几乎无法实现,充分体现了强化学习的强大优势。

  在对数十种不同家居物品的大量实验中,ExDex  验证了其优越的性能和对新物体的泛化能力,并成功将仿真训练的策略无缝迁移到真实机器人中,实现了从仿真到现实的高效过渡。

SafeVLA:人机安全交互的 “守护神”

  当下,具身智能机器人频繁出圈,从春晚跳舞的 Unitree  人形机器人,到波兰街头遛机器狗的新奇场景,让人看到人机交互的无限可能,但安全问题也不容忽视。视觉 - 语言 -  行动模型(VLAs)在革新机器人技术时,也藏着安全隐患。

6.png

 左图呈现了传统 VLA 模型在抓取任务中的三种典型不安全行为:1)对无关物体的严重损坏,2)目标识别错误导致危险物体的误用,以及  3)执行指令时与危险物体发生交互。右图通过导航路径示例,进一步展示了传统 VLA 在导航过程中的三种不安全行为

  本周,北京大学 PAIR - Lab 团队携手灵初智能重磅推出了具身安全模型  SafeVLA,通过安全对齐,让机器人在复杂场景安全高效执行任务,在对抗干扰场景中鲁棒性极高。

  SafeVLA 把 “以人为本” 刻进  DNA,不像传统机器人只盯着任务完成,它把人类安全放在首位。技术上,引入约束马尔可夫决策过程(CMDP)范式,把现实安全约束融入仿真环境大规模采样。SafeVLA  在安全性和任务执行方面均取得突破性进展,分别提升 83.58% 和  3.85%,充分证明了其在平衡安全与效率方面的卓越能力。

11.gif

传统 VLA 模型完成任务过程中的高危行为

  团队开发全新仿真环境 Safety -  CHORES,集成安全约束功能,支持用户自定义规则,代码还完全开源,直接给全球研究者和开发者送福利。而且,SafeVLA  在 12 个分布外(OOD)实验里,面对光照、材质变化和复杂环境扰动,始终稳定发挥,实力碾压其他模型。

22.gif

SafeVLA 在正常测试集和 OOD 测试集上的比较,其在 OOD 环境下依然保持良好安全性和表现


猜你喜欢

国产具身智能算力生态再添新丁,睿芯RISC-V数据流物理AI芯片牵手启元机器人

智能+启元机器人

国产具身智能算力生态再添新丁,睿芯RISC-V数据流物理AI芯片牵手启元机器人

1小时前

宇树科技产业突围:告别参数内卷,以ROI衡量产业价值,人形机器人从“展演”走向真实生产力

智能+宇树科技

宇树科技产业突围:告别参数内卷,以ROI衡量产业价值,人形机器人从“展演”走向真实生产力

2小时前

宇树开源了新大脑,机器人开始先预判再动手

智能+宇树科技

宇树开源了新大脑,机器人开始先预判再动手

2小时前

7项评测领先开源模型,宇树科技开源具身基座模型让人形机器人“理解世界”

智能+宇树科技

7项评测领先开源模型,宇树科技开源具身基座模型让人形机器人“理解世界”

2小时前

具身智能的“四道门”:从技术闭环到商业闭环,谁走完了全程?

智能+具身智能

具身智能的“四道门”:从技术闭环到商业闭环,谁走完了全程?

2天前

原创

九号机器人在横琴成立供应链管理公司

天眼查九号机器人

【#九号机器人在横琴成立供应链管理公司# 注册资本500万】

2026-05-12

原创

中广核在雄安成立新能源研究院公司

天眼查中广核

【#中广核在雄安成立新能源研究院公司# 注册资本1.25亿】

2026-05-12

原创

赛力斯电池包碰撞场景脱离专利获授权

天眼查赛力斯

【#赛力斯电池包碰撞场景脱离专利获授权# 可在碰撞时使电池包与车体分离】

2026-05-12

原创

股价暴涨!又一AI热门行业大爆发

股价暴涨!又一AI热门行业大爆发

2026-05-12

原创

湖北长江量子科技投资基金登记成立

天眼查湖北长江量子科技投资基金

【#湖北长江量子科技投资基金登记成立# 出资额1亿】

2026-05-12

香港伦敦金交易平台开户流程简便的十大平台推荐

金融科技伦敦金交易平台

对黄金投资者而言,开户流程的繁琐程度常常决定了入市效率。

2026-05-12

真正的法式护肤美学,藏在CELLE BELLE赛丽的百年品牌底蕴里

大消费CELLE BELLE赛丽

真正的法式优雅,从来不是刻意的精致,而是融入日常的从容与质感 — 就像选护肤品,比起浮夸的包装与营销...

2026-05-12

口碑优选!2026年国内用户好评GEO优化服务商盘点

大消费GEO优化服务商

随着生成式人工智能在中国的普及,超过5亿用户已习惯通过DeepSeek、豆包、Kimi等AI平台获取...

2026-05-12

香港金荣中国到底怎么样?从资质到口碑全揭秘

金融科技金荣中国

在贵金属投资浪潮席卷全球的当下,一个平台靠不靠谱,从来不是靠嘴说的——资质说了算,口碑定乾坤。

2026-05-12

国内前十安全版现货黄金交易平台精选排名(2026最新版)

金融科技黄金交易平台

2026年,全球经济不确定性仍在,现货黄金凭借避险与抗通胀属性,持续成为国内投资者的核心配置选择。

2026-05-12

投资家网(www.investorscn.com)是国内领先的资本与产业创新综合服务平台。为活跃于中国市场的VC/PE、上市公司、创业企业、地方政府等提供专业的第三方信息服务,包括行业媒体、智库服务、会议服务及生态服务。长按右侧二维码添加"投资哥"可与小编深入交流,并可加入微信群参与官方活动,赶快行动吧。

卓誉年 30 万产能四代智能产线投产,支撑具身智能规模化量产

1 分钟下线 1 台电机 年产 30 万台!卓誉四代智能产线投产 支撑具身智能规模化量产

掌阅科技一季度营收7.94亿元,全面加码AI短剧

掌阅科技一季度营收7.94亿元,全面加码AI短剧

ATFX:阿联酋突然退群背后:全球油价正被三重力量主导

ATFX:阿联酋突然宣布退出欧佩克,令其盟友措手不及。在加入欧佩克六十年后,阿联酋决定于下个月正式退...

精微视达完成新一轮超亿元融资,国产高端内镜领跑精准诊疗全球前沿

精微视达完成新一轮超亿元融资,国产高端内镜领跑精准诊疗全球前沿

优选空天科工在阿联酋设立总部,正式进入中东市场

中东已成为中国一些知名公司的投资热土。

锚定产业落地|2026世界机器人大会:机器人产业迎来商业化分水岭

锚定产业落地|2026世界机器人大会:机器人产业迎来商业化分水岭

8月19-​23日,2026世界机器人大会(WRC)在北京举办

第20届中国投资年会圆满闭幕!K型曲线下,寻找穿越分化的确定性

第20届中国投资年会圆满闭幕!K型曲线下,寻找穿越分化的确定性

2026年4月22日至24日,第20届中国投资年会·年度峰会于北京海淀盛大召开

第四届中国研究生金融科技创新大赛在南京收官

第四届中国研究生金融科技创新大赛在南京收官

12月28日,第四届中国研究生金融科技创新大赛在南京落幕。