更多精彩 >

极佳视界首次提出通用世界模型L1-L5分级体系

2026-08-31 16:32:48    来源:投资家网  作者: 

摘要:极佳视界首次提出通用世界模型(GWM)L1-L5分级体系。旨在为不同技术路线提供统一的能力坐标系,并为研发目标、数据建设和评测方式提供参考。

近日,在北京极佳视界科技有限公司与通用世界模型北京市重点实验室联合主办的2026世界机器人大会通用世界模型前沿论坛上,极佳视界创始人、CEO黄冠发表题为《通用世界模型引领AGI的最新前沿》的主旨演讲,并首次提出通用世界模型(GWML1-L5分级体系。该体系按照模型对视觉、动作、空间、物理和长程运行的建模能力,将通用世界模型划分为视频、动作、几何、物理、运营五个层级,旨在为不同技术路线提供统一的能力坐标系,并为研发目标、数据建设和评测方式提供参考。

1.png 

极佳视界创始人、CEO黄冠在论坛发表主旨演讲

随着视频生成模型、交互环境模型和机器人策略模型被广泛纳入世界模型范畴,概念边界不断扩展,但不同模型的能力仍存在明显差异。画面逼真并不等同于空间结构准确,能够预测下一帧也不等同于能够判断接触、碰撞或长程操作的真实后果。黄冠认为,AGI不能只有语言智能,还需要能够在物理空间中理解、生成、预测和行动的世界智能,行业因此需要一套能够区分能力边界的分级框架。

基于极佳视界在通用世界模型领域的技术积累,以及在具身智能、自动驾驶、内容创作等领域的落地实践,黄冠表示:通用世界模型(GWM)可以分为L1-L5分级框架——从生成视觉真实的视频世界,逐级走向动作、几何、物理,最终抵达可长程运营的通用无限世界。

从视频到运营:通用世界模型的五级能力

L1-L5描述的是模型对世界施加的约束逐步增强:从外观真实走向动作可用,从三维结构稳定走向物理规律可信,再到状态、记忆与反馈能够在更长时间尺度上持续运转。层级越高,模型越不能只依赖一段看起来合理的视频证明能力。黄冠认为,通用世界模型的通用至少需要经受三重检验:能否跨场景迁移,能否被行动及其结果验证,能否在时间推移中保持一致。

L1视频:先让世界看起来真实

L1根据各种输入生成视觉真实的通用视频世界,重点考察画面质量、时间连续性、语义一致性与可控性。这一层解决世界的视觉表达问题,但视觉可信并不等于结构和规律可信。一个模型能够生成逼真的机械臂,并不代表它已经掌握夹爪与物体接触后的变化。

L2动作:从看见未来做出选择

L2要求模型生成高效、合理的通用执行动作,把对环境的理解转化为可执行的动作序列。对于机器人,动作需要在约束条件下完成任务;对于交互环境,用户输入需要引起合理反馈。世界模型由此从内容生成工具进一步走向决策与行动的基础设施。

L3几何:让像素世界具备稳定空间结构

L3要求模型生成几何准确的通用空间世界,空间关系、尺度、遮挡、多视角一致性和三维结构成为硬约束。随着视角、传感器或观察时间变化,物体的位置、形状和相互关系仍应保持一致,使世界成为可以被定位、测量和导航的空间。

L4物理:从空间正确走向因果正确

L4要求模型生成物理精确的通用物理世界。除几何结构外,模型还需要遵循接触、摩擦、碰撞、力与运动等规律,不仅预测接下来像什么,还要判断采取这个动作会发生什么,并在更长的滚动预测中控制误差累积。

L5运营:让世界长期存在并持续反馈

L5要求模型生成可长程运营的通用无限世界。这里的运营并非商业运营,而是让世界在长时间尺度上维持状态、规则、记忆和交互,并在持续反馈中演化。模型还需要处理长程任务、多主体协同、异常恢复和开放式变化,使一次性生成结果转变为可持续运行的智能环境。

2.png 

极佳视界提出的通用世界模型L1-L5分级体系

三条进阶轴共同刻画能力提升

这五个层级并不是五代模型的简单排列,而是由三条彼此关联的技术进阶轴共同构成。只有三条轴同时推进,世界模型才可能从演示走向可复用的基础能力。

表征轴:从像素到几何,再到物理。像素让模型学习世界的外观,几何赋予模型稳定的空间结构,物理则把结构与因果规律连接起来。能力越向上演进,模型越需要显式或隐式地保存对象、状态、关系与动力学,而不能只依赖局部纹理延续下一帧。

智能轴:从生成到行动,再到闭环反馈。生成是提出一种可能的未来,行动是在多种未来中选择一条可执行路径,闭环则要求模型根据结果持续修正策略。只有进入预测行动反馈再预测的循环,世界模型才可能成为智能体的内部环境。

时间轴:从短片段到长程任务,再到持续世界。短时生成主要考验局部连贯性,长程任务会暴露记忆丢失、状态漂移和误差累积,持续世界还需要面对开放变化和多主体交互。L5的难点不只是生成得更久,而是让因果、状态和目标在更长时间尺度上仍然成立。

需要强调的是,更高层级不是替代更低层级,而是在其上叠加更强约束。没有稳定的视频表征,动作无从观察;没有准确的几何与物理,长程运行也只会放大误差。

三类场景检验同一套能力坐标

L1-L5并非从单一场景倒推出的抽象概念。极佳视界自2023年成立以来,持续布局通用世界模型的全栈技术体系,并将相关能力应用于具身智能、自动驾驶、内容创作等方向。不同场景对视觉、空间、物理、动作和长程稳定性的要求各不相同,但都在检验同一个问题:模型是否真正理解世界,而不仅是在拟合画面。

3.png 

极佳视界的世界生成模型与世界行动模型体系

具身智能:以行动结果检验预测

在具身智能场景中,黄冠重点介绍了GigaBrain-0.7。据介绍,其System 1VLA生成连续未来动作,System 2VLM理解物理常识和因果关系并完成高层规划,System 3引入通用世界价值模型,对未来世界及动作价值进行预测,再结合在线强化学习形成持续自进化闭环。现场展示的一项长程任务包含20余个原子动作,并实现超过20分钟的一镜到底执行。

这类任务对应的不只是L2的动作生成。高层规划依赖对环境状态的理解,世界价值模型需要判断动作的未来后果,长程执行则会持续检验记忆、状态保持和异常恢复能力。机器人由此成为高等级世界模型的重要真机验证场景。

4.png 

GigaBrain-0.7系统架构

自动驾驶:将视觉生成置于几何与物理约束之下

据极佳视界介绍,在自动驾驶场景中,DriveDreamer EngineWorld ModelAgentic ModelHarness构成,支持结构化多输入视频生成、HD Map3D Box控制、多视角生成,以及RGBLiDAR之间的跨传感器一致性。极佳视界还将世界重建扩展至10公里以上路网,并在部分场景中把重建时间从约3小时缩短至约3分钟。

驾驶场景对看起来合理的容忍度较低:车道结构、车辆位置、遮挡关系与传感器观测需要保持一致,智能体的动作还需要引起合理的交通演化。这使其成为从L1视频向L3几何、L4物理演进的典型压力测试。

5.png 

DriveDreamer Engine整体架构

10.png 

极佳视界持续推进自动驾驶世界模型技术迭代

内容生成:在开放创作中检验可控性与一致性

在内容生成场景中,极佳视界以YiSu 2.0YiSu AgenticYiSu Engine构成产品矩阵,并通过WonderTurboHumanDreamerMotion-R1WorldDreamer等模型推进长镜头、三维一致性、人体运动和空间交互等能力。

内容创作通常从L1能力切入,但镜头拉长、视角切换以及角色与环境发生互动后,几何、遮挡和物理稳定性很快会成为决定内容可用性的关键因素。

6.png 

极佳视界内容创作产品及模型矩阵

分级体系推动评测指标随能力边界升级

分级框架的意义不仅在于描述技术演进方向,也在于推动评测对象随能力边界升级。如果用视频美学指标衡量物理世界模型,或仅以短时成功率衡量长程智能体,容易把演示效果与真实能力混为一谈。

按照L1-L5框架,L1主要评估视觉质量、时间连续性和输入可控性;L2关注动作合理性、任务成功率、效率与安全边界;L3需要验证空间与结构的几何精度以及跨视角、跨时间一致性;L4进一步考察物理规律、因果关系和滚动预测的稳定性;L5则需要在长时间、开放环境和持续交互中检验状态持久性、长程稳定性、恢复能力与持续学习能力。

当指标随层级变化,行业才有可能区分演示得好能力走得远L1-L5由此不仅是一张技术地图,也可作为连接研发目标、数据建设与评测标准的共同语言。

7.png 

L1L5,评测对象随能力边界逐级升级

从语言到世界,GWM成为AGI的重要前沿

视频决定世界看起来是否真实,几何与物理决定它是否真正可以被进入、被预测、被行动;长程运营则决定这个世界能否持续存在。黄冠表示,更高层级并非替代更低层级,而是在其上叠加更强约束。没有稳定的视频表征,动作无从观察;没有准确的几何与物理,长程运行也只会放大误差。

大语言模型证明了规模化学习可以压缩人类语言与知识,但物理世界并不只以文本形式存在。空间、动作、摩擦、碰撞以及不断延展的时间,都需要被纳入同一个可学习、可预测、可行动的系统。L1-L5分级体系给出的并非一张按年份划分的路线表,而是一条从世界可见行动发生,再到空间成立、规律可信、长程闭环的能力累积路径。

极佳视界表示,将继续围绕通用世界模型推进全栈技术研发,并通过具身智能、自动驾驶和内容生成等场景验证相关能力。随着研发目标和评测方式逐步分层,通用世界模型有望成为连接数字世界与物理世界、推动AGI向真实环境延伸的重要技术方向。

8.png 

2026世界机器人大会通用世界模型前沿论坛现场

关于极佳视界

极佳视界成立于2023年,围绕通用世界模型构建全栈技术体系,并在具身智能、自动驾驶、内容生成等方向推进技术研发与应用实践。


猜你喜欢

行业首个"百万小时"数据诞生!觅蜂科技第2万套数采设备交付京东

具身智能

觅蜂科技第20,000套MEgo无本体数据采集设备正式下线——这是行业第一次实现大规模化量产无本体数...

43分钟前

AGIC 2026 | 天元兴科技TX01荣获“2026机器人创新产品奖”

具身智能

天元兴科技TX01荣获“2026机器人创新产品奖”,三项真机任务演示吸睛全场

2天前

卓誉科技完成新一轮超亿元融资

具身智能

专注于具身智能核心驱动件的研发卓誉科技宣布完成新一轮超亿元融资

2天前

具身智能“大脑”的终极考验:不是聪明,是持续

智能+具身智能

具身智能“大脑”的终极考验:不是聪明,是持续

3天前

中国车企全球销量首超日本,现存汽车产销相关企业超175.6万家

大消费天眼查

中国车企全球销量首超日本,现存汽车产销相关企业超175.6万家

2026-03-26

警惕“财经大V”的敛财陷阱,现存金融消费相关企业超44.8万家

金融科技天眼查

警惕“财经大V”的敛财陷阱,现存金融消费相关企业超44.8万家

2026-03-26

河北定兴成咖啡加工地,全国现存咖啡相关企业超26.5万家

大消费天眼查

河北定兴成咖啡加工地,全国现存咖啡相关企业超26.5万家

2026-03-26

中医药将重点助力优生优育,现存中医相关企业超201万家

医疗健康天眼查

中医药将重点助力优生优育,现存中医相关企业超201万家

2026-03-26

无人机“飞”进麦田助春管,现存相关企业超3.6万家

大消费天眼查

无人机“飞”进麦田助春管,现存相关企业超3.6万家

2026-03-26

多方合力整治“幽灵外卖”,现存外卖相关企业超378万家

大消费天眼查

多方合力整治“幽灵外卖”,现存外卖相关企业超378万家

2026-03-26

水肥机器人助力春管保丰收,全国现存机器人相关企业超108万家

天眼查智能+

水肥机器人助力春管保丰收,全国现存机器人相关企业超108万家

2026-03-26

第六届跨交会在福州开幕,现存跨境电商相关企业超4万家

大消费天眼查

第六届跨交会在福州开幕,现存跨境电商相关企业超4万家

2026-03-26

外媒:中国AI成增长新引擎,现存人工智能相关企业超509万家

天眼查智能+

外媒:中国AI成增长新引擎,现存人工智能相关企业超509万家

2026-03-26

新国标下的博弈与阵痛:电动自行车行业的需求与乱象

大消费天眼查

作为承载数亿人日常出行的“国民代步工具”,电动自行车行业正站在政策重塑与市场转型的十字路口。

2026-03-26

投资家网(www.investorscn.com)是国内领先的资本与产业创新综合服务平台。为活跃于中国市场的VC/PE、上市公司、创业企业、地方政府等提供专业的第三方信息服务,包括行业媒体、智库服务、会议服务及生态服务。长按右侧二维码添加"投资哥"可与小编深入交流,并可加入微信群参与官方活动,赶快行动吧。

掌阅科技一季度营收7.94亿元,全面加码AI短剧

掌阅科技一季度营收7.94亿元,全面加码AI短剧

ATFX:阿联酋突然退群背后:全球油价正被三重力量主导

ATFX:阿联酋突然宣布退出欧佩克,令其盟友措手不及。在加入欧佩克六十年后,阿联酋决定于下个月正式退...

精微视达完成新一轮超亿元融资,国产高端内镜领跑精准诊疗全球前沿

精微视达完成新一轮超亿元融资,国产高端内镜领跑精准诊疗全球前沿

优选空天科工在阿联酋设立总部,正式进入中东市场

中东已成为中国一些知名公司的投资热土。

锚定产业落地|2026世界机器人大会:机器人产业迎来商业化分水岭

锚定产业落地|2026世界机器人大会:机器人产业迎来商业化分水岭

8月19-​23日,2026世界机器人大会(WRC)在北京举办

第20届中国投资年会圆满闭幕!K型曲线下,寻找穿越分化的确定性

第20届中国投资年会圆满闭幕!K型曲线下,寻找穿越分化的确定性

2026年4月22日至24日,第20届中国投资年会·年度峰会于北京海淀盛大召开

第四届中国研究生金融科技创新大赛在南京收官

第四届中国研究生金融科技创新大赛在南京收官

12月28日,第四届中国研究生金融科技创新大赛在南京落幕。