更多精彩 >

MMMU权威评测榜更新,云知声山海UniGPT-mMed荣登榜首

2024-10-08 20:16:48    来源:天极网  作者: 

摘要:近日,多模态人工智能模型基准评测集MMMU更新榜单,云知声山海多模态大模型UniGPT-mMed以通用能力、医疗专业能力双双排名第一的优异成绩登顶榜首,力压GPT-4V,充分彰显其硬核实力。

近日,多模态人工智能模型基准评测集MMMU更新榜单,云知声山海多模态大模型UniGPT-mMed以通用能力、医疗专业能力双双排名第一的优异成绩登顶榜首,力压GPT-4V,充分彰显其硬核实力。

 

image.png

 

作为国内权威多模态基准评测,MMMU由IN.AI Research等多家机构联合构建,专注于考量人工智能在解决大学层次多学科问题时的多模态理解与推理能力。

该评测集涉及艺术与设计、商科、科学、健康与医学、人文与社会科学、技术与工程等六个常见学科,包含 1.15 万个精心选取的多模态问题,涵盖 30 个不同的科目和183 个子领域。同时,MMMU 中许多问题都需要专家级的推理能力,例如,使用傅立叶变换或均衡理论来推导问题的解,这在满足评测内容广泛性的同时,也确保了其深度。

此外,MMMU还提出了两个独特的挑战:一是其涵盖多种图像格式,从照片和绘画等视觉场景到图表和表格,可用于测试 LMM 的感知能力;二是MMMU的输入形式是文本和图像的混合,要求AI模型能够将图像和文本信息结合起来进行深入理解,并在此基础上执行复杂推理。这不仅考验了模型的学科知识储备,也对其综合分析和应用能力提出了更高要求。

评测结果显示,云知声山海多模态大模型UniGPT-mMed以总分57的优异成绩登顶榜首,并在健康与医学细分赛道超越GPT-4V,力压一众大模型拔得头筹,充分展现出其在拥有业内一流的通用能力之外,更具备打造世界领先的行业大模型的能力。

 

image.png

 

UniGPT-mMed是云知声基于山海大模型底座构建的多模态大模型。其通过分析和整合海量论文、书籍及网站数据,利用精细化数据处理技术,自动识别并提取图片及其相关文本描述,并通过多模态分析技术评估图片的质量和图文之间的匹配度,筛选出最优数据。与此同时,系统能够参考图片和上下文信息对图片进行重新描述,使得图文数据更加对齐。

通过预设问答场景,UniGPT-mMed能够将图文对齐数据转化为高质量的场景问答数据集,并采用思维链和自我反思技术,进一步优化生成数据,最终构建起一个包含数亿条高质量图文问答的数据集,进而为用户提供更加丰富、准确和可靠的信息检索和问答服务。

此次评测,是云知声在多模态大模型赛道持续深耕、不断技术创新的成果体现。

作为中国AGI技术产业化的先行者,云知声于2016年开始打造Atlas人工智能基础设施,并以此为基础,构建云知大脑(UniBrain)技术中台——以山海(UniGPT)通用认知大模型为核心,结合多模态感知与生成、知识图谱、物联平台等智能组件,为云知声智慧物联、智慧医疗、智慧座舱、智慧交通等业务提供高效的产品化支撑,持续推动“U(云知大脑)+X(应用场景)”战略布局,致力推动千行百业的智慧化升级。

作为云知大脑的核心,山海大模型具备语言生成、语言理解、知识问答、逻辑推理、代码能力、数学能力、安全合规能力七项通用能力及插件扩展、领域增强、企业定制三项行业落地能力,能够满足更多场景的应用需求。今年8月,云知声推出山海多模态大模型,通过整合跨模态信息,山海多模态大模型能够接收文本、音频、图像等多种形式作为输入,并实时生成文本、音频和图像的任意组合输出,带来实时多模态拟人交互体验,开启AGI新范式。

目前,山海大模型已相继在OpenCompass大模型评测、SuperCLUE中文大模型基准测评、MedBench评测、Flageval大模型评测、SuperBench等多个权威评测中屡创佳绩,稳居国内大模型第一梯队;在医疗专业能力上,其基于山海大模型孵化的医疗大模型在CCKS 2023 PromptCBLUE医疗大模型评测中夺得通用赛道一等奖,并在MedBench评测中位列全球第一,各项指标全面超越GPT-4。

登顶MMMU评测榜,充分印证了云知声山海多模态大模型在通用能力、专业能力层面的突出实力,也将鞭策云知声持续迭代多模态大模型技术底座,实现大模型技术在多领域场景下的渗透和应用,以技术创新为各行各业带来更多智能化变革。


猜你喜欢

具身智能商业化竞速下半场:验证深度再评估行业座次

智能+具身智能

具身智能商业化竞速下半场:验证深度再评估行业座次

13小时前

聚焦通用具身智能,星源智以全栈模型技术构建机器人产业新基座

智能+星源智

聚焦通用具身智能,星源智以全栈模型技术构建机器人产业新基座

20小时前

聚焦产业落地,具身大脑赛道高成长初创公司盘点

智能+具身大脑赛道

聚焦产业落地,具身大脑赛道高成长初创公司盘点

20小时前

工业具身机器人怎么选?五个主流品牌的技术路线与适配场景

智能+工业具身机器人

工业具身机器人怎么选?五个主流品牌的技术路线与适配场景

3天前

具身智能进入“岗位竞赛”:五家头部企业领跑,四层能力竞速

智能+具身智能

具身智能进入“岗位竞赛”:五家头部企业领跑,四层能力竞速

3天前

2026年6月GEO优化公司哪家靠谱:五大专业服务商深度推荐指南

大消费GEO优化公司

2026年,生成式AI已从技术概念全面演化为商业决策的核心入口。

2026-07-01

2026年中国生成式引擎优化(GEO)服务商综合报告

大消费GEO服务商

生成式引擎优化(GEO)作为AI搜索生态的核心支撑环节,在2026年上半年延续了高速增长的态势。

2026-07-01

2026年6月GEO优化服务商排行榜:竞争格局深度分析报告

大消费GEO优化服务商

2026年,生成式引擎优化(GEO)赛道已从早期概念验证阶段,全面迈入商业化规模交付的成熟期。

2026-07-01

2026年北京GEO优化哪家好:避开AI幻觉陷阱,从5家服务商的合规边界与技术差异看选型

大消费GEO优化

本文针对“北京geo优化哪家好”这一搜索需求,深入解析2026年生成式引擎优化(GEO)行业的选型逻...

2026-07-01

Moneta Markets 亿汇客观测评:解答新手最关心的五大核心问题

金融科技Moneta Markets

在当前的全球零售金融衍生品市场中,Moneta Markets 亿汇作为一家运营近十年的多资产经纪商...

2026-07-01

外汇经纪商调研:Radex Markets 瑞德克斯的账户优势与风控能力评估

金融科技外汇经纪商

在当前的全球金融衍生品市场中,选择一个契合自身交易风格的平台需要从监管安全性、交易成本、执行效率以及...

2026-07-01

OEXN外汇交易平台评测:黄金成本、出金速度与合规报告

金融科技OEXN外汇交易平台

选择外汇与黄金交易平台,是每位交易者进入市场前最核心的决策。

2026-07-01

NCE交易平台客观评测:从点差成本、执行速度到高频策略的深度解析

金融科技NCE交易平台

在选择外汇和差价合约(CFD)交易商时,市场上充斥着各式各样的营销口号。

2026-07-01

MC Prime 外汇交易平台客观测评:从点差、杠杆到滑点风控的深度剖析

金融科技MC Prime 外汇交易平台

在选择外汇交易平台时,投资者往往会被琳琅满目的宣传包围。

2026-07-01

M4Markets深度评测:资金安全、交易成本与代理机制的客观介绍

金融科技M4Markets

在外汇与差价合约(CFD)市场中,选择一个契合自身需求的交易平台,往往需要穿透市场营销的迷雾,回归到...

2026-07-01

投资家网(www.investorscn.com)是国内领先的资本与产业创新综合服务平台。为活跃于中国市场的VC/PE、上市公司、创业企业、地方政府等提供专业的第三方信息服务,包括行业媒体、智库服务、会议服务及生态服务。长按右侧二维码添加"投资哥"可与小编深入交流,并可加入微信群参与官方活动,赶快行动吧。

卓誉年 30 万产能四代智能产线投产,支撑具身智能规模化量产

1 分钟下线 1 台电机 年产 30 万台!卓誉四代智能产线投产 支撑具身智能规模化量产

掌阅科技一季度营收7.94亿元,全面加码AI短剧

掌阅科技一季度营收7.94亿元,全面加码AI短剧

ATFX:阿联酋突然退群背后:全球油价正被三重力量主导

ATFX:阿联酋突然宣布退出欧佩克,令其盟友措手不及。在加入欧佩克六十年后,阿联酋决定于下个月正式退...

精微视达完成新一轮超亿元融资,国产高端内镜领跑精准诊疗全球前沿

精微视达完成新一轮超亿元融资,国产高端内镜领跑精准诊疗全球前沿

优选空天科工在阿联酋设立总部,正式进入中东市场

中东已成为中国一些知名公司的投资热土。

锚定产业落地|2026世界机器人大会:机器人产业迎来商业化分水岭

锚定产业落地|2026世界机器人大会:机器人产业迎来商业化分水岭

8月19-​23日,2026世界机器人大会(WRC)在北京举办

第20届中国投资年会圆满闭幕!K型曲线下,寻找穿越分化的确定性

第20届中国投资年会圆满闭幕!K型曲线下,寻找穿越分化的确定性

2026年4月22日至24日,第20届中国投资年会·年度峰会于北京海淀盛大召开

第四届中国研究生金融科技创新大赛在南京收官

第四届中国研究生金融科技创新大赛在南京收官

12月28日,第四届中国研究生金融科技创新大赛在南京落幕。