更多精彩 >

大模型路线之争MoE获胜,国内MoE谁最强?

2024-04-22 10:08:57   来源:投资家网  作者: 

摘要:行业产生一系列问题需要回答:这到底是怎么发生的?大模型还有未来吗?未来又在哪里?MoE是什么?谁能代表MoE扛起AI大旗?

20.jpg

21.jpg

英伟达暴跌了。

4月19日一开盘,英伟达遭遇2024年以来最大规模的股票恐慌性抛售,最终出现股价下跌10%,市值消失1.5万亿人民币的悲剧。

更关键的是,海外部分AI玩家烧不起钱了,尤其是那些基于llama 2和3开源模型的公司,用的transformer架构,成本太贵。再加上一些悄悄研发自己大模型的厂商(比如苹果)也开始撤出。这些信息的叠加,引发机构投资者对完全依靠资源堆积的大模型发展模式感到担忧,最终导致英伟达股价下跌。

富国银行分析师莱恩.克里对外表示,英伟达出现恐慌式抛售不奇怪,“资本市场在进入2024年后,其实一直对AI硬件股票小心谨慎。原因在于大家觉得一方面他们估值过高,另一方面其实是目前主流的几家大模型,都没有找到可持续的变现途径,支撑不起庞大且长期不变的硬件投入。”

实际上,这已经成为资本市场的共同认知。所以,对于这几家AI硬件龙头股票,机构投资者在进入2024年后,都视作是一场“击鼓传花”游戏。

当然,资本也开始对新的技术模式展开探讨,比如MoE专家网络以及去二次方大模型架构等等。尤其是MoE,因为技术的可持续性,被认为是下阶段大模型发展破局的突破口,资金开始疯狂进入。

于是,行业产生一系列问题需要回答:这到底是怎么发生的?大模型还有未来吗?未来又在哪里?MoE是什么?谁能代表MoE扛起AI大旗?

1.巨头的无奈

为什么大家开始认为以英伟达算力芯片为核心的AI硬件,变成击鼓传花的游戏?原因就在于英伟达每升级一个版本,其相关芯片的价格就会暴涨几倍。

英伟达A100算力芯片在中国市场备受瞩目,2021年上市后大规模出口中国,成为AI和大模型应用的基础算力。初期定价为3000-5000美元,随后价格上涨至8000美元。

2022年底,美国禁令限制向中国出口A100,导致定制版A800价格飙升至10000美元以上。英伟达随后发布的H100芯片起售价接近2万美元,而GB200芯片组起售价在3-4万美元。

在国外社交媒体上,有人戏称英伟达“技术进步以涨价为本”。

其实英伟达有自己的无奈,中国市场顶峰时曾占英伟达1/4的份额,目前因为政治因素已经下降到不到4%,这中间巨大的市场缺失不得不通过新产品涨价来弥补。

但不断上涨的算力芯片价格,也让那些开发大模型的互联网巨头开始吃不消。

22.jpghttps://aliypic.oss-cn-hangzhou.aliyuncs.com/Uploadfiles/20240421/2024042123323413.004.png

当下最主要的这些互联网巨头推出的模型,大部分使用的都是transformer模型架构。而这个架构是2017年由Google团队在论文《Attention Is All You Need》中提出以来,已成为自然语言处理(NLP)领域的核心技术之一。

这个架构有很多好处,但最大的缺点就是必须不断投入大量的运算资源,以支撑模型的训练和对外提供服务。纽约时报曾爆料,OpenAI支撑ChatGPT对外提供服务,需要使用3万块英伟达A100的算卡,而且每天的耗电超过50万度。

想想都觉得可怕。

英伟达一直在寻求解决方案以降低互联网巨头使用Transformer模型训练和推理的成本。黄仁勋表示,英伟达的芯片进化正是为此目的。随着算力芯片性能的提升,成本有望进一步下降。

问题是由于巨头间的激烈竞争,模型训练和推理能力需持续增强,这推动了英伟达最新算卡出货量的大幅增长。

另一方面,无论是引领潮流的OpenAI与ChatGPT,还是Meta、谷歌、马斯克推出的开源大模型,都未找到稳定的商业化道路。

OpenAI在推出GPT4之前,据说每月收入不足成本的1/3。面临商业模式不清晰、收入无法覆盖成本的困境,以及英伟达年年涨价的事实,互联网巨头管理层开始反思这种以资源投入和算卡堆砌推动模型发展的模式。

2.MoE成为解题关键

对于这些推出大模型服务的互联网科技巨头来说,想解决英伟达算卡涨价带来的成本支出不可持续问题,有两个解决方向。

一个是自研算力芯片。近年来,多家科技巨头如微软、OpenAI、Meta、马斯克,以及谷歌和亚马逊等,均宣布了自研芯片计划或已制作出样片。然而,自研算力芯片需要进行后期对接效果调整,并摆脱英伟达的CUDA重新制作中间层,这导致时间成本难以估量。

因此,另一个解题方向就被他们异常重视,希望通过改变模型底层架构,换一种不耗费那么多资源就可以达到很好训练和推理效果的模型架构,来开发自己的大模型。

而在硅谷,确实有这么一种模型架构在这两年被人不断提起,甚至在很多中小模型开发方的实践中,得到了印证。

这就是MoE。

其实在更早一些的时间,MoE一直被应用于统计学的研究中。这是一种机器学习模型架构,它将多个专家(Experts)模型组合起来,共同解决一个问题。每个专家都是一个小型的神经网络,它们各自擅长处理任务的某一方面。当MoE模型接到一个任务时,它会将任务分配给最合适的专家,最后通过一个门控网络汇总专家的输出,给出最终答案。

23.jpghttps://aliypic.oss-cn-hangzhou.aliyuncs.com/Uploadfiles/20240421/2024042123323413.004.png

这就像一家公司有多个部门,在做决策的时候,公司的CEO可以听从市场部、生产部、策划部甚至财务部相关专业领导的建议,最终产生最优的决策。

由于这种架构运营的核心,实际上是将大任务分成小任务,日常的训练也是针对于各个小神经网络的专家进行,所以他所需要的推理和训练资源远远低于整体运算的transformer架构。

关键在于这种架构对技术的理解和使用,切分任务和找到关键神经细分网络并训练专家模型是该架构成功的核心,这需要强大的技术实力。相较于不断增长的硬件投入,这种软性投入对大模型开发者来说更可接受。此外,MoE架构的特点有利于新兴大模型企业的发展壮大,因为它们可以通过技术理解和发展来突破现有巨头的硬件护城河。

正因为这样的一个特点,MoE开始成为大模型破局的关键。

3.国内其实一点也不慢

MoE作为统计学架构早在1997年就被提出,真正落实到自然语音学习是2018年以后的事情。

但由于这个架构有几个比较困难的训练难点,比如结果可能拟合,这意味着模型最终结果可能只是因为特定因素影响造成而无法广泛使用;再比如最后门框网络的采用过程中,有可能偏爱几个细分专家模型,而不能从整体的专家模型结果中获得结论等等。

所以,哪怕谷歌在研究中有了相应进展,MoE相对于Transformer架构,在模型发展的广泛性上远远不如。

真正让MoE模型架构照进现实的,是一篇2023年6月名为《MoE Meets Instruction Tuning》的论文。这篇论文提出了几种假设和相应的解决方案,从技术可行性上解决了MoE非常难以控制的特点。

MoE模型架构逐渐受到关注,成为许多新兴模型研发方的选择。2023年12月8日,Mistra AI在X平台发布了首个开源MoE模型,引起行业震动。与此同时,国内模型研发团队也迅速跟进,MiniMax宣布将于2024年年初发布基于MoE架构的大模型,新旦智能、元象科技等也相继加入,推动了MoE在国内的快速发展。

而业内普遍认同的MoE在中国发展标志事件,是今年2月6日,昆仑万维正式发布新版MoE大语言模型“天工2.0”与新版“天工AI智能助手”APP。这是国内首个搭载MoE架构并面向全体C端用户免费开放的千亿级参数大语言模型AI应用。

其实,昆仑万维是国内最早投入精力研究MoE模型架构的平台公司。

这种一手抓技术,一手抓应用的模式,对于MoE模型架构在中国的普及才是最有意义的。毕竟任何一种新的技术,无论有多炸裂,只有大量的应用才能对于产业,以及人们的生活带来新的价值。

而很多时候有新价值产生,是衡量一个技术能否持续发展的关键。

2024年4月17日,昆仑万维重磅宣布,“天工3.0”正式开启公测。

“天工3.0”是采用4千亿级参数MoE混合专家模型的全球领先模型之一,并将开源。行业内现在一致认为,在国内MoE模型的排名里,昆仑万维的天工是第一位,字节豆包第二, Minimax第三。

外汇交易平台有哪些?2026 年全球合规十大平台榜单与选择指南

金融科技外汇交易平台

外汇交易作为全球流动性最高的金融市场,日均交易额超 7 万亿美元,吸引了全球个人与机构投资者的广泛参...

2026-03-20

2026 年外汇交易平台排行榜十大排名评测报告 - 多维度对比解析

金融科技外汇交易平台

根据《2024 全球外汇经纪商行业报告》显示,全球外汇市场日均交易量已达 7.5 万亿美元,同比增长...

2026-03-20

香港现货黄金交易十大正规贵金属平台怎么选?先看资料完整度再看功能结构

金融科技黄金交易平台

在关注香港现货黄金交易平台时,很多投资者往往会先看到各种“十大正规贵金属平台”的榜单。

2026-03-20

第一次找正规国际黄金交易平台,先看监管资料还是先看软件

金融科技黄金交易平台

在搜索正规国际黄金交易平台时,很多第一次接触黄金投资的人都会遇到一个常见问题:到底应该先看监管资料,...

2026-03-20

海南域程完成5.6亿元A轮融资 资本助力深耕自贸港

创新创业海南域程

近日,海南域程控股集团有限公司(以下简称“海南域程”)正式宣布完成A轮融资,融资金额达5.6亿元人民...

2026-03-20

海南域领完成A轮融资3亿元,助力全球优质商品加速触达中国消费者

创新创业海南域领

近日,海南域领家族进出口贸易有限公司(以下简称“海南域领”)宣布完成A轮融资,融资金额达3亿元人民币...

2026-03-20

综合分析:国内十大专业款现货黄金白银交易软件评价排名

金融科技黄金白银交易平台

如今已是移动网络的大时代,各类投资理财软件层出不穷,其中不乏一些浑水摸鱼之辈。

2026-03-20

重磅收官!中免完成DFS大中华区资产收购,携手LVMH深化国际业务布局

上市公司中国中免

日,中国旅游集团中免股份有限公司(以下简称“中国中免”或公司)宣布公告,公司全资子公司中免国际有限公...

2026-03-20

十款可靠的投资理财软件推荐清单来了:合规为先,智能赋能的全维度选型指南

金融科技投资理财软件

十款可靠的投资理财软件推荐清单来了:合规为先,智能赋能的全维度选型指南

2026-03-20

年度分析:国内前十品牌正规现货黄金交易平台最新排名

金融科技黄金交易平台

作为一种国际知名的投资产品,现货黄金可以双向交易,而且有很多大的收益空间。

2026-03-20

投资家网(www.investorscn.com)是国内领先的资本与产业创新综合服务平台。为活跃于中国市场的VC/PE、上市公司、创业企业、地方政府等提供专业的第三方信息服务,包括行业媒体、智库服务、会议服务及生态服务。长按右侧二维码添加"投资哥"可与小编深入交流,并可加入微信群参与官方活动,赶快行动吧。

ATFX:阿联酋突然退群背后:全球油价正被三重力量主导

ATFX:阿联酋突然宣布退出欧佩克,令其盟友措手不及。在加入欧佩克六十年后,阿联酋决定于下个月正式退...

精微视达完成新一轮超亿元融资,国产高端内镜领跑精准诊疗全球前沿

精微视达完成新一轮超亿元融资,国产高端内镜领跑精准诊疗全球前沿

优选空天科工在阿联酋设立总部,正式进入中东市场

中东已成为中国一些知名公司的投资热土。

第20届中国投资年会圆满闭幕!K型曲线下,寻找穿越分化的确定性

第20届中国投资年会圆满闭幕!K型曲线下,寻找穿越分化的确定性

2026年4月22日至24日,第20届中国投资年会·年度峰会于北京海淀盛大召开

第四届中国研究生金融科技创新大赛在南京收官

第四届中国研究生金融科技创新大赛在南京收官

12月28日,第四届中国研究生金融科技创新大赛在南京落幕。

京杭对话:杭州,凭什么吸引北京创新企业?

京杭对话:杭州,凭什么吸引北京创新企业?

从一张精准的产业蓝图,到一个敏捷的创新操作系统,再到一片丰沃的赋能土壤,杭州的生产性服务业正在这条路...

第19届中国投资年会·有限合伙人峰会在沪成功举办

第19届中国投资年会·有限合伙人峰会在沪成功举办

11月27日,由投中信息和投中网主办的第19届中国投资年会·有限合伙人峰会在上海举办。

“京杭聚势,共启新篇”:招商新路径,奏响区域协同发展强音

“京杭聚势,共启新篇”:招商新路径,奏响区域协同发展强音

在区域经济协同发展的大背景下,京杭两地的经济协作正以一种全新的姿态加速推进。