更多精彩 >

阿里云发布全栈AI负载高可用与用户共建AI时代云上IT新治理

2024-12-27 11:45:50   来源:阿里云  作者: 

摘要:在论坛上,2025年中国数字化治理领域最新评估结果揭晓,阿里云成为首批通过信通院“企业用云治理能力成熟度评估”评测的两家企业之一,同时获得该项能力评估最高等级。

12月17日上午,在中国信息通信研究院主办的2024第五届“GOLF+IT新治理领导力论坛”主论坛上,阿里云重磅发布了全栈AI负载高可用架构,以满足AI大模型企业级应用在大规模参数量、复杂结构和高性能算力背景下,对云服务处理能力可扩展性、服务连续性、服务质量和故障快速恢复的需求。

以为生成式 AI 打造持续的卓越用户体验为目的,阿里云全栈AI负载高可用架构可达到GPU故障预测准确率92%,千卡规模集群连续训练有效时长大于99%,秒级模型自动保存、分钟级故障恢复;每分钟10000个pod扩展,分钟级自动扩容;核心模型服务99.99%的API SLA,模型应用服务全链路可观测等重要的AI业务高可用目标,在大规模数据处理和训推场景下,实现了对Gen AI应用业务连续性、响应速度、稳定性和安全性的全面保障。

在论坛上,2025年中国数字化治理领域最新评估结果揭晓,阿里云成为首批通过信通院“企业用云治理能力成熟度评估”评测的两家企业之一,同时获得该项能力评估最高等级。

阿里云全栈AI负载高可用架构正式发布

在AI算力需求逐渐超越通用需求的今天,以GenAI为代表的应用场景和技术倍增,云上企业需要处理和存储的数据量呈指数增长,AI驱动的应用在高负载情况下,对保障业务的连续性、响应速度、稳定性和安全性均提出了更高要求。

为此,阿里云在升级云平台自身的技术服务能力的同时,将GPU、异构算力集群、容器集群、存储、向量数据库、机器学习平台等AI负载高可用全面融入云平台架构设计,围绕大模型训练微调、推理、多模态数据处理等环节,构建具备“高可用模型训练、灵活弹性的推理资源、数据高可靠”特性的全栈AI负载高可用架构,实现了从通用负载向AI负载的可用性演进,为客户AI业务构建提供稳定的业务服务和出色的用户体验。

47.png

在高可用模型训练方面,阿里云AI基础设施高可用能力融入云服务整体架构设计,基于AI算法的故障预测,实现训推环节的性能瓶颈分析和潜在故障分析,GPU故障预测准确率达92%,同时将异常预测接入自愈链路,训练恢复自愈率超90%、千卡规模集群连续训练有效时长大于99%,实现秒级模型自动保存、分钟级故障恢复;同时,CPFS 高性能存储集群,在超大集群中 20TB/s 的吞吐能力,支持更大及更加频繁的 Checkpoint 读写,能够更好地防止数据丢失,并提升训练的稳定性和可靠性。在网络层面,阿里云自研的高性能网络,业界首创双平面的高可用网络架构,网络Link和设备中断,训练任务不中断。

在推理资源方面,阿里云容器计算服务ACS的弹性能力实现每分钟可以进行10000个pod扩展,分钟级自动扩容;PAI-EAS模型在线服务,适用于实时推理、近实时异步推理等多种AI推理场景,能感知每个请求的执行进度,做到更公平的任务调度,提高扩缩容效率。同时,阿里云将跨区域的主动式重路由技术运用到数据中心间的通信,从而在跨数据中心推理网络上,达到跨域带宽业界最高的 99.995% SLA,实现秒级内重新路由,提供一个更加稳定的网络通信延迟。

对于在实时语音交互、实时AI搜索等高性能场景有推理需求的客户,阿里云百炼模型服务平台,基于预训练模型为用户提供模型推理与应用构建托管服务,核心模型服务API达到 99.99% SLA,高性能场景核心用户用例中的首包延时小于300毫秒,能够有效解决应用开发、模型调用等过程中的跨区域TPM限制、高并发需求下API响应变慢等问题,提升Gen AI应用推理与构建时的用户体验。

在数据高可靠方面,阿里云数据存储与数据库服务面向不同计算引擎、多种 AI 框架进行了深度集成,形成承载PB级甚至EB级大规模数据统一的存储底座,同城冗余容灾,高达99.995% SLA,数据多副本冗余、大文件断点续传、批量和多线程数据操作保障数据服务高可靠,向上支撑面向单AZ, 双AZ, 三AZ及跨Region的高可用服务,跨Region AI数据的就近读写和负载均衡,满足AI数据多活的强一致性,AI数据冷备、热备、故障自动切换,解决AI数据故障风险。

AI时代与用户共建云上的IT新治理

AI时代的浪潮中,企业对于高可用架构的需求不仅仅停留在节点的稳定性上,而是在更高的层面追求智能化运营。阿里云全栈AI负载的高可用架构已为企业奠定了坚实的技术基础,而进一步的挑战则在于如何提升云上系统的运维管理与治理能力。通过与用户携手,阿里云致力于在云环境中构建一个AI-Native的智能化、自动化和可持续的IT治理体系,为企业的创新之路保驾护航。

阿里云根据多年服务客户的经验总结为一系列的方法论和架构设计原则,推出了阿里云卓越架构 Well-Architeched Framework,意在帮助企业在云上构建一个安全、稳定、高效的应用环境。面向AI技术融入带来的更复杂更大规模的,根据云计算的弹性、实时交付、自助化等特点,阿里云卓越架构进一步升级了用云企业运维管理和治理规则基线的最佳实践,依靠Well-Architeched云卓越架构来学习-度量-优化,落地治理潜在的风险隐患,从安全、稳定、效率、成本、性能五大支柱全面提升系统整体韧性和运营效率。

48.png

阿里云开放平台负责人何登成表示,“在云上构建可靠的系统是云厂商与用户共同的责任。云厂商负责提供云平台的可靠性,确保提供的云服务可用性符合或超过阿里云服务等级协议;用户需要根据业务需求,选择合适的产品服务,并根据云相关文档的指导搭建高可用架构,来确保云上应用的可靠性。”

49.jpg

尤其在AI迅猛发展的今天,企业更应让业务系统利用现代云平台的基础设施达到高可用,总结成三个"面向":面向失败的设计架构,面向精细的运维管控,面向风险的应急快恢。同时,用户可以在建设持续稳定的云环境过程中,面向AI并结合AI,通过良好的AI模型训推架构设计、AI数据资产处理与存储、智能诊断与风险预测等手段,进一步提升系统可用性、可靠性、可持续性。

阿里云获信通院企业用云治理能力成熟度评估最高等级 

据信通院发布的《企业用云治理能力成熟度分级要求》,企业用云治理能力成熟度评估共分为L1-L5共5个等级,分别为L1基础级、L2应用级、L3优秀级、L4先进级、L5卓越级。该分级要求不仅适用于对云服务使用方用云治理能力成熟度进行评估,也适用于对云服务提供商云服务治理产品、技术能力成熟度进行评估。阿里云测评结果为L4+,是目前阶段云服务提供商实际获得的最高等级。

此前,阿里云企业用云治理能力曾两度获得信通院评测认可,包括2022年“企业云治理能力成熟度模型”获信通院科技治理领域年度明星解决方案及产品;2023年“云治理中心”获信通院科技治理领域年度明星解决方案。

50.png

今年,针对企业用云发展路径、企业云治理发展趋势分析与洞察,阿里云联合埃森哲发布《云治理企业成熟度发展2024年度报告》(https://developer.aliyun.com/ebook/8419),报告调研取样来自400多家企业客户,横跨互联网、金融、新零售、交通等多个行业,旨在帮助用户理解云治理概念、企业用云实践的现状及变迁趋势,并基于云治理框架的五大分类(即稳定性、安全合规、成本效益、高效性能、卓越运营),报告作为企业云上旅程的实践样本,为面向AI时代做好IT新治理和云上架构优化提供更多的参考与决策依据。

(完)


猜你喜欢

选对现货黄金平台:六大现货黄金投资平台实测盘点,新手老手都适用

金融科技黄金交易平台

投资黄金只要认准几个关键点,就能稳定交易,安全投资。本文将教您如何快速甄选炒现货黄金平台,并通过实测...

2天前

2026年十大投资软件排名:AI 原生重构行业生态,全链路赋能投资决策

金融科技投资软件

 根据易观千帆 2026 年 3 月发布的证券行业 APP 运营数据,国内证券服务类 APP 月活跃...

2天前

国内贵金属交易所前十正规会员平台综合排名(2026榜单一览)

金融科技贵金属交易平台

2026年,全球贵金属市场在通胀波动、地缘风险与央行持续购金的共振下,热度持续攀升,黄金、白银等资产...

2天前

全球前十知名贵金属投资平台排行榜:2026版综合

金融科技贵金属投资平台

2026年,全球经济与地缘格局持续震荡,央行购金潮不退、美元波动加剧,贵金属作为“压舱石”的配置价值...

2天前

伦敦金投资平台大起底:哪些平台安全又靠谱?

金融科技伦敦金投资平台

伦敦金作为全球主流避险资产,凭借高流动性与24小时交易优势,成为投资者配置热点。

2天前

香港前十顶尖外盘期货交易平台独家排名2026版

金融科技外盘期货交易平台

外盘期货是指在境外的交易所上交易的期货合约。

2025-12-17

现货黄金投资哪家正规?2026个人如何选正规现货黄金交易平台

金融科技黄金交易平台

现货黄金是全球性市场,支持24小时不间断交易,具有高度流动性和透明度。

2025-12-17

手机版mt5软件怎么下载?安卓+IOS下载攻略最全版!

金融科技mt5

作为贵金属交易的“专业利器”,MT5软件凭借38种技术指标、多资产交易支持、自动化交易功能,成为百万...

2025-12-17

利好!上海泷姝信息技术有限公司再获200万元A轮融资!

创新创业泷姝信息技术

简讯,上海泷姝信息技术有限公司(简称:泷姝信息技术)于12月17日再获200万元A轮融资!

2025-12-17

上海简路实业有限公司再获200万元A轮融资

创新创业简路实业

上海简路实业有限公司(简称:简路实业)于12月17日获得200万元A轮融资!!

2025-12-17

微众银行绿色普惠贷款模型成功入选深圳金融科技创新监管工具

金融科技微众银行

近日,微众银行与盟浪可持续数字科技(深圳)有限责任公司共同研发的“基于大数据技术的绿色普惠信贷服务”...

2025-12-17

平安融易宿迁分公司:“资”持绿色环保转型,绿植种植户焕发新生机

金融科技平安融易

江苏省宿迁市耿车镇,曾经以废塑料产业闻名,如今正经历着翻天覆地的变化,一场从“污染”到“绿意”的产业...

2025-12-17

泰康人寿1218财富节火热开启,四大专业财富规划方案盛启新篇章

金融科技泰康人寿

岁末将至,财富焕新。泰康人寿1218财富节盛大启幕,献礼集团成立三十周年,本次财富节以“宜爱宜发,财...

2025-12-17

原创

筑牢反洗钱防线 守护金融安全,民生北分积极开展新《反洗钱法》系列宣教活动

金融科技民生银行

在国家金融安全体系现代化建设的关键时期,新修订的《中华人民共和国反洗钱法》(以下简称新《反洗钱法》)...

2025-12-17

秋冬眼周护理大作战,hfp冷玛吉眼油守护你的年龄秘密

大消费hfp

都说眼睛是心灵的窗户,但脸部的衰老往往也从眼周开始显露,影响了别人对你的第一印象。

2025-12-17

投资家网(www.investorscn.com)是国内领先的资本与产业创新综合服务平台。为活跃于中国市场的VC/PE、上市公司、创业企业、地方政府等提供专业的第三方信息服务,包括行业媒体、智库服务、会议服务及生态服务。长按右侧二维码添加"投资哥"可与小编深入交流,并可加入微信群参与官方活动,赶快行动吧。

ATFX:阿联酋突然退群背后:全球油价正被三重力量主导

ATFX:阿联酋突然宣布退出欧佩克,令其盟友措手不及。在加入欧佩克六十年后,阿联酋决定于下个月正式退...

精微视达完成新一轮超亿元融资,国产高端内镜领跑精准诊疗全球前沿

精微视达完成新一轮超亿元融资,国产高端内镜领跑精准诊疗全球前沿

优选空天科工在阿联酋设立总部,正式进入中东市场

中东已成为中国一些知名公司的投资热土。

第20届中国投资年会圆满闭幕!K型曲线下,寻找穿越分化的确定性

第20届中国投资年会圆满闭幕!K型曲线下,寻找穿越分化的确定性

2026年4月22日至24日,第20届中国投资年会·年度峰会于北京海淀盛大召开

第四届中国研究生金融科技创新大赛在南京收官

第四届中国研究生金融科技创新大赛在南京收官

12月28日,第四届中国研究生金融科技创新大赛在南京落幕。

京杭对话:杭州,凭什么吸引北京创新企业?

京杭对话:杭州,凭什么吸引北京创新企业?

从一张精准的产业蓝图,到一个敏捷的创新操作系统,再到一片丰沃的赋能土壤,杭州的生产性服务业正在这条路...

第19届中国投资年会·有限合伙人峰会在沪成功举办

第19届中国投资年会·有限合伙人峰会在沪成功举办

11月27日,由投中信息和投中网主办的第19届中国投资年会·有限合伙人峰会在上海举办。

“京杭聚势,共启新篇”:招商新路径,奏响区域协同发展强音

“京杭聚势,共启新篇”:招商新路径,奏响区域协同发展强音

在区域经济协同发展的大背景下,京杭两地的经济协作正以一种全新的姿态加速推进。