AWS算力饥荒:65%的EC2在空转,AI却无卡可用

2026.08.07 23:49
2026年8月7日,AWS被曝出向全球工程团队下达指令:关停长期闲置的EC2实例。当前约65%的EC2实例30天内平均CPU利用率低于20%,而AI训练与推理正以前所未有的速度吞噬算力。本文揭示了这场算力饥荒背后的结构性矛盾——当通用CPU算力过剩与AI专用算力紧缺同时存在,云计算二十年卖闲置空间的商业模式正在被AI改写。

一名在亚马逊云科技(AWS)供职多年的工程师,最近遭遇了一件职业生涯中从未见过的事。

申请几台CPU服务器用于内部研发,过去只需要几小时就能获批的请求,现在要等上好几天。项目交付日期一推再推,他的团队开始怀疑:这家掌管全球最大云计算基础设施的公司,是不是自己也快没算力了?

答案是:是的,AWS的算力确实不够用了。但不是因为服务器太少,而是因为太多服务器在空转,而真正吃算力的AI业务,已经把整个数据中心的资源分配逻辑彻底打乱。

65%的EC2在吃灰,AWS却要求工程师关机器

8月7日,AWS被曝出向全球工程团队下达了一项内部指令:关停长期闲置的EC2云服务器实例,腾挪算力资源。据一位知情会议参与者透露,AWS管理层早在今年5月就与工程师召开了闭门会议,传递出一则严峻指令,为保障EC2业务未来能为全部客户提供充足算力,工程师必须想尽一切办法节约资源。

这不是一个孤立的小动作。AWS为此升级了Compute Optimizer工具,自动标记那些在14天内峰值CPU利用率低于15%且网络流量极低的虚拟机。背后是一组触目惊心的数据:当前约65%的EC2实例在30天内的平均CPU利用率低于20%。

65%。这是AWS历史上首次对外披露如此大规模的算力浪费。

但更值得追问的是:既然有65%的算力在空转,为什么AWS还会缺算力?

答案在于算力结构的分化。过去数十年,互联网产业的所有应用都跑在通用CPU芯片上。AWS的商业模式本质上就是“出租闲置的CPU机房空间”,自家数据中心用不完的服务器,按小时计费租给客户。这个模型运转了二十年,完美且高效。

但AI改变了这一切。

AI训练依赖GPU,AI推理同样需要GPU。英伟达的GPU在过去两年成为全球最稀缺的科技硬件。而随着AI智能体、AI应用的爆发式增长,就连传统的CPU服务器也开始告急。英特尔CEO谭仲明在4月财报电话会上透露,当时AI推理场景中CPU与GPU算力配比为1:4;到7月,英特尔CFO大卫·津斯纳称二者配比已接近1:1。AMD、Arm高管也给出了类似判断。

这意味着什么?AI推理正在以前所未有的速度吞噬CPU算力。而CPU,恰恰是云计算最核心的“水电煤”。

算力饥荒从GPU蔓延到CPU:一场没有预警的供应链危机

AWS的算力荒并非孤例。它正在席卷整个科技行业。

今年4月,谷歌被曝成立了一个高管专项委员会,专门统筹分配谷歌云、DeepMind人工智能实验室和C端业务三大板块的算力资源。但即便如此,各方算力争夺矛盾依旧突出。据报道,今夏谷歌顶尖AI研究员诺姆·沙泽尔便因算力资源受限、研发受阻而离职。

微软则走了一条截然不同的路。微软CFO艾米·胡德在上月财报电话会上直言,Azure云服务业绩增长,部分得益于团队对CPU、GPU算力集群的高效调度优化。她说:“本季度工程团队在算力盘活上成效显著。受供需失衡大环境影响,只要我们提升算力使用效率,新增的可用资源就能快速变现创收。”

这场算力饥荒的传播路径清晰可见:先是GPU告急,企业不得不提前数月锁定产能;然后GPU短缺倒逼企业转向CPU做推理,CPU需求随之暴涨;CPU服务器需要配套内存芯片,内存产能同样不足;服务器要放进数据中心,但物理机柜空间和电力容量有限。每一个环节都在层层加码。

AWS的应对是双管齐下。一边疯狂扩建基础设施,过去一年新增了3.8吉瓦的数据中心电力容量,是近年来最快增速。亚马逊CFO布莱恩·奥尔萨夫斯基在Q3电话会上透露,2025年资本开支已从1000亿美元上调至1250亿美元,2026年还将更高。另一边,AWS开始从内部“抠”算力,给各团队设定了今年下半年前完成算力压降的期限。

关停闲置EC2实例只是第一步。AWS还给出了明确的优化标准:若某台EC2服务器连续四周CPU、内存平均使用率不足40%,建议降级更换更小规格实例。

但这对内部工程师来说并不轻松。那名在AWS任职多年的工程师说,以往几小时就能获批的服务器算力,现在要等上好几天,极易导致项目无法按期交付。“我从未遭遇如此漫长的资源排期。”

AI推理:正在吞噬一切的“隐形算力黑洞”

这场算力饥荒的根源,比大多数人想象的更深。

金融AI服务商埃伦迪尔实验室联合创始人谢静分析,越来越多员工借助AI智能体开发软件,企业CPU消耗量随之激增。她接触到的客户企业,员工人均IT开支直接翻倍,大量工作交由AI智能体处理,需要采购更多云端算力,而这类任务普遍依赖CPU。

即便在AI模型研发流程中,CPU也承担着关键工作:训练模型前预处理数据时,需要CPU读取文档、图片、视频等原始素材。她说:“当下绝大多数模型开发、生成与运行任务,对CPU的需求量远高于以往。”

但真正的算力黑洞,是AI推理。

高盛研究预测,到2030年,全球数据中心电力需求将比2023年增长165%。而推理正在取代训练,成为AI算力需求的最大来源。据行业数据,到2026年底,推理将占全球AI算力需求的三分之二。

原因很简单:训练是“一次性”的,一个模型训练几个月,消耗再大也是有限的。推理是“持续性”的,一个ChatGPT级别的产品每天处理数亿次查询。当越来越多的AI应用、Agent、智能体开始7x24小时不间断运行,推理的算力消耗以指数级膨胀。

这带来了一个经济学上的经典悖论。150年前,瓦特改良了蒸汽机,煤的利用效率大幅提升,按理说该省下不少煤了。结果恰恰相反,因为成本降了,所有工厂都在疯狂上马蒸汽机,最后整个英国的煤炭消耗量反而原地爆炸。

今天的AI算力消耗,正在一分不差地复刻这个剧本。效率越高,单价越低,总消耗反而越大。

云计算的“闲置经济学”走到头了

2006年,亚马逊推出AWS时,逻辑很朴素:自家数据中心有大量闲置服务器,与其让它们吃灰,不如按小时租出去。这个“出租仓库空余货架”的生意,在接下来二十年里把全球IT行业的基础设施翻了个底朝天。

据统计,AWS在过去二十年里累计主动降价至少161次。阿里云、腾讯云们更是把“降价”当成了一年几度的狂欢节。这种连续多年近乎“自残”的定价策略,把全球IT基础设施的成本硬生生砸出了一个深坑。

但AI正在终结这个模式。

原因很简单:当算力供不应求时,降价就失去了商业逻辑。2026年,腾讯云部分大模型API价格涨幅超过400%,多家云厂商跟进。这不是短期波动,这是云计算二十年价格战终结的信号弹。

更深层的变化在于,云计算的核心商业模式正在从“卖闲置空间”转向“卖稀缺资源”。当算力从“水电煤”变成“珍稀矿产”,定价权就从买家手中回到了卖家手中。

AWS的声明试图淡化这一转变。官方回应称:“即便需求持续高涨,我们仍能满足绝大多数内外部客户的算力需求。我们始终协同内部团队保障其算力供给,同时督促团队高效使用EC2资源,该管理方针从未改变。”AWS强调,内部工程师优化资源的准则与面向外部客户的建议完全一致。

但数据不会说谎。一名AWS行业咨询顾问透露,客户通过合约锁定的预留CPU算力暂未出现供给缺口,但近几个月大批量申领AWS竞价实例,厂商以低价售卖闲置富余算力、可提前两分钟回收资源,其难度明显上升。当云厂商连“边角料”算力都舍不得低价出售时,供给侧的压力已经到了临界点。

谁会赢,谁会输?

这场算力饥荒正在重塑云计算产业的竞争格局。

对于AWS、微软Azure、谷歌云三大巨头来说,算力短缺既是危机也是壁垒。拥有最多基础设施、最强芯片自研能力、最大电力合约的玩家,将在这场短缺中率先突围。AWS的自研芯片Trainium已是一个“数十亿美元级别的业务”,季度环比增长150%。Trainium3预计2025年底预览,2026年初大规模量产。

对于中小云厂商和AI初创公司,算力荒意味着更高的成本和更慢的扩张速度。竞价实例被挤占、预留实例涨价、新机型发布延迟,这些都会成为制约它们增长的实际瓶颈。

对于企业客户,一个更紧迫的问题摆在面前:云计算的“免费午餐”结束了。过去二十年,企业习惯了每年等着云厂商降价。但未来,算力定价将更多反映供需关系而非规模效应。企业的算力成本管理将从“粗放式”走向“精细化”,关停闲置实例、优化实例规格、利用Spot实例、使用自动扩缩容,这些实操动作将直接决定企业的IT成本竞争力。

AWS要求工程师关停闲置EC2,这个动作本身并不惊天动地。但它揭示了一个正在发生的结构性变化:云计算从“卖不完的库存”变成了“不够分的稀缺品”。

65%的EC2在空转,但AI还是抢不到算力。这不是资源总量的问题,而是资源结构的问题。当通用CPU算力过剩与AI专用算力紧缺同时存在,云计算行业面临的不只是调度优化,而是商业逻辑的根本重构。

二十年前,AWS用一个“出租闲置货架”的创意改变了世界。二十年后,AI正在让这个创意变得不再成立。

云计算的下一个二十年,从“学会关掉闲置机器”开始。

作品声明:内容由AI生成