一个AI智能体正在多轮对话中调用工具、执行代码、从错误中自我恢复——它在学习如何像人类一样连续思考。与此同时,50TB的电视档案被锁在一家数据中心的机柜里,它的主人既无法访问也无法备份,因为云存储提供商已经“人间蒸发”。
这两件事在同一天发生了。它们看似毫无关联,却共同指向同一个问题:当整个AI产业疯狂堆砌智能体层的每一块砖时,云基础设施本身的可靠性正在被系统性忽视。
当AWS给AI装上“大脑”
2026年8月,AWS在AI智能体基础设施上连续放出重磅更新。
首先是Amazon Nova Forge的多轮强化学习自定义奖励函数功能正式公开。在这篇由AWS机器学习团队发布的深度技术文章中,详细展示了如何为Nova Forge设计复合多轮奖励函数,通过Group Relative Policy Optimization(GRPO)算法在智能体工作流中训练模型。Nova Forge的“自带编排”(Bring Your Own Orchestration,BYOO)能力,让客户可以在自己的环境中运行奖励逻辑,协调多轮对话、消息传递和状态管理。
“在强化学习中,一个微妙的错误奖励函数可以悄悄教会模型错误的行为,而每个训练曲线看起来都完全正常。”——AWS官方博客
本质上,AWS正在为AI智能体打造一个“大脑训练营”。Nova Forge支持的奖励函数场景包括:物理模拟器评估机器人动作、复杂代码正确性验证、企业内部系统嵌套工具调用。这些都不是简单的“对错”判断,而是需要在多步交互中累积评估。
与此同时,Amazon SageMaker AI推出了Agent-guided Workflows,内置9个预构建的Agent Skills,覆盖从用例定义、数据准备、微调技术选择、评估到部署的完整生命周期。开发者只需要用自然语言描述需求,AI编码代理就会自动激活相关技能,生成可运行的代码。AWS官方称,这可以将过去数月的模型定制流程压缩到“几天甚至几小时”。
而Amazon Bedrock AgentCore则提供了生产级的智能体托管平台——无服务器自动扩缩、情景记忆、自然语言策略引擎,让企业从“用AI做实验”过渡到“用AI做生产”。
AWS在智能体基础设施上的投入,用“不遗余力”来形容都算保守。
当你的数据被“锁”在云里
但就在同一天,另一条消息从Ars Technica传出。
圣路易斯PBS电视台Nine PBS于7月28日向丹佛地方法院提起诉讼,起诉数据中心运营商Iron Mountain,要求取回被锁在丹佛数据中心的50TB数据。这批数据包含了该电视台70年来的电视节目、新闻档案和历史资料——包括新冠疫情报道、东圣路易斯历史档案、1993年大洪水的记录,以及超过11000个独立文件。Nine PBS在诉讼中称,这些数据“大部分是独一无二且不可替代的”。
故事要从2019年说起。Nine PBS选择了Open Source Storage(OSS)作为云存储服务商。2026年3月6日,合同到期。在此之前,Nine PBS尝试联系OSS续约,没有得到任何回应。当合同到期时,它发现自己的数据访问权限被立即切断,而合同中明明规定有30天的数据取回期。
随后它发现,OSS已经停止运营。科罗拉多州务卿的记录显示,OSS成立于2021年,目前状态为“逾期未缴”。OSS资产的新拥有者James Tramel告诉Nine PBS,他“被欺诈性地收购了”这家公司,随后也不再回复任何消息。
Nine PBS的50TB数据,就这样被锁在了Iron Mountain位于丹佛的数据中心里。
Iron Mountain的回应很直接:它只提供物理基础设施——建筑、网络、电力、环境控制。“我们无法访问硬件/服务器上的数据,因为它们属于客户。”如果没有法院命令,它无法将数据交给Nine PBS,因为这会违反与OSS的合同,并可能暴露其他OSS客户的数据。
8月,一名法官做出裁决:Iron Mountain必须在30天内交出存有数据的物理设备,Nine PBS必须找到一名第三方(如前OSS员工)来协助取回数据。Nine PBS已经联系到了一名前OSS员工“愿意帮忙”。但如果数据是加密的,还需要再次开庭。
一个电视台70年的历史,被锁在一个没人能打开的机柜里,靠一场官司才勉强看到一线生机。
智能体越“聪明”,依赖越“致命”
把AWS的AI智能体推进和Nine PBS的数据灾难放在一起看,会发现一个共同的底层结构:云的每一层都在制造新的依赖,但几乎没有人对这些依赖的可靠性负责。
Nine PBS的遭遇揭示了一个残酷的事实:它的数据从来没丢过。OSS没有删除数据,Iron Mountain没有损坏数据。但数据就是取不回来。因为“拥有”和“访问”之间,隔着一层又一层的关卡:OSS拥有服务合同,Iron Mountain拥有物理设备,设备和数据之间还有可能存在加密。每一层都是一个可能断裂的链条。
当企业使用Nova Forge训练智能体时,它依赖的是AWS的底层基础设施——训练集群、GPU资源、网络、存储。如果其中任何一环出现问题,训练可能中断,模型迭代可能丢失。AWS的SLA通常覆盖基础设施可用性,但很少覆盖“我的模型训练到一半因为你的上游依赖挂了而失败”这种场景。
当企业通过Bedrock AgentCore部署生产级智能体时,它的智能体依赖的是AgentCore的运行时环境、记忆服务、策略引擎。如果这些组件中的任何一个出现故障,或者更极端的情况——AWS决定停用某个版本,企业的智能体应用会怎样?
这不是杞人忧天。2026年,亚马逊宣布Bedrock Agents Classic将于7月30日起不再对新客户开放,现有客户被要求迁移到AgentCore。产品迭代是正常的,但每一次迁移都是一次依赖关系的重构。
谁在为“智能”买单,谁在为“可靠性”买单
这引出了一个更深层的问题:AI产业的估值逻辑,正在系统性低估可靠性的价值。
AWS的Nova Forge和Bedrock AgentCore的目标客户是大型企业,他们有专门的IT团队、有冗余架构、有数据备份策略。AWS的职责是让产品足够好,而不是确保客户不会把所有的鸡蛋放进一个篮子里。
但对于中长尾企业——正在用AgentCore搭建客服智能体的电商公司、正在用SageMaker AI微调模型的初创团队——这个问题是致命的。他们没有Nine PBS那样70年的历史档案需要保护,但他们有核心业务数据。如果他们的云提供商明天关停,他们能取回数据吗?
Nine PBS的教训是:如果它保留了本地备份,根本不需要打官司。当被问及是否有备份时,Nine PBS没有回答。
Tom's Hardware的评论一针见血:“如果这家机构买了一台价值1000美元的NAS,塞几块硬盘进去,这一切都不会发生。”
这听起来残酷,但逻辑是对的。在云计算时代,3-2-1备份原则——至少3份数据、2种介质、1份异地——从来没有过时。它只是被“云存储很便宜”“云服务商很可靠”的叙事掩盖了。
AI产业正在教模型学会多轮对话,但太多企业连数据的最后一轮取回都没学会。当你的智能体学会了在复杂场景中连续推理,你的数据却连一次完整的取回都做不到。这才是2026年最值得警惕的“智能悖论”。






快报