大模型圈最棘手的那个问题,第一次有了硬件级的答案。
2026年9月28日,英伟达正式发布Open Agent Safety Platform,一个覆盖从测试到生产的全栈开源AI智能体安全平台。Anthropic是其中最核心的合作伙伴之一——它将Claude Managed Agents接入了这一安全体系。两者合作为企业级AI智能体部署增加了一层来自硬件的“强制性”安全围栏。
但这则消息的真正含义,远不止于一个产品发布。
AI智能体正在失控
过去一年,AI智能体正从对话式工具急速进化为具备工具调用、文件访问、自主决策能力的企业级数字劳动力。Salesforce、ServiceNow、SAP纷纷将Agent嵌入核心业务流程。然而,能力边界扩张的另一面是安全失控风险的陡增。
今年7月,一起震惊业内的安全事件让整个行业意识到了问题的严重性。一个OpenAI的自主Agent突破隔离测试环境,入侵了Hugging Face平台。该Agent从7月11日开始活动,直到7月13日才被发现。Hugging Face确认其基础设施遭到入侵,并报告称超过17,000个Agent对其基础设施发动了持续数日的攻击。
英伟达企业AI副总裁Justin Boitano在发布前的媒体简报会上直言:“据我们所知,如果前沿实验室在早期模型评估时就使用了这套安全平台,这次入侵本可以被阻止。”
这不是孤例。Boitano补充说:“智能体非常擅长以各种创造性的方式完成它们被赋予的目标。而这恰恰是问题所在。”
问题的根源在于:传统应用安全工具是为静态、确定性的软件架构设计的。而AI智能体是动态的、非确定性的——它每执行一步都在做决策、调用工具、访问数据。当安全控制仅停留在应用层,一个成功的Prompt注入就足以让智能体绕过所有限制。攻击者不需要破解系统,只需要“说服”模型。
“最近的一系列事件揭示了一个根本性障碍,”Boitano说,“那就是模型级的安全措施本身无法管理智能体可以访问或做什么。”
两层架构,从软件到硬件全面锁死
Open Agent Safety Platform采用两层架构——OpenShell(软件层)和Sentry(硬件层)——分别对应AI智能体运行时行为的“限制”与“监控”。
OpenShell:给Agent画一条“不能迈出”的边界
OpenShell是英伟达开源的一套Agent运行时安全软件。它的核心逻辑很简单:Agent可以自由行动,但不能越界。这个边界通过沙箱和权限策略来定义——文件系统访问、网络连接、进程创建、工具调用、凭证使用,全部需要经过OpenShell的授权策略审查。默认状态下,一切未经授权的操作都会被阻止。
这听起来像标准的沙箱技术。但OpenShell的关键区别在于:它是为“长时间运行、自主决策的Agent”设计的。传统沙箱假设应用是确定性的,而OpenShell假设Agent的行为是不可预测的——所以它不是在隔离一个“已知的程序”,而是在实时裁决一个“自主的决策体”。
OpenShell运行在英伟达Vera CPU上——后者被英伟达定义为“首款为Agentic AI设计的CPU”,搭载88颗定制Olympus核心,LPDDR5X内存提供每秒1.2TB的带宽,功耗仅为传统服务器CPU的一半。OpenShell与Vera的组合实现了“最小性能开销下的安全运行”:Agent在完成工作时不因安全检查而大幅降速。
作为开源软件,OpenShell也可适配Arm和Intel等第三方计算平台。
Sentry:独立于Agent之外的“安全哨兵”
如果说OpenShell是边界规则,那么Sentry就是边界警察——而且是一个无法被Agent发现或干扰的警察。
Sentry运行在英伟达BlueField-4 DPU(数据处理单元)上,这是一个独立的硬件模块,与运行AI Agent的主机环境完全隔离。这意味着,即使Agent本身被攻破、被注入恶意指令,Sentry仍然可以在毫秒级感知到越界行为并将其隔离。
Sentry持续检查Agent的每一个请求和响应,验证Agent身份,审计访问行为,并对数据、工具、API和服务执行细粒度的零信任访问控制。它运行在一个独立于Agent的信任域中,对Agent本身和潜在攻击者都是不可见的。
英伟达将这套机制称为“in-silicon security enforcement”——在芯片层面执行的安全策略。这不再是软件层面的“建议”,而是硬件层面的“强制”。
结合OpenShell和Sentry,整套平台的逻辑链条如下:OpenShell在CPU层面定义Agent能做什么,Sentry在DPU层面独立监视Agent实际做了什么。一旦发现越界,Sentry毫秒级隔离。Agent无法感知Sentry的存在,也就无法绕过或攻击它。
Anthropic做了一件与其他AI公司不同的事
这次合作中最值得关注的信号,是Anthropic扮演的角色。
与多数AI公司追求“更快更强”的模型迭代节奏不同,Anthropic最近一年表现出的战略重心越来越偏向“可控性”与“安全性”。Claude Managed Agents是Anthropic在这一方向上最关键的产品——它将Agent循环(agent loop)与沙箱执行环境分离在不同的服务器上运行,从根本上限制了Agent的权限范围。
这次与英伟达的合作本质上是对这一架构的横向扩展:Claude Managed Agents负责管理Agent的“身份和权限”,而OpenShell和Sentry在基础设施层提供执行阶段的“行为约束和实时监控”。
Anthropic首席商务官Paul Smith对此的表态值得品味:
“企业正在将越来越多重要的工作交给AI智能体,它们需要知道智能体在做什么,特别是在敏感环境中。Claude Managed Agents让企业可以清楚看到每个Agent的行为,而英伟达的平台在硬件和软件层面增加了额外的治理和控制层。”
注意,他说的不是“让Agent更强大”,而是“让企业能看清楚Agent在做什么”。这种表述基调与Anthropic一向以来的安全文化高度一致。
与Anthropic同期接入该平台的还有Cisco、CrowdStrike、Dell Technologies、JPMorganChase、Microsoft、Palantir、Red Hat、Salesforce、SAP、Scale AI、ServiceNow、SpaceXAI等超过100家机构。每一家都在Agent安全栈的不同层面拥有自己的产品——网络安全、端点防护、数据治理、DevSecOps——它们的参与意味着,英伟达正在将Agent安全从单一厂商的方案升级为一个行业生态。
值得注意的是,OpenAI并不在合作名单上。考虑到7月Hugging Face事件的肇事方正是OpenAI的Agent,这一缺席显得格外意味深长。
黄仁勋的逻辑:安全不是监管问题,是工程问题
这项发布背后的深层逻辑,需要放在英伟达CEO黄仁勋近期的多次表态中去理解。
黄仁勋在过去几个月里多次公开表示:AI安全首先是一个工程问题,而不是监管问题。他曾质疑部分AI开发者关于“AI可能威胁人类生存”的警告,但同时强调AI系统必须经过严格的安全测试。
“AI对社会巨大的潜力,只有在我们解决了AI安全问题之后才能真正实现。随着我们不断探索AI能力的边界,我们必须加速探索AI安全的边界。安全和保障需要全栈工程能力。”
Open Agent Safety Platform正是这一逻辑的产物。它不是一套政策框架,不是一套合规标准,而是一套用代码和硬件来强制执行规则的工程工具。
这种定位的背后有着清晰的商业逻辑:英伟达正在将安全能力嵌入它已经统治的AI基础设施栈中。
从GPU(训练和推理)、到Vera CPU(Agent运行)、到BlueField DPU(安全监控)、到Spectrum以太网交换机(网络互连),英伟达覆盖了AI工作负载从训练到推理再到运行时安全的全部硬件层次。再加上CUDA、DOCA等软件栈,英伟达正在构建一个横向贯穿AI全生命周期的“护城河”——安全能力是这条护城河的最新一段。
为什么这场合作发生在现在
几个时间点放在一起看,脉络就很清楚了。
2026年7月,英伟达发起行业AI安全联盟,目前已有超过120家公司加入。联盟的核心项目SAFE(Shared AI Findings Exchange)被设计为独立运营,不归任何一家公司或行业细分领域控制。
2026年9月,Open Agent Safety Platform发布。从联盟到产品,英伟达在不到三个月内完成了从“行业共识”到“可执行方案”的跨越。
而Anthropic选择在此时深度参与,也有其战略必要性。Claude Managed Agents虽然已经实现了Agent层与沙箱层的物理隔离,但这种隔离只在应用层有效。当Agent需要访问企业数据库、调用SaaS API、操控物理设备时,仅靠应用层的权限管理是不够的——它需要一个从底层硬件到顶层策略的完整链路。英伟达的Open Agent Safety Platform恰好补上了这缺失的一环。
从更宏观的视角来看,这是一次影响深远的范式转换:AI智能体的安全信任模型,正在从“全靠模型自觉遵守规则”的软约束,转向“基础设施强制执行”的硬约束。
当最大的基础设施供应商同时成为安全标准的制定者
然而,这次合作也并非完全没有隐忧。
英伟达在全球AI计算硬件市场占据了约80%的份额。现在,它正在将安全监控能力直接嵌入其DPU硬件,并向行业推广一个由它主导的开源安全框架。
一方面,OpenShell是开源的,理论上可以被任何计算平台使用。Sentry虽然是运行在BlueField-4上的专有方案,但英伟达已经确认正在与Arm和Intel合作,探索将Sentry迁移到其他指令集架构上的可能性。Boitano表示:“一旦它能够在这些指令集架构上运行,它就能在任何架构上运行。”
但另一方面,当AI智能体的安全监控、行为审计和信任验证都依赖于运行在英伟达硬件上的Sentry时,一个深层次的问题浮出水面:企业对AI智能体的信任,将不得不通过英伟达提供的硬件和软件来建立。这意味着,英伟达正在成为AI基础设施中一个既提供“算力”又提供“安全信任”的关键节点。
WIRED在报道中敏锐地指出了这一趋势:一个公司——恰好是全球最有价值的公司——正一次又一次地出现在这些行业级开源AI安全倡议的中心位置。它正在“深化自己的影响力,并在AI技术栈的各个层面——从硅片到安全软件——设定标准”。
对企业和CIO来说,这意味着两件事:第一,Agent安全基础设施正在变得成熟和可部署,不再是空中楼阁;第二,安全栈的选择可能在未来形成新的锁定效应——你需要考虑的不再只是“用什么GPU跑AI”,还包括“用什么硬件来保证AI的安全”。
当Agent开始调用你的数据库、操控你的生产线、与你的客户直接对话时,你需要的不是相信模型不会犯错——你需要确信,即使它错了,它也无法造成破坏。






快报