谷歌联合新加坡安全研究所,全球首个AI双盲评估上线

2026.08.27 21:37
2026年8月27日,谷歌联合新加坡人工智能安全研究所,推出全球首个针对前沿专有AI模型的双盲评估方案。依托Confidential Space加密环境实现评估方与模型方双向隐私隔离,旨在杜绝基准污染,让模型评估从自证清白走向可验证的公信力。

当行业还在疯狂卷Benchmark分数时,有人决定先把考官和考生关进两个不同的房间。

2026年8月27日,谷歌联合新加坡人工智能安全研究所(Singapore AI Safety Institute),推出全球首个针对前沿专有AI模型的双盲评估方案。这套机制的技术底座是谷歌云Confidential Space——一个基于机密计算的加密执行环境。评估方无法访问模型的权重和内部参数,谷歌也无法获知评估方提交的测试提示词。双向隔离,互不可见。

翻译成人话:考官不知道自己在考谁,考生也看不到考卷。

这在临床试验领域是几十年来的黄金标准——双盲试验。但在AI行业,尤其是前沿专有模型的第三方评估中,这还是头一回。

AI行业的公开秘密

要理解谷歌为什么做这件事,必须先搞清楚一个被行业心照不宣的问题:基准污染(Benchmark Contamination)。

所谓基准污染,指的是模型的训练数据中混入了测试集的内容。这不是什么边缘漏洞——GPT-3的论文(Brown et al., 2020)就明确承认,多个基准测试的污染程度部分超过90%。GPT-4技术报告也坦承,BIG-bench的部分内容不慎混入了训练集,导致OpenAI最终不得不放弃在这个基准上报告结果。

更令人吃惊的是后续研究:学者们设计了一种猜题测试——把MMLU测试题的答案选项遮盖掉,让模型去猜。结果GPT-4的精准匹配率达到57%,ChatGPT达到52%。在随机概率仅有约25%的情况下,这个数字是强有力的证据——模型在训练阶段就已经见过这些题目。

拿教育来打比方:这就像一场高考,但考生提前一个月拿到了标准答案。你考的不是能力,是记忆力。

行业对这种污染并非没有意识。多个开源评测框架试图通过定期换题来缓解。但问题在于,前沿专有模型(Proprietary Model)的评估面临一个结构性悖论:

如果评测方看不到模型参数,就无法确定测试结果是否真的反映真实能力——因为模型可能在训练时已经见过题目。如果评测方看到了模型参数,商业机密和知识产权面临泄露风险。

信任,在这里出现了一条裂缝。

Confidential Space:不是加密,是信任架构

谷歌选择用Confidential Space来填补这条裂缝,不是偶然。

Confidential Space是谷歌云机密计算产品线的核心组件。它的名字里有Space,但它不是空间,而是一种运行时环境——在硬件层面(基于AMD EPYC或Intel TDX)对数据进行加密,确保即使在云服务商内部,未经授权的人员也无法读取内存中的数据。2026年4月29日,Confidential Space正式宣布支持NVIDIA H100 GPU,这意味着AI模型推理可以在完全加密的环境中高效运行。

在双盲评估场景中,Confidential Space扮演了三个角色:

隔离层——评估方无法接触模型权重,谷歌的知识产权得到保护。

隐身层——谷歌无法观察评估方提交的提示词,评估方法的独立性得到保护。

公证层——通过远程证明(Remote Attestation)机制,双方都能确认这个环境没有被篡改。

这就像一间特殊的考场:考官和考生被分别关在两个房间里,所有交流都通过一道加密管道完成,连考场管理员都不知道管道里在传什么。

此次启用评估的首个模型是Gemini Flash Lite。但谷歌明确表示,这套机制可以适用于任何需要高敏感度评估的场景——国家AI安全测试、金融合规审查、医疗AI认证。

从自证到他证的转折点

把谷歌这次动作放在更大的背景下来看,一个更深的趋势正在浮现:AI治理的重心正从自证清白转向可验证的他证。

过去几年,主流大模型公司的安全治理路径高度相似:内部组建安全团队,制定安全框架,发布系统卡,邀请少数外部评测者,在可控范围内公开评测结果。这套模式的公信力门槛极低——评测者是谁?评测标准怎样?测试数据有没有被模型看过?这些关键信息全在模型公司内部,外界无从验证。

2025年以来,全球多个国家陆续成立了AI安全机构:英国AI安全研究所、美国AI安全研究所、日本AI安全研究所,以及此次参与合作的新加坡AI安全研究所(AISI,其前身为数字信任中心DTC,2024年5月被指定为新加坡AISI)。这些政府机构的出现,本质上是在要求一种可独立验证的评估权。

但政府机构也面临同一条裂缝:如果拿不到模型权重,评估效果大打折扣;如果拿到了,商业机密可能泄露——尤其是对于非美国本土的评估机构而言。

谷歌联合新加坡AISI推出的双盲评估,恰好在这条裂缝上提供了一种技术解决方案:评估方不需要看到模型权重,就能完成独立、真实的评估。

从这个意义上说,谷歌做的不是一次技术发布,而是一次信任实验。实验的结果将决定:当AI进入医疗、金融、司法等高风险领域时,社会到底能不能相信模型很强这个结论。

裁判权的商业逻辑

谷歌为什么会是第一个做出双盲评估的模型公司?答案也许不仅是谷歌更重视安全,更直接的驱动力来自:谷歌云需要差异化。

根据Synergy Research Group的数据,2025年第四季度全球云基础设施市场格局如下:AWS以28%的份额居首,Microsoft Azure以21%位列第二,谷歌云以14%排在第三。虽然谷歌云的增速(同比增长约48%)快于前两名,但绝对差距仍然巨大。要在巨头夹击中突围,谷歌需要一个明确的差异化标签。

更安全的AI评估平台恰恰是这样的标签。

如果政府机构、金融机构、医疗客户需要一个高度可信的AI评估环境,那么谷歌的Confidential Space就是天然的入口。每一次评估都需要消耗计算资源——这本身就是云收入。而当评估从自愿行为逐步变为监管强制时,评估基础设施将成为下一波关键的竞争壁垒。

在巨头林立、竞争激烈的AI基础设施赛道中,掌握定价权的往往不是技术迭代最快、投入最高的企业,而是那些掌握了规则制定层和验证层的企业。谷歌正在赌的,正是这条路。

一次结构性的行业拐点

回到开头的问题:双盲评估能根治基准污染吗?

答案是不能——至少不能解决历史存量问题。那些已经混入训练集的污染数据,不会因为双盲机制而消失。模型在MMLU、HumanEval、GSM8K等经典基准上的分数,永远会有刷题的嫌疑。

但双盲评估能保证一件事:未来的新增评估是干净的。它无法抹去过去的分数,但能给未来的分数加上可验证的印章。

这对AI行业的真正意义或许在于:当评测本身成为一门生意、一种基础设施——谁的评测可信就变得比谁的分数更高更重要。

行业正在从比谁更强迈向比谁更可信。而在这场新的竞赛中,第一个系上安全绳的玩家,往往能最先发现悬崖在哪。

当行业还在争论谁的模型是天生骄傲的做题家时,有人已经悄悄攥住了阅卷权。

作品声明:内容由AI生成

快报

更多

09:14

两部门:鼓励金融机构加大物流、交通领域金融支持

09:11

今年1至7月全国社会物流总额214.5万亿元,同比增长5.0%

09:11

两市融资余额增加113.06亿元

09:01

国内商品期货开盘多数上涨,原油涨超4%

09:01

两部门:加快发展新型冷藏载具,支持储能式绿电冷藏箱、新型铁路冷藏装备等研发应用

09:00

两部门:培育具有国际竞争力的交通物流领军企业和综合物流集成商,形成一批专业化物流服务企业

09:00

两部门:加快物流设施设备数智化转型升级

08:59

国家发展改革委、交通运输部联合印发物流网建设实施方案

08:52

8月28日A股盘前要闻

08:37

胜宏科技:控股股东及其一致行动人上层股东内部股权结构调整

08:28

中信证券:伴随FDE交付效率改善,预计头部CSP、平台应用软件厂商业绩将跟随受益

08:26

城堡证券据悉二季度交易收入创73亿美元纪录,同比增长逾两倍

08:25

行业传利好,29只生物医药股滚动市盈率低于30倍

08:19

迪哲医药:重新向香港联交所递交H股发行上市申请

08:19

国家医保局召开医保促进“十五五”医药产业高质量发展座谈会

08:18

OpenAI发布公开信,呼吁采取网络防御行动

08:06

谷歌将支付2.6亿英镑,就应用开发者集体诉讼达成和解

08:03

韩国KOSPI指数开盘下跌0.95%,日经225指数低开0.04%

07:57

短期波动加大,国际金价围绕4600美元/盎司展开拉锯战

07:57

基金中报显现策略分歧,投资愈发重视“差异化定价”