联合国儿童基金会(UNICEF)的首席统计学家João Pedro Azevedo在最近的媒体简报中给出了一组让行业难以回避的数据。他们用六款全球主流的大模型——OpenAI的GPT-4o和GPT-4o-mini,Anthropic的Claude Sonnet 4.5和Haiku 4.5,Google的Gemini 2.5 Flash和Gemini 2.0 Flash——做了超过13.3万次问答测试,覆盖全球发展指标。平均准确率仅21.2%。
约五分之三的回答根本没给出一个可用的数字。模型们在打太极。而当同样的题目在两天后重新测试时,两次给出完全相同数字的比例只有大约一半。
大语言模型最致命但最容易被忽视的短板被这个数字血淋淋地揭开了:它不是一个可靠的数据库,它是一个擅长编造答案的幻觉制造机。
联合国做了一个不寻常的选择
2026年9月17日,联合国正式宣布与谷歌合作推出UN System Data Commons平台。这个平台基于谷歌开源的数据基础设施Data Commons构建,允许用户用自然语言直接查询来自联合国各机构的海量统计数据。它取代了此前的UNData门户——那个需要用户在数据库界面中逐层浏览和搜索的传统系统。
这一选择的本质,远不止升级了一个搜索框。
联合国的全球统计数据网络是全世界最权威的公共数据集合之一,涵盖人口、经济、健康、教育、环境、贸易等上百个领域,数据来源横跨联合国26个实体机构。UN Data网站月访问量超过600万,是联合国访问量最高的网站之一。今年以来,从ChatGPT等AI助手回答链接跳转到联合国数据网站的流量同比暴增67%,AI助手的推荐流量已占到网站总访问量的约十分之一。
AI正在成为联合国的数据分发渠道,但同时也是最容易扭曲数据的渠道。
Shantanu Mukherjee,联合国统计司代理司长,在公告中直言:
我们在规模、范围和灵活性上实现了数量级的提升,首次实现了联合国系统内如此多机构间的数据连接。我们正在抓住这个时机,让我们的数据变得AI-ready。
谷歌为什么肯白送200万美元
联合国选择的不是找咨询公司定制一套系统,而是直接基于谷歌开源的Data Commons平台搭建。
Data Commons是谷歌自2018年起持续运营的项目,由Ramanathan V. Guha创立,现由Prem Ramaswamy领导。它的核心理念是将来自不同来源的公共数据集组织到一个统一的语义框架中。它不是搜索引擎,而是一个语义对齐层——它知道婴儿死亡率在WHO数据库里叫什么字段,在UNICEF数据库里又叫什么字段,能够自动映射和融合。
这种能力恰好是传统联合国系统最缺失的。此前的UNData门户虽汇聚了大量数据,但各机构之间的数据格式、分类标准、更新频率各不相同,用户要跨机构查询往往需要反复跳转和手动比对。Data Commons用一个统一的知识图谱架构代替了传统的数据仓库思维——不是把所有数据搬到一起存着,而是让不同来源的数据在语义层面说同一种语言。
谷歌为此提供了200万美元的能力建设资金和技术支持。Ramaswamy向媒体表示,系统托管在由联合国治理的实例上,最终目的是让联合国能独立运维、扩展和规模化。谷歌采用的是培训培训师的模式——训练联合国的团队自己去跑,自己维护。
200万美元在2026年的AI行业连一小时的训练成本都不够。但谷歌从Data Commons身上要的不是钱。
MCP:给AI装上可验证的数据水管
UN System Data Commons最值得关注的技术细节,是它对MCP(Model Context Protocol)的原生支持。
MCP是Anthropic在2024年底提出的开放协议标准,被业界类比为AI世界的USB-C。它的核心理念很简单但很激进:不再让AI模型靠内部参数去猜测和编造数据,而是通过标准化的协议直接连接到外部可靠数据源,实时拉取可验证的信息。
谷歌在2025年9月为Data Commons加入了MCP支持,并于2026年2月在Google Cloud上推出了托管版的Data Commons MCP服务,实现零配置安装。这意味着任何兼容MCP的AI客户端——Claude、GPT、Gemini——都可以像接上水管一样直接读取联合国统计数据库中的真实数据,而不是靠模型内部背下来的那点训练语料。
这对准确率只有21.2%的大模型来说,是一次外挂级别的能力补充。
Ramaswamy在演示中展示了一个更惊人的场景:通过MCP连接到联合国数据的AI系统,能自动整合多个指标,生成仪表盘、图表和书面分析报告,用户完全不需要手动拼接底层数据集。他让AI系统分析美国总统艾滋病紧急救援计划在非洲的影响,AI自动找到HIV感染率、艾滋病死亡率、预期寿命等联合国统计数据,生成了完整信息图。
但Ramaswamy同时给出了一个重要提醒:
因为模型可能会误解细微差别,人类在引用或发布AI输出之前,始终应该审核结果。
给权威数据不等于给权威结论。解决了AI编造数据的问题,并不等于解决了AI误读数据的问题。这一点,联合国和谷歌都坦诚面对。
谷歌在打什么算盘
回到那200万美元。截至2025年,全球已有数十家机构搭建了自己的Data Commons版本,包括ONE Campaign、TechSoup、Feeding America、斯坦福大学等。而联合国Data Commons,是谷歌这个开源项目迄今为止最有分量的样板间。
如果越来越多的公共数据系统跑在Data Commons之上,且默认兼容MCP协议,谷歌将天然成为AI时代的数据水电煤供应商。任何想获取权威公开数据的AI应用,都会在底层依赖谷歌定义的数据标准和接口协议。
这是一个教科书级的卖水人策略。谷歌不做数据生产商(那是联合国的事),也不做数据消费者(那是OpenAI、Anthropic的事),而是做那个定义数据如何被AI读取的标准基础设施。OpenAI在2025年3月官方采纳了MCP协议,微软Copilot Studio在2025年5月原生支持MCP。当竞争对手都用你的协议来获取数据时,谁定义标准,谁就控制了生态的入口。
21.2%的真相
Azevedo的数据值得再深入讨论。21.2%的平均准确率不是模型在某项高难度推理题上的表现,而是回答某国儿童死亡率多少、全球入学率趋势如何这类基础统计问题时的结果。
UNICEF的研究尚未经过同行评审,目前是一份正在准备投稿的working paper。但方法论是有规模的——超过13.3万次问答,覆盖六款主流模型。约60%的回答根本没有给出可用的数字,模型选择不直接回答。而在那些给出数字的回答中,同一道题两天后重测的一致性只有约50%。
同样的问题,大模型今天给你一个数字,后天给你另一个数字。对于依赖数据做决策的机构来说,这种不稳定性比答不出来更致命。
联合国规划到2027年将联合国系统80%的统计数据接入UN System Data Commons平台。这不仅仅是一个IT现代化项目,更是在用商业世界的成熟协议来对冲大模型的不确定性。
谁赢了
把目光拉远,这轮联谷合作有三个关键受益方。
联合国赢了。它用自己的权威数据为AI提供可信底座,同时解决了流量被AI截获却无法控制信息质量的困境。
谷歌赢了。它以200万美元的投入和开源之名,把全球最有分量的公共数据集合锁定到了自己的数据标准之中。
AI行业赢了——但赢的是接入数据标准的能力,而不是生成数据答案的能力。MCP和数据溯源机制的存在,某种意义上是对大模型知识记忆能力的一记耳光:当AI必须在每一次出错的风险中回到权威数据源重新拉取,它就不再是知识的拥有者,而是知识的索引者。
这恰恰是AI Agent时代最核心的范式转换。Agent不需要万亿参数的百科全书大脑,它需要的是一套标准化的数据管道——遇到不知道的事,知道去哪里查,怎么查,查回来的东西可不可信。
联合国的这次选择,可能成为这个新时代的第一个标志性基础设施工程。
AI不需要更会说谎的大脑,它需要一条通向真相的数据管道。






快报