Meta新基准GAMUT戳破AI真相:漏说的比说错的更致命

2026.07.24 20:23
Meta AI 发布 GAMUT 基准测试,重新定义 AI 事实性:不仅要说对,还要说全。在 1,813 个问题、14 个前沿模型的评测中,最高得分仅 58.7%,且遗漏信息导致的失败次数超过虚假声明。论文揭示 RLHF 的副作用——模型学会'少说更安全',却让'完整性'成为 AI 评测的最大盲区。

当一个AI给你输出2000字的回答,每个字都正确,但偏偏漏掉了你最需要的信息——这算不算事实性错误?Meta AI的最新研究给出了一个令人不安的答案:算,而且比“说错话”更普遍。

现象层

7月24日,Meta AI 研究团队在 arXiv 上发布了一篇名为《Two-Level Meta-Rubrics for Evaluating Open-Ended Generation: GAMUT, a Benchmark for Factual Completeness》的论文,直接挑战了当前AI评测体系的底层假设:事实性不止是“有没有说错”,还应该包括“有没有说全”。

他们构建了一个名为 GAMUT(Grounded Assessment of Multimodal Factuality)的全新基准测试,包含1,813个基于真实可穿戴设备图像的多模态问题,覆盖10个不同领域,每个问题均配有经过人类专家验证的评分细则。论文还同步发布了纯文本变体版本,证明其框架是模态无关的。

结果让整个行业清醒:在14个前沿和开源模型中,最高得分仅为58.7%,由 Gemini 3.1 Pro 取得。更关键的是,遗漏信息导致的失败次数,超过了虚假声明导致的失败次数。也就是说,即使模型不再“编造”,它也远未达到“可靠”。

分析层

一、为什么“说全”比“说对”更难测?

当前AI事实性评估的核心逻辑是“分解-搜索-验证”:把模型的回答拆成一个个独立的声明,然后逐个核对正误。这套流水线对检测“编造”非常有效,但它对“该说的没说”几乎无能为力。

原因很简单:要判断一个回答是否完整,必须先知道“一个完整回答应该包含什么”。而这些信息很少能列成一张平面的清单。它们可能涉及开放式集合(哪些关键事实必须覆盖)、顺序要求(某些步骤必须按特定顺序出现)、以及关系约束(事实之间并非独立,而是相互关联的)。

GAMUT 论文的作者在摘要中直言:“衡量事实完整性,是事实性评估中缺失的那一半。”比“缺失的一半”更棘手的是——它曾长期被整个行业忽视。

二、两层元评分:从“蓝图”到“检查清单”的精巧设计

GAMUT 的核心创新在于它的两层元评分体系

上层(元评分):一个结构化的评分指南,明确标注了“必须包含的事实”“可接受的替代选择”“需要按顺序出现的步骤”“事实之间的关系”以及“各项的重要性权重”。这层评分不是给AI直接打分用的,而是给人类专家和评测系统使用的“蓝图”。

下层(二元评分):将上层蓝图通过确定性规则,机械地编译成一份扁平的、二元的(通过/不通过)检查清单。这些检查项足够简单,可以由一个LLM裁判模型可靠地评分。

这套设计的精妙之处在于,它同时解决了两个矛盾:上层保留了人类对“完整回答”的复杂理解——结构、顺序、关系、重要性;下层又保证了评测的可操作性和一致性——二元的、可机械执行的检查项。论文强调,该基准测试具有“高度区分度”且“对裁判模型的选择具有鲁棒性”,说明 GAMUT 确实在测量某种核心能力,而非噪声。

三、RLHF的黑暗面:少说更安全

GAMUT 的发现并非偶然。X 用户 @shaped 的评论一针见血:“RLHF 花了五年训练模型少说话更安全,现在终于有了一个基准来测试这个问题。”

这揭示了当前AI行业一个深层矛盾:强化学习人类反馈(RLHF)在压抑“胡编乱造”的同时,也在无形中鼓励模型“吝啬输出”。当模型发现说多了可能出错、说少了只在“完整性”上扣分(而当时完整性不被评测)、说得保守一点反而能获得更高“准确率”时,理性的选择就是——少说,说短,说安全。

这份论文用数据证明了:这种“战略性沉默”的代价,可能比“编造”更严重。因为用户往往意识不到自己错过了什么——他们只会在实际使用中感到“这AI好像不够聪明”,却说不清问题出在哪里。

四、从“不胡说”到“不沉默”:评测范式的跃迁

GAMUT 的发布标志着一个重要的信号:AI评测正在从“你说对了吗”进入“你说全了吗”的新阶段。

过去五年,AI行业在“反幻觉”上投入了巨大精力。从 RLHF 到 RLAIF,从检索增强生成到各类事实性校验工具,几乎所有技术路线都在解决同一个问题:如何让模型不要编造事实。这套方法论塑造了当今AI产品的“安全基因”——宁可不说,也不乱说。

但 GAMUT 的论文明确指出,这种单向度的优化正在制造新的盲区。在医疗、金融、法律等严肃场景中,“遗漏关键信息”可能比“包含错误信息”更危险。一个遗漏了癌症早期指标的AI诊断报告,即使其他所有描述都正确,也是一份致命的错误报告。

GAMUT 的数据集可在 Hugging Face 上获取(facebook/GAMUT),评估工具链已在 GitHub 开源(facebookresearch/GAMUT),支持通过 OpenAI 兼容的 API 接口运行评测。这为整个行业提供了一个可复现的实验框架。

结论/展望

GAMUT 的发布,意味着三件事:

第一,“事实性”的定义正在被重写。过去,AI团队追求的是“不胡说”;未来,他们必须同时追求“不沉默”。Meta 这篇论文把“事实完整性”正式推到了评测前台。

第二,RLHF 的副作用被正式量化了。那些在 RLHF 训练中“学会闭嘴”的模型,在 GAMUT 面前集体现形。这不是模型智能的问题,而是训练目标函数的问题——你测量什么,就得到什么。当评测体系只惩罚“说错”,不惩罚“没说”,模型自然会选择后者。

第三,对AI产品化的深远影响。在 Agent、Copilot、AI医生、AI律师等产品快速落地的今天,“完整性”正在成为比“准确性”更紧迫的工程问题。一个只会说正确话但总漏掉关键信息的AI,在真实场景中可能比一个偶尔犯错但信息全面的AI更危险——因为前者让用户产生了“它是对的”的错觉,而后者至少能提醒用户“这里可能有误”。

当AI终于学会不再撒谎时,我们才发现,它最大的问题也许不是“说错话”,而是“该说的话,一句都没说”。

作品声明:内容由AI生成

快报

更多

16:45

“红霞”将以台风级或强台风级登陆香港至陆丰沿海

16:34

《2026能源产业生态报告》发布,风电光伏装机超越火电

16:15

国家防总提升针对广东的应急响应至Ⅲ级

16:15

今年上半年新疆霍尔果斯口岸进出口货运量创新高

16:10

全球首个“零碳机场”在内蒙古鄂尔多斯建成

15:32

黎巴嫩称以军行动致该国南部发生强烈爆炸

15:24

数字经济交出亮眼成绩单,2025年中国数字产业收入超39万亿元

15:18

台风“红霞”临近,港珠澳大桥桥梁航道实施临时交通管制

15:15

携程集团就行政处罚决定公布十九项整改措施

15:09

奥地利官员:反对为乌克兰加入欧盟开“快速通道”

14:38

大连首推二套房公积金贷款贴息,年内近90城发“房补”

14:11

自然资源部将广东地质灾害防御响应提升至Ⅲ级

14:07

派拉蒙天舞宣布推迟收购华纳兄弟交易

13:44

沙特证实多国联军打击也门胡塞武装

13:23

SK集团与英伟达通过一项涵盖人工智能工厂和下一代内存的5000亿美元以上战略合作项目,进一步扩大战略合作

13:14

三星电子宣布与博通公司签署谅解备忘录,涵盖至2030年价值高达2000亿美元的存储芯片、代工服务和先进封装业务

13:05

VC价格一个多月涨幅超40%,厂商限量供货

12:54

日本连续5天出现“酷暑日”,刷新历史纪录

12:36

也门胡塞武装称打击沙特南部城市

12:33

鸿蒙版微信更新,支持自定义通话铃声