当一个AI给你输出2000字的回答,每个字都正确,但偏偏漏掉了你最需要的信息——这算不算事实性错误?Meta AI的最新研究给出了一个令人不安的答案:算,而且比“说错话”更普遍。
现象层
7月24日,Meta AI 研究团队在 arXiv 上发布了一篇名为《Two-Level Meta-Rubrics for Evaluating Open-Ended Generation: GAMUT, a Benchmark for Factual Completeness》的论文,直接挑战了当前AI评测体系的底层假设:事实性不止是“有没有说错”,还应该包括“有没有说全”。
他们构建了一个名为 GAMUT(Grounded Assessment of Multimodal Factuality)的全新基准测试,包含1,813个基于真实可穿戴设备图像的多模态问题,覆盖10个不同领域,每个问题均配有经过人类专家验证的评分细则。论文还同步发布了纯文本变体版本,证明其框架是模态无关的。
结果让整个行业清醒:在14个前沿和开源模型中,最高得分仅为58.7%,由 Gemini 3.1 Pro 取得。更关键的是,遗漏信息导致的失败次数,超过了虚假声明导致的失败次数。也就是说,即使模型不再“编造”,它也远未达到“可靠”。
分析层
一、为什么“说全”比“说对”更难测?
当前AI事实性评估的核心逻辑是“分解-搜索-验证”:把模型的回答拆成一个个独立的声明,然后逐个核对正误。这套流水线对检测“编造”非常有效,但它对“该说的没说”几乎无能为力。
原因很简单:要判断一个回答是否完整,必须先知道“一个完整回答应该包含什么”。而这些信息很少能列成一张平面的清单。它们可能涉及开放式集合(哪些关键事实必须覆盖)、顺序要求(某些步骤必须按特定顺序出现)、以及关系约束(事实之间并非独立,而是相互关联的)。
GAMUT 论文的作者在摘要中直言:“衡量事实完整性,是事实性评估中缺失的那一半。”比“缺失的一半”更棘手的是——它曾长期被整个行业忽视。
二、两层元评分:从“蓝图”到“检查清单”的精巧设计
GAMUT 的核心创新在于它的两层元评分体系。
上层(元评分):一个结构化的评分指南,明确标注了“必须包含的事实”“可接受的替代选择”“需要按顺序出现的步骤”“事实之间的关系”以及“各项的重要性权重”。这层评分不是给AI直接打分用的,而是给人类专家和评测系统使用的“蓝图”。
下层(二元评分):将上层蓝图通过确定性规则,机械地编译成一份扁平的、二元的(通过/不通过)检查清单。这些检查项足够简单,可以由一个LLM裁判模型可靠地评分。
这套设计的精妙之处在于,它同时解决了两个矛盾:上层保留了人类对“完整回答”的复杂理解——结构、顺序、关系、重要性;下层又保证了评测的可操作性和一致性——二元的、可机械执行的检查项。论文强调,该基准测试具有“高度区分度”且“对裁判模型的选择具有鲁棒性”,说明 GAMUT 确实在测量某种核心能力,而非噪声。
三、RLHF的黑暗面:少说更安全
GAMUT 的发现并非偶然。X 用户 @shaped 的评论一针见血:“RLHF 花了五年训练模型少说话更安全,现在终于有了一个基准来测试这个问题。”
这揭示了当前AI行业一个深层矛盾:强化学习人类反馈(RLHF)在压抑“胡编乱造”的同时,也在无形中鼓励模型“吝啬输出”。当模型发现说多了可能出错、说少了只在“完整性”上扣分(而当时完整性不被评测)、说得保守一点反而能获得更高“准确率”时,理性的选择就是——少说,说短,说安全。
这份论文用数据证明了:这种“战略性沉默”的代价,可能比“编造”更严重。因为用户往往意识不到自己错过了什么——他们只会在实际使用中感到“这AI好像不够聪明”,却说不清问题出在哪里。
四、从“不胡说”到“不沉默”:评测范式的跃迁
GAMUT 的发布标志着一个重要的信号:AI评测正在从“你说对了吗”进入“你说全了吗”的新阶段。
过去五年,AI行业在“反幻觉”上投入了巨大精力。从 RLHF 到 RLAIF,从检索增强生成到各类事实性校验工具,几乎所有技术路线都在解决同一个问题:如何让模型不要编造事实。这套方法论塑造了当今AI产品的“安全基因”——宁可不说,也不乱说。
但 GAMUT 的论文明确指出,这种单向度的优化正在制造新的盲区。在医疗、金融、法律等严肃场景中,“遗漏关键信息”可能比“包含错误信息”更危险。一个遗漏了癌症早期指标的AI诊断报告,即使其他所有描述都正确,也是一份致命的错误报告。
GAMUT 的数据集可在 Hugging Face 上获取(facebook/GAMUT),评估工具链已在 GitHub 开源(facebookresearch/GAMUT),支持通过 OpenAI 兼容的 API 接口运行评测。这为整个行业提供了一个可复现的实验框架。
结论/展望
GAMUT 的发布,意味着三件事:
第一,“事实性”的定义正在被重写。过去,AI团队追求的是“不胡说”;未来,他们必须同时追求“不沉默”。Meta 这篇论文把“事实完整性”正式推到了评测前台。
第二,RLHF 的副作用被正式量化了。那些在 RLHF 训练中“学会闭嘴”的模型,在 GAMUT 面前集体现形。这不是模型智能的问题,而是训练目标函数的问题——你测量什么,就得到什么。当评测体系只惩罚“说错”,不惩罚“没说”,模型自然会选择后者。
第三,对AI产品化的深远影响。在 Agent、Copilot、AI医生、AI律师等产品快速落地的今天,“完整性”正在成为比“准确性”更紧迫的工程问题。一个只会说正确话但总漏掉关键信息的AI,在真实场景中可能比一个偶尔犯错但信息全面的AI更危险——因为前者让用户产生了“它是对的”的错觉,而后者至少能提醒用户“这里可能有误”。
当AI终于学会不再撒谎时,我们才发现,它最大的问题也许不是“说错话”,而是“该说的话,一句都没说”。






快报