2026年9月22日,OpenAI和Anthropic在同一天分别放出了GPT-6 Sol和Claude Opus 5.5。如果你只关注编程Benchmark和API定价,你会错过一条更值得追问的新闻——不到一周前,一位历史学家用它们的前代模型,找到了艾萨克·牛顿一段炼金术翻译的原始出处。这在此前似乎从未有人做到过。
这听起来像科幻小说的开头,但它是真实发生的实验结果。还在继续。
历史学家Benjamin Breen在其Substack专栏Res Obscura上发表了一篇长文,记录了2026年9月前后用GPT-6 Astra和Opus 5.5进行历史研究的实验结果。他的判断直接且明确:“将历史学家组成协作小组与当前前沿模型配对,将产生大量历史知识和解读的进步。我认为AI实验室、历史研究者和资助机构应该开始积极推动这些合作。”
这在一年前还是不可想象的。2025年初,Breen曾测试过GPT-4o和Claude Sonnet 3.5,当时的结论是“AI在特定领域已经是个合格的历史学家了”——但也仅限于转录16世纪意大利语手稿、翻译早期现代拉丁文这类“研究助理”功能。而GPT-6 Astra和Opus 5.5做到的,是直接开始解决此前悬而未决的历史学难题。
三条路径,三个突破口
Breen总结了一套历史学“开放问题”匹配AI能力的框架。并非所有历史问题都适合交给AI——适合的问题需要同时满足:领域专家已识别出待解决问题;所需数据已完全数字化并可供访问;问题适配前沿模型的“尖峰能力”——多语言推理、跨学科自主研究、代码能力;以及最关键的一条:解决方案能否被清晰地证明或证伪。
这层过滤之后,三类历史问题浮出水面。
密码学与代码破解
这是AI表现最直观的领域。2026年9月15日,独立密码学研究者Frode Weierud公布了一项引人注目的成果:GPT-6 Astra破解了一条1941年7月10日的德国陆军Enigma电文——这条信息自2005年以来一直未被破解。Weierud本人是一位老牌密码分析师,他的反应很诚实:“作为一个老密码分析师,我仍然感到敬畏。”
但真正的突破点不在于“AI会破译密码”,而在于它做到了人类密码学家未能做到的事——AI发现了此前被忽视的关键信息来源。Weierud在复盘时写道:“GPT-6 Astra提到了德国联邦档案馆的文件编号RS 3–3/20a和RS 3–3/63b……这些文件编号是正确的。GPT-6 Astra的行为就像一位非常专业的密码分析师和档案研究员。它在两天内完成的,人类研究者需要数周甚至数月。”
换句话说,AI没有发明新的密码学方法。它只是比人类更彻底地扫描了所有可用的信息源——包括几个月前刚刚更新的德国联邦档案馆目录——发现了一个人类研究者尚未注意到的平行数据集。
这听起来简单,却恰恰揭示了历史研究中的一条底层真理:一个人的生命有限,一种语言的能力有限,一个国家的学术传统有限。但历史记录是无限的。AI所扮演的角色,本质上是一个不知道“疲倦”和“偏好”为何物的跨语际、跨档案信息连接器。
同样在这一领域,Breen本人用GPT-6 Astra对伊丽莎白时代神秘学家John Dee的加密魔法书Liber Loagaeth进行了初步分析——这本400多年来无人能完全解读的密码手稿——同样展现出了令人兴奋的进展。
跨语言、跨文化的文本溯源
如果说密码破解是AI的“硬实力展示”,那么第二个领域——追踪文本在翻译和改编中的演变——则触及了历史学研究最精微的方法论核心。
Breen的案例是艾萨克·牛顿。牛顿一生留下的炼金术手稿超过百万词——这是一个科学史学者无人不知但很少被认真对待的事实。大多数牛顿传记将其炼金术研究当作他晚年“走偏了”的痕迹来处理。但Breen用GPT-6 Astra做了一件此前似乎无人做成的事:确定了牛顿从一本法语炼金术文本自由翻译成拉丁文的一段文字的原始出处。
这个发现意味着什么?如果AI能够系统性地追踪牛顿数百万词炼金术手稿的来源——哪些来自中世纪和文艺复兴的炼金术传统,哪些是他自己的原创性思考——那么科学史界对牛顿的认知可能需要重写。牛顿不再仅仅是“近代科学的奠基人”,他同时也是最后一个伟大的炼金术士——而AI正在帮助后人第一次看清这两种身份之间的真实联系。
更广义上,这种能力几乎可以应用于整个前现代知识史:中世纪欧洲的阿拉伯科学翻译运动、大航海时代的跨文化知识流动、耶稣会士在中国宫廷的科学传播——这些都是涉及多语言文本、分散在不同国家和档案馆中的历史问题,传统研究手段难以在合理时间内完成全景式拼图。但一个多语言推理模型配合一位知道“该问什么问题”的历史学家,这个组合可能改变一切。
连接分散的学术发现
Breen认为,这可能是新方法中影响最大的一条。“连接那些仅在小众子领域中被报道的现有发现——这可能是这些工具为历史研究者打开的最具影响力的新路径。”
历史学术研究有一个结构性困境:随着学科专业化,同一主题下的研究可能分散在几十种语言、十几个国家、数种学术传统中。一位研究18世纪大西洋奴隶贸易的学者,可能需要同时追踪葡萄牙语、法语、英语、荷兰语、西班牙语的档案和学术文献。极少有人能做到这种覆盖。而AI模型——特别是多语言推理能力强的模型——可以充当这种跨语际、跨档案的连接器。
这不是理论推演。Enigma破解案例已经实证了这条路径:关键的突破不是代码本身,而是联邦档案馆新公布的通信集。人类密码学家Weierud花了数周时间研究这些档案;AI在两天内完成了同样的工作,并直接将其纳入了破译流程。
哲学家的问题,历史学家的直觉
AI真的能取代历史学家吗?Breen花了相当大的篇幅回答这个问题——答案是否定的,而且理由比技术层面更深。
在他的上一篇相关文章《AI legibility, physical archives, and the future of research》中,Breen提出了一个核心概念:“可读性光谱”(spectrum of legibility)。简言之,如果一个领域的工作内容是“可读的”——可以清晰地定义什么是正确、什么是错误,可以标注数据集,可以用强化学习来优化——那么AI在这个领域超越人类只是时间问题。数学和编程就是典型。
但历史研究处于这个光谱的另一个极端。历史学家的“直觉”——在物理档案馆中翻过成千上万页发黄的手稿后形成的、半意识层面的信息判断力——是无法被标注、被数字化、被编码的。
Breen举了一个例子:2012年他在里斯本的海外历史档案馆做研究时,看到一封18世纪里约热内卢的葡萄牙士兵写回家的信,恳求回国,因为他病了,他想念他的母亲。这封信在浩如烟海的档案中“跳了出来”——不是因为任何可量化的标准,只是因为它“很奇怪”,“它的语气和同文件夹里的其他文件不一样”。
这种“跳出来”的感觉,经过多年的积累,构成了历史学家对一个时期的整体图景。这个过程本质上是个人化的、不可复制的、无法程序化的。引用计算机科学博士生Pradyumna Prasad的判断:“最安全的人是那些很难或很不划算去创建能给出清晰信号的数据集的人。”
Breen补充了一个数据点:根据OpenAI的Deep Research工具所做的估算,“大约只有10%到30%的人类书面文字被数字化了”,而“只有0.01%到0.1%的人类曾说过的话可以在网上找到”。绝大多数历史记录仍然躺在物理档案馆中。在那里,数字只能指引方向,而直觉才能真正打开门。
为什么AI实验室应该资助历史研究
Breen的呼吁——AI实验室应该资助历史研究——听起来像是一个学者在为自己要经费。但仔细推敲,这套逻辑对AI产业同样成立。
第一,历史研究是AI“稀缺数据”的金矿。前沿模型的训练数据正在枯竭。互联网上几乎所有公开可用的文本已经被用完。但还有70%到90%的人类书面文字从未被数字化。它们在档案馆里,在手稿中,在石碑上。这些数据不仅稀缺,而且质量极高——它们是经过时间检验的、包含复杂语义和深层语境的严肃思想记录。对AI训练来说,这种“硬数据”的边际价值可能远超又一轮Reddit帖子和YouTube字幕。
第二,历史研究天然适配“推理验证”范式。OpenAI的o系列和DeepSeek的R1已经证明,在可以验证正确答案的领域,推理模型可以取得惊人进展。历史研究中大量问题——这段文字的来源是什么?这条信息是否被其他档案佐证?这两个事件之间是否存在因果关系?——本质上都是可验证的推理题。“可验证性”正是让AI推理能力发挥作用的催化剂。
第三,竞争差异化。2026年9月22日,GPT-6 Sol和Claude Opus 5.5几乎同时上线。前者定位于编码和Agent任务,定价比GPT-6 Astra更低;后者自称性能与Claude Fable 5.1相当,但成本比Opus 5降低40%,定价为每百万输入token 4美元、每百万输出token 20美元。二者在编程benchmark上争夺小数点后两位的精度差距。但历史研究能力提供了一个目前没有任何主流Benchmark能够衡量的维度。如果有一家AI实验室能喊出“我们的模型是第一个系统性发现历史关联的大模型”,这种叙事在品牌层面的价值可能超过任何一次排行榜排名。
事实上,已经有迹象表明这条路走得通。OpenAI的Deep Research工具已经能够生成长篇历史研究报告——尽管Breen提醒说这些报告“仍然缺乏真正优秀历史研究的深度和细微差别”——但方向是明确的。
可读的历史,不可读的智慧
回到“可读性光谱”的概念。AI在历史研究中的真正角色,不是取代历史学家,而是处理光谱上“更可读”的那一端——多语言翻译、大规模文本比对、跨语料库线索追踪、密码破解——同时将“更不可读”的那一端留给人类:直觉、物理档案经验、对“奇怪”信息的敏感度、以及提出好问题的能力。
这实际上为历史学家的角色提出了新的定义。在一个AI能够处理大量“可读”工作的世界里,一名历史学家的核心竞争力不再是我读了多少本书,而是我知道哪些东西值得读、我能在物理档案馆中找到AI不知道存在的东西、我能把AI发现的零星线索编织成一个有意义的历史叙事。
历史学家正在从“知识生产者”转变为“知识策展人”。这场转变所需要的工具,正是前沿AI模型。反过来,AI也需要历史学家为它提供那些“不可读”的直觉来校准方向。
GPT-6 Sol和Opus 5.5在编程任务上的胜负很快会被Benchmark定义清楚。但它们在历史研究上展现的可能性——帮助历史学家发现牛顿失踪的炼金术出处、破解85年前兵士的最后一封电文、连接散落在三个世纪里的知识线索——才是真正值得持续追问的方向。因为在这些问题面前,Benchmark是失效的,而历史是真实的。






快报