Claude Fable 5在FrontierMath最难测试中领先GPT-5.5 13个百分点

2026.06.13 20:15
Anthropic新模型Claude Fable5在FrontierMath基准测试中表现优异,Tier4准确率达88%,超GPT5.5的75%。其前代模型Opus4.5年初Tier4得分不足10%,进步显著。AI数学能力提升不仅在基准测试,还解决了Erdős等实际问题。

Anthropic推出的新模型Claude Fable 5在FrontierMath基准测试中拿下了最高得分。根据Epoch AI的数据,Fable5在1至3级的准确率达到87%,在难度最高的4级(v2)更是拿到了88%的成绩。

Anthropic的模型数学能力在短时间内实现了显著飞跃。要知道,2026年初它的前代模型Opus4.5在4级的得分还不到10%。OpenAI的GPT-5.5在同一级别得分约75%,明显落后于Fable5,不过GPT-5.6目前已处于开发阶段。

所有参与测试的模型都在Epoch AI的标准框架下,以最大推理努力完成了测试。FrontierMath被广泛认为是AI数学推理领域最严格的基准之一。这些数学能力的进步不仅体现在基准测试的数字上,现实世界中的应用案例也在不断出现——最近,OpenAI的模型解决了一个悬而未决的Erdős问题,Claude Mythos同样完成了这一突破。

作品声明:内容由AI生成

快报

更多

2026-09-12 23:00

习近平会见印度总理莫迪

2026-09-12 22:43

Anthropic联合创始人兼首席执行官:必须放慢提升AI模型能力的速度

2026-09-12 22:16

中国聚变:正全力推进全球首个高温超导强场稳态燃烧实验平台研发

2026-09-12 21:48

巴勒斯坦总统:期待巴中战略伙伴关系不断取得新发展

2026-09-12 21:47

恺英网络:拟间接参股韩国公司Wemade,整体预估出资2.98亿美元

2026-09-12 21:46

iPhone 18 Pro系列多电商平台售罄

2026-09-12 21:17

苹果iPhone 18 Pro/Pro Max开启预购

2026-09-12 20:44

与谷歌合作智能家居项目是否涵盖AI眼镜相关产品?创维数字回应

2026-09-12 20:41

“铁建起重5000”大型起重船离港赴远洋施工

2026-09-12 20:37

创维数字:不存在“大股东持股比例仅13%”情形

2026-09-12 20:37

欧洲资金涌入拉美股票基金,净流入金额创2010年以来新高

2026-09-12 20:14

北京丰台发布文化产业新政,聚焦数字出版创新等六大方向

2026-09-12 20:11

柳州优必选万台级工业人形机器人超级智慧工厂投产

2026-09-12 20:05

9月12日新闻联播速览20条

2026-09-12 19:56

中国最北城市漠河正式开栓供暖

2026-09-12 19:56

习近平会见印度总理莫迪

2026-09-12 19:55

中国工程院院士邬贺铨:2030年中国算力有望占到全球30%

2026-09-12 19:39

塞尔维亚总统武契奇视察“卡拉乔尔杰领袖走廊”快速路项目

2026-09-12 19:38

习近平将会见印度总理莫迪

2026-09-12 19:16

华储网:9月15日、16日中央储备冻猪肉轮换出库竞价交易挂牌国产冻猪肉分别15500吨、12900吨