谷歌推出了个“做题家”:Gemini 4 Argon屠榜,但干活差点意思

AGI
消失10个月的谷歌,为什么连Pro这块招牌都扔了?

文 | 字母AI

Gemini 4可算来了,连名字也换了:这次的旗舰不叫Pro,叫Argon。

从谷歌公布的成绩看,Gemini 4 Argon在知识工作方面表现抢眼,多项测试超过了OpenAI和Anthropic的旗舰模型。

它主打一个知识面广,从金融、法律到数学、科学,都有不错的表现。

谷歌还确认,9月15日在LMArena上亮相、表现接近GPT-6 Astra的“3.8 Flash”,其实就是Gemini 4 Argon。

曾与Anthropic、OpenAI并驾齐驱的谷歌,此前因Gemini 3.5 Pro表现未达预期,加上内部人事动荡,一度掉队。

这一次,谷歌能靠Gemini 4 Argon翻盘吗?

Gemini 4 Argon性能如何?

据谷歌介绍,Gemini 4 Argon采用了公司迄今规模最大的预训练。这也是谷歌时隔10个月推出的新一代旗舰。

和其他旗舰模型一样,它瞄准的是长程编程任务、企业级知识工作和网络安全防御。

在谷歌公布的18项基准测试中,Argon拿下12项第一、1项并列第一;GPT-6 Astra拿下3项第一、1项并列第一,Claude Opus 5.5则拿下2项第一。

至少在这份成绩单上,谷歌的领先项目数超过了OpenAI和Anthropic。

在长程软件工程测试DeepSWE v1.1中,Argon以77.9%的成绩刷新纪录,高于Astra的74.1%和Opus 5.5的74.2%。

在衡量知识工作能力的Vals Index中,Argon以68.9%的成绩排名第一;在Zapier的业务自动化测试AutomationBench中,它以51.3%领先,Opus 5.5和Astra分别为42.5%和41.4%。

在金融研究测试Vals Finance Agent v2中,Argon得分65.4%;在法律任务测试Harvey Legal Agent中,它得分19.6%,Astra为5.4%,约为它的四分之一。

在长视频理解测试LVBench中,Argon得分91.7%;在GraphWalks的长上下文图检索测试中,得分84.2%。

网络安全方面,Argon与Astra在CWE-bench v1中以68%并列第一。在Gray Swan的提示注入测试中,针对Argon的攻击成功率仅为0.7%,是参测模型中最低的,Astra则为8.5%。

成绩单很漂亮,但Argon并非处处领先。

它的短板,出现在部分软件工程、终端操作和科学任务上。

在FrontierSWE v2中,Argon得分55.0%,Astra为65.5%;在Terminal-Bench Science 0.1中,两者分别为57.6%和68.1%。两项测试中,Argon都落后10.5个百分点。

在衡量Agent终端操作能力的Terminal-Bench 4.0中,Argon得分57.4%,也低于Opus 5.5的66.4%和Astra的58.2%。

这些结果说明,Argon在知识工作上有优势,但面对一些需要持续操作、执行的任务,仍未追上对手。

Argon的另一个特点是少说没把握的话。在Artificial Analysis的AA-Omniscience测试中,它的幻觉率最低。

在未能答对的问题中,Argon只有15%给出了错误答案,其余选择承认“不知道”。这一指标衡量的是模型有多爱“瞎编”,不等于答题正确率。

作为对比,GPT-6 Astra在不同推理设置下的幻觉率为45%至51%,Opus 5.5和Fable 5.1在最高推理设置下分别为59%和73%。

不过,榜单成绩还不能直接等同于使用体验。谷歌自报的测试结果,尤其需要结合独立评测来看。

GPT-6 Astra此前自报ARC-AGI-3成绩达到99.9%,随后就引发了对测试可信度的质疑。

Gemini 4 Argon发布不到一小时,也有外媒质疑其评分,称部分试用过的谷歌员工认为,分数高于实际表现。

在Artificial Analysis公布的智能指数图中,Argon得分53分,与Astra、Claude Fable 5.1同分,低于Opus 5.5。

目前,普通用户和开发者还用不上Argon。首批获准使用的是谷歌Fairwind计划中的网络安全防御人员。

价格倒是颇有吸引力。尝鲜期内,Argon每百万输入token收费2美元,每百万输出token收费10美元;缓存命中的输入价格再降95%,为每百万token 0.10美元,低于Astra和Opus 5.5。

尝鲜期结束后,标准价格将恢复至每百万输入token 4美元、输出token 20美元,与Opus 5.5相同。

Pro去哪了?

Argon意为氩,是一种化学性质稳定、很少与其他物质发生反应的稀有气体,算得上元素周期表里的“宅男”。

谷歌称,新的“元素命名法”是为了将旗舰架构与更轻量的Flash系列区分开。

有意思的是,Argon首次公开露面时,却披着Flash的外衣。9月15日,它以“gemini-3.8-flash”的名字出现在LMArena上。

不少网友拿它做鹈鹕测试,发现效果与Astra相差无几,纷纷感叹:Flash都这么强了,Pro还了得?如今谜底揭晓,他们提前试到的就是旗舰。

除了性能,谷歌这次还着重介绍了Argon的安全设计。此前,谷歌与OpenAI、Anthropic一样,都曾曝出模型被越狱的问题。

这一次,谷歌为首批用户提供了一个移除网络安全护栏的特别版本。

谷歌称,这样做是为了减少模型误拒绝正常安全研究请求的情况,让防御人员能够检查潜在攻击入口、发现并修补漏洞。

谷歌还介绍了“监控内部激活”的安全手段,用来识别模型推理过程中的风险信号。

这意味着,安全检查除了筛查输入,还会监控模型的思维链和内部激活信号。

一旦检测到模型正在生成进攻性网络行为的相关内容,运行时监控系统就会中断生成。

据谷歌介绍,Argon已经在公司内部干起了活。

它帮助量子计算团队优化编译流程,将时空开销较已发表的基线降低40%;分析跨数据中心的性能数据并修补问题,释放超过300 TiB内存;将C/C++代码迁移至Rust,涉及re2、libgav1,以及80万行的Fuchsia OS Zircon内核。其中,libgav1的3.2万行SIMD代码被改写为安全的Rust代码后,运行速度达到原Rust版本的2.7倍,输出结果保持一致。

9月14日,谷歌还曾联合马里兰大学、弗吉尼亚大学发布论文《Dream-RSI》。

这篇论文提出,将Agent过去的搜索历史保存为一棵“发现树”,让它沿着这棵树反复“做梦”,离线尝试不同的探索策略,无须重新运行真实实验。

在六个数据集上,这种方法将发现型Agent的调用次数降至原来的约1/162,减少了探索过程中的调用开销。

Argon也采用了这套方法,以提高训练效率。

谷歌这一阵到底去哪了

自Gemini 3 Pro发布以来,谷歌已近10个月没有推出新一代旗舰。

2026年2月19日,谷歌推出了Gemini 3.1 Pro小幅更新,但原定6月发布的Gemini 3.5 Pro迟迟未能通过内部测试。

当时,行业竞争的重心已转向编程和Agent,Gemini 3.5 Pro却未能在多文件代码重构、自主Agent执行等任务中,展现出相对OpenAI和Anthropic的明确优势。

7月17日,外媒报道称,Gemini 3.5 Pro因编程表现不达标,将推迟数月发布。当天,Alphabet股价一度下跌4%。

8月,DeepMind迎来人事调整。哈萨比斯卸任DeepMind CEO,转任Alphabet首席科学家;杰夫则离开首席科学家岗位,与朋友创业。

科雷·卡武克丘奥卢(Koray Kavukcuoglu)接掌DeepMind,直接向皮查伊汇报。外媒将其视为谷歌近年来最大的一次AI领导层调整。

这段时间,谷歌主要靠Flash系列维持声量,同时启动Fairwind计划,与多家网络安全公司合作。

9月24日,科雷表示,Gemini 4已进入后训练阶段,将尽快发布,不必等到年底。

如今,Gemini 4 Argon终于来了。我的谷歌会员要不要续,等真正用上它再说。

本文系作者 字母AI 授权钛媒体发表,并经钛媒体编辑,转载请注明出处、作者和本文链接。
本内容来源于钛媒体钛度号,文章内容仅供参考、交流、学习,不构成投资建议。
想和千万钛媒体用户分享你的新奇观点和发现,点击这里投稿 。创业或融资寻求报道,点击这里。

敬原创,有钛度,得赞赏

赞赏支持
发表评论
0 / 300

根据《网络安全法》实名制要求,请绑定手机号后发表评论

请 登录后输入评论内容

扫描下载App