谷歌推出了个“做题家”:Gemini 4 Argon屠榜,但干活差点意思
文 | 字母AI
Gemini 4可算来了,连名字也换了:这次的旗舰不叫Pro,叫Argon。
从谷歌公布的成绩看,Gemini 4 Argon在知识工作方面表现抢眼,多项测试超过了OpenAI和Anthropic的旗舰模型。
它主打一个知识面广,从金融、法律到数学、科学,都有不错的表现。
谷歌还确认,9月15日在LMArena上亮相、表现接近GPT-6 Astra的“3.8 Flash”,其实就是Gemini 4 Argon。
曾与Anthropic、OpenAI并驾齐驱的谷歌,此前因Gemini 3.5 Pro表现未达预期,加上内部人事动荡,一度掉队。
这一次,谷歌能靠Gemini 4 Argon翻盘吗?
Gemini 4 Argon性能如何?
据谷歌介绍,Gemini 4 Argon采用了公司迄今规模最大的预训练。这也是谷歌时隔10个月推出的新一代旗舰。
和其他旗舰模型一样,它瞄准的是长程编程任务、企业级知识工作和网络安全防御。
在谷歌公布的18项基准测试中,Argon拿下12项第一、1项并列第一;GPT-6 Astra拿下3项第一、1项并列第一,Claude Opus 5.5则拿下2项第一。
至少在这份成绩单上,谷歌的领先项目数超过了OpenAI和Anthropic。

在长程软件工程测试DeepSWE v1.1中,Argon以77.9%的成绩刷新纪录,高于Astra的74.1%和Opus 5.5的74.2%。
在衡量知识工作能力的Vals Index中,Argon以68.9%的成绩排名第一;在Zapier的业务自动化测试AutomationBench中,它以51.3%领先,Opus 5.5和Astra分别为42.5%和41.4%。
在金融研究测试Vals Finance Agent v2中,Argon得分65.4%;在法律任务测试Harvey Legal Agent中,它得分19.6%,Astra为5.4%,约为它的四分之一。
在长视频理解测试LVBench中,Argon得分91.7%;在GraphWalks的长上下文图检索测试中,得分84.2%。
网络安全方面,Argon与Astra在CWE-bench v1中以68%并列第一。在Gray Swan的提示注入测试中,针对Argon的攻击成功率仅为0.7%,是参测模型中最低的,Astra则为8.5%。
成绩单很漂亮,但Argon并非处处领先。
它的短板,出现在部分软件工程、终端操作和科学任务上。
在FrontierSWE v2中,Argon得分55.0%,Astra为65.5%;在Terminal-Bench Science 0.1中,两者分别为57.6%和68.1%。两项测试中,Argon都落后10.5个百分点。
在衡量Agent终端操作能力的Terminal-Bench 4.0中,Argon得分57.4%,也低于Opus 5.5的66.4%和Astra的58.2%。
这些结果说明,Argon在知识工作上有优势,但面对一些需要持续操作、执行的任务,仍未追上对手。
Argon的另一个特点是少说没把握的话。在Artificial Analysis的AA-Omniscience测试中,它的幻觉率最低。
在未能答对的问题中,Argon只有15%给出了错误答案,其余选择承认“不知道”。这一指标衡量的是模型有多爱“瞎编”,不等于答题正确率。
作为对比,GPT-6 Astra在不同推理设置下的幻觉率为45%至51%,Opus 5.5和Fable 5.1在最高推理设置下分别为59%和73%。

不过,榜单成绩还不能直接等同于使用体验。谷歌自报的测试结果,尤其需要结合独立评测来看。
GPT-6 Astra此前自报ARC-AGI-3成绩达到99.9%,随后就引发了对测试可信度的质疑。
Gemini 4 Argon发布不到一小时,也有外媒质疑其评分,称部分试用过的谷歌员工认为,分数高于实际表现。
在Artificial Analysis公布的智能指数图中,Argon得分53分,与Astra、Claude Fable 5.1同分,低于Opus 5.5。

目前,普通用户和开发者还用不上Argon。首批获准使用的是谷歌Fairwind计划中的网络安全防御人员。
价格倒是颇有吸引力。尝鲜期内,Argon每百万输入token收费2美元,每百万输出token收费10美元;缓存命中的输入价格再降95%,为每百万token 0.10美元,低于Astra和Opus 5.5。
尝鲜期结束后,标准价格将恢复至每百万输入token 4美元、输出token 20美元,与Opus 5.5相同。
Pro去哪了?
Argon意为氩,是一种化学性质稳定、很少与其他物质发生反应的稀有气体,算得上元素周期表里的“宅男”。
谷歌称,新的“元素命名法”是为了将旗舰架构与更轻量的Flash系列区分开。
有意思的是,Argon首次公开露面时,却披着Flash的外衣。9月15日,它以“gemini-3.8-flash”的名字出现在LMArena上。
不少网友拿它做鹈鹕测试,发现效果与Astra相差无几,纷纷感叹:Flash都这么强了,Pro还了得?如今谜底揭晓,他们提前试到的就是旗舰。
除了性能,谷歌这次还着重介绍了Argon的安全设计。此前,谷歌与OpenAI、Anthropic一样,都曾曝出模型被越狱的问题。
这一次,谷歌为首批用户提供了一个移除网络安全护栏的特别版本。
谷歌称,这样做是为了减少模型误拒绝正常安全研究请求的情况,让防御人员能够检查潜在攻击入口、发现并修补漏洞。
谷歌还介绍了“监控内部激活”的安全手段,用来识别模型推理过程中的风险信号。
这意味着,安全检查除了筛查输入,还会监控模型的思维链和内部激活信号。
一旦检测到模型正在生成进攻性网络行为的相关内容,运行时监控系统就会中断生成。
据谷歌介绍,Argon已经在公司内部干起了活。
它帮助量子计算团队优化编译流程,将时空开销较已发表的基线降低40%;分析跨数据中心的性能数据并修补问题,释放超过300 TiB内存;将C/C++代码迁移至Rust,涉及re2、libgav1,以及80万行的Fuchsia OS Zircon内核。其中,libgav1的3.2万行SIMD代码被改写为安全的Rust代码后,运行速度达到原Rust版本的2.7倍,输出结果保持一致。
9月14日,谷歌还曾联合马里兰大学、弗吉尼亚大学发布论文《Dream-RSI》。
这篇论文提出,将Agent过去的搜索历史保存为一棵“发现树”,让它沿着这棵树反复“做梦”,离线尝试不同的探索策略,无须重新运行真实实验。
在六个数据集上,这种方法将发现型Agent的调用次数降至原来的约1/162,减少了探索过程中的调用开销。
Argon也采用了这套方法,以提高训练效率。
谷歌这一阵到底去哪了
自Gemini 3 Pro发布以来,谷歌已近10个月没有推出新一代旗舰。
2026年2月19日,谷歌推出了Gemini 3.1 Pro小幅更新,但原定6月发布的Gemini 3.5 Pro迟迟未能通过内部测试。
当时,行业竞争的重心已转向编程和Agent,Gemini 3.5 Pro却未能在多文件代码重构、自主Agent执行等任务中,展现出相对OpenAI和Anthropic的明确优势。
7月17日,外媒报道称,Gemini 3.5 Pro因编程表现不达标,将推迟数月发布。当天,Alphabet股价一度下跌4%。
8月,DeepMind迎来人事调整。哈萨比斯卸任DeepMind CEO,转任Alphabet首席科学家;杰夫则离开首席科学家岗位,与朋友创业。
科雷·卡武克丘奥卢(Koray Kavukcuoglu)接掌DeepMind,直接向皮查伊汇报。外媒将其视为谷歌近年来最大的一次AI领导层调整。
这段时间,谷歌主要靠Flash系列维持声量,同时启动Fairwind计划,与多家网络安全公司合作。
9月24日,科雷表示,Gemini 4已进入后训练阶段,将尽快发布,不必等到年底。
如今,Gemini 4 Argon终于来了。我的谷歌会员要不要续,等真正用上它再说。
加载中,请稍侯......