AI 工具目录与使用指南
功能 · 价格 · 教程
模型入门约 7 分钟

Gemini 4 Argon 与跑分争议:一张旧榜单能说明什么?

从 Ishu Agrawal 的推文与 Logan Kilpatrick 的回复出发,核对 Gemini 3.1 Pro 对比 Opus 4.6 的旧榜单,分析 Argon 的新证据与真实工作表现。

Gemini 4 Argon 与跑分争议:一张旧榜单能说明什么?

一张发布时的成绩单,能让人对下一代 AI 模型有多大信心?2026 年 10 月 1 日,Ishu Agrawal 在 X 上重新贴出 Gemini 3.1 Pro 的官方基准表,并质疑围绕 Gemini 4 Argon 的乐观情绪。Logan Kilpatrick 随后的回复,把话题引向 Google 内部的大规模工程师测试。

这段对话值得讨论,因为它同时暴露了两种容易走偏的判断:把榜单优势直接当成日常体验优势,以及因为过去的体验不佳,就忽略新模型已经出现的新证据。读懂这场争论,需要把历史分数、测试条件和当前进展放回各自的位置。

原帖与回复到底说了什么?

Ishu Agrawal(@ishuagra02 原帖)发表于 2026 年 10 月 1 日 10:32,以下为中文译文,时间为北京时间:

顺便一提,这是 Gemini 3.1 Pro 发布时的官方基准测试,几乎全线碾压了 Opus 4.6。

我并不是说 Gemini 4 Argon 会差,但考虑到 Google 以往的表现,大家居然连一点怀疑都没有,这实在令人难以置信。

同日 12:53,Logan Kilpatrick 直接回复。中文译文如下:

如今,我们在 Google 内部大规模测试模型方面已经有了很大进步。因此,可以认为,大多数新版 Gemini 在发布前,都会经过数千名软件工程师长达数周的测试;希望这已经切实缩小了基准测试与实际使用表现之间的差距。

Ishu Agrawal 英文原帖、基准图表及 Logan Kilpatrick 直接回复的浏览器截图。
英文原帖及 Logan 回复的浏览器截图,截取于 2026 年 10 月 2 日。点击放大查看。
Ishu Agrawal 原帖及 Logan Kilpatrick 回复的完整中文译文图。
原帖与回复的中文译文图,由 FindGoodAI 翻译整理。点击放大查看。

这里的“几乎全线碾压”是 Ishu 的概括,“数千名工程师、数周测试”是 Logan 的说法。前者要接受数据检验,后者说明一种测试过程;两者都不能单独替代最终用户的使用结果。Logan 的原文还用了“hopefully”,表达的是希望差距已缩小,并没有公布差距缩小了多少。

旧榜单确实很强,但并非全面领先

首先要校准时间:Gemini 3.1 Pro 的正式发布公告日期是 2026 年 2 月 19 日。推文引用的是这代模型发布时的表格,并不是 10 月的最新模型排名,更不是 Argon 的测试成绩。

下面选取截图中具有代表性的项目,并与 Google 官方模型卡核对。百分比为对应测试的得分;GDPval-AA 使用 Elo,不是百分比。

2026 年 2 月官方发布表中的部分结果
测试与条件 Gemini 3.1 Pro
Thinking: High
Opus 4.6
Thinking: Max
ARC-AGI-2 77.1% 68.8%
GPQA Diamond,无工具 94.3% 91.3%
Terminal-Bench 2.0,Terminus 2 68.5% 65.4%
Humanity’s Last Exam,无工具 44.4% 40.0%
Humanity’s Last Exam,搜索(blocklist)与代码 51.4% 53.1%
SWE-bench Verified,单次尝试 80.6% 80.8%
GDPval-AA,Elo 1317 1606
τ2-bench,零售 90.8% 91.9%
τ2-bench,电信 99.3% 99.3%

这些数字足以说明 Gemini 3.1 Pro 在多项测试中表现出色,也足以否定“各方面都占优”的解读。SWE-bench Verified 的 0.2 个百分点差异,不能据此认定存在显著胜负;但它确实不是 Gemini 的数值领先。GDPval-AA 的 Elo 也不能拿来计算“强了百分之多少”。

更值得留意的是,HLE 的无工具和带工具结果呈现了不同的相对次序。这提醒我们:用户接触到的能力往往取决于整个任务系统。不能仅凭这两行数字,就把差异归因于某一个工具或某一项模型设计。

为什么同一张表,仍不等于同一场考试?

Google 的评测方法说明明确写到,其他厂商的成绩通常采用其自报结果,另有注明的项目除外;SWE-bench 对比使用了不同的代理脚手架和基础设施。因此,同表列出不代表所有模型都在同一套软件与资源预算下重新测过。

代理脚手架可以理解为模型周围的工作环境:它能调用什么工具,如何读取文件,什么时候重试,怎样检查结果。一个模型擅长回答独立问题,并不能自动保证它在包含环境配置、跨文件修改、失败恢复的完整任务中同样领先。

这也解释了为什么“我用起来没有榜单那么好”值得调查,却不能直接推出“榜单是假的”。需要进一步拆开:具体是哪类任务?使用了什么版本和入口?给了多少时间与上下文?失败发生在理解需求、执行工具,还是验收结果?只有把这些条件记录下来,争论才会变成能复现的问题。

数千名工程师内测,能回答哪些问题?

如果模型在真实代码库里被持续使用,大规模内测有机会发现短测题难以覆盖的问题:执行到一半忘记约束,修改了不该动的接口,测试失败后反复绕圈,或者交付了看似完整却无法维护的结果。这是内测具有价值的原因。

但“很多人测过”仍没有回答几个关键问题:与哪个基线比较?成功如何定义?失败和弃用案例是否计入?工程师花了多少时间纠错?参与人数说明覆盖规模,不能直接换算成生产力提升。内部反馈、外部评估与用户自己的验收,应当提供不同层面的证据。

因此,对 Logan 回复的合理理解是:Google 表示正在改善从评测到实际使用之间的验证过程。它值得跟进,但这条回复本身没有证明这种差距已经被消除。

评价 Argon,也必须把新证据算进去

截至本文核查日 2026 年 10 月 2 日,Argon 已不是传闻。Google 于 9 月 30 日正式宣布 Gemini 4 Argon,先向 Fairwind 计划中的可信网络防御者逐步开放,广泛面向开发者和消费者的可用性仍待推进。

早期第三方证据也已经存在。Artificial Analysis 在 9 月 30 日的直接评测中,报告 Argon 在 high reasoning 设置下取得 AutomationBench-AA 78%、Terminal Bench 4 57%。这比单纯依据一张旧发布表讨论新模型,更接近需要回答的问题。

这些结果仍有清楚的适用范围:它们来自特定任务与配置,并非所有工作流的通用保证。尤其不能把 Terminal Bench 4 的 57% 与旧表 Terminal-Bench 2.0 的 68.5% 直接相减,宣称模型退步;测试版本不同。也不要把 AutomationBench-AA 与其他同名近似评测的分数混用。

合理的怀疑,应当允许新证据改变判断。过去的体验可以提高验证要求,却不应预先决定下一代模型的结论。

真正选模型时,应该记录什么?

对于需要用 AI 完成工作的团队,我们建议从自己反复遇到的任务出发,保留相同输入与明确的验收标准,再比较不同模型。以修复程序错误为例,验收不应停在“生成了代码”,而要检查能否运行、是否引入回归、是否满足原有约束,以及别人能否接手维护。

  • 可用结果比例:有多少任务通过验收,而不是回答看上去像完成了。
  • 人工返工时间:包括检查、修正、补上下文和重新解释需求。
  • 完成任务的总成本:把失败重试、工具调用和人工处理一起考虑。
  • 稳定性与等待时间:反复运行是否可靠,失败能否及时被发现和恢复。

这场争论最有价值的地方,是提醒我们把注意力从发布表里加粗的数字,移向最终交付的工作。Gemini 3.1 Pro 的优势应该得到承认,旧榜单的边界也应该被看见;Argon 则应由它自己的新数据和实际结果来证明价值。对任何一家厂商,都应采用同样的标准。

编辑说明:本文为资料核验与观点分析,未由 FindGoodAI 独立复跑上述基准。X 原文与回复关系已通过官方嵌入数据核对;译文由 FindGoodAI 整理。历史分数保留发布时口径,核查日期为 2026 年 10 月 2 日。

资料与来源

Ishu Agrawal:讨论原帖 ↗

Logan Kilpatrick:直接回复 ↗

Google:Gemini 3.1 Pro 发布公告(2026-02-19) ↗

Google DeepMind:Gemini 3.1 Pro 模型卡与历史成绩 ↗

Google DeepMind:Gemini 3.1 Pro 评测方法 ↗

Google:Gemini 4 Argon 公告(2026-09-30) ↗

Artificial Analysis:Argon 独立评测(2026-09-30) ↗

SHARE THIS ARTICLE

复制链接,保存或分享这篇文章。

相关工具

MORE ARTICLES

更多文章

全部文章 ↗