跳到正文
Gemini 4 Link
English简体中文繁體中文DeutschEspañolPortuguês

Gemini 4 Argon 独立实测:谷歌自测表没写的东西,第三方测出来了

谷歌在 2026 年 9 月 30 日发布了自家的一张跑分对照表。同一天,Artificial Analysis 用自己的一套评测也跑了一遍 Argon 并公布了结果。两张表回答的其实是两个问题。

一张瀑布图,标题为从 Gemini 3.1 Pro Preview 到 Gemini 4 Argon 的每任务智能指数成本。起点 0.67 美元,因 token 用量增加 1.76 美元升至 2.43,因单价上调 2.19 美元升至 4.62,因缓存折扣扩大到 95% 减去 0.64 美元升至 3.98,最后因五折优惠减去 1.99 美元,落到 1.99 美元
1.99 美元这个数字是怎么算出来的,以及优惠结束后会变成多少。来源为 Artificial Analysis。

第二张表在同一天出现

谷歌在 2026 年 9 月 30 日的公告末尾附了一张十八行的对照表。同一天,Artificial Analysis 也给出了自己对这款模型的读数,用的是它自己跑的评测,而不是厂商提供的数字。

在 Artificial Analysis 的智能指数上,Gemini 4 Argon 在高推理档位拿到 53 分,与 max 档的 GPT-6 Astra 持平,比 GPT-6.1 Sol 高 1 分。和谷歌自己近一年半的成绩比,跨度更大,比 Gemini 3.1 Pro Preview 的 30 分高 23 分,比 Gemini 3.8 Flash 高 12 分。

这份独立报告由此得出一个结论,谷歌重新回到智能水平前三的位置。Argon 也是谷歌七个多月来第一款高于 Flash 级别的闭源模型,这和谷歌旗舰线十个月的空窗正好对上。

本文数字来自谷歌 2026 年 9 月 30 日的 Gemini 4 Argon 公告,以及 Artificial Analysis 同日发布的独立评测结果。

Artificial Analysis 的两张图。上方柱状图按智能指数 v4.3 给模型排序,Gemini 4 Argon 为 53 分,与 GPT-6 Astra 的 53 分持平,高于 GPT-6.1 Sol 的 52 分。下方散点图把智能指数与每任务成本画在一起,Gemini 4 Argon 落在被绿色标出的高性价比象限内,坐标为 53 分与 1.99 美元
Artificial Analysis 智能指数,以及同分数与每任务成本的对照。来源为 Artificial Analysis,2026 年 9 月 30 日。

为什么这一轮要等独立评测

发布前三周,一个标注为 gemini-3.8-flash 的匿名模型出现在公开竞技场的盲测里,在代码、图形和智能体任务上明显强过真正的 Gemini 3.8 Flash。开发者普遍推断这就是 Gemini 4 的早期版本,但显示名一直没有变,谷歌也从未认领。

2026 年 9 月 18 日流传出的一张基准图,把这个未确认的模型排在 GPT-6 Astra 和 Claude Fable 5.1 之前,覆盖长流程编程和计算机操作,还附了一份据称的定价。这些数字在多家媒体之间转了一圈,始终没有落到一款谷歌真正点名过的模型上。

这并不是说那张流出的图是错的,而是说它无法被验证。9 月 30 日出现的东西性质不同,它带着公开的评测框架、写明的推理档位和一份可以拿去对照公开价目表的成本数字。

  • 竞技场上的那个马甲显示为 gemini-3.8-flash,谷歌从未确认过它的身份。
  • 流传的基准图日期是 2026 年 9 月 18 日,比正式发布早十二天。
  • Artificial Analysis 自己跑评测,不转述厂商提供的数字。

每个任务 1.99 美元,便宜来自价目表

预算真正在意的是每个任务的成本。按当前五折的上市优惠价,Gemini 4 Argon 每个智能指数任务花 1.99 美元,max 档的 GPT-6 Astra 是 3.26 美元。在智能水平相近的前提下,Argon 只花了对手六成的钱。

但和更便宜的那款 OpenAI 模型比,方向就反过来了。同一个评测里,GPT-6.1 Sol 的每任务成本比 Argon 低 2.7 倍。而优惠一旦结束,Argon 的数字会升到 3.98 美元,变成 GPT-6 Astra 的 1.2 倍,不再便宜。

原因不在效率。Argon 平均每个任务输出约 6.2 万 token,GPT-6 Astra 只有 2.7 万,它是靠花更多 token 换到同样的分数,赢在单价上。缓存输入也变便宜了,折扣从 Gemini 3.8 Flash 的九折优惠提到 95%。

方案每百万 token 输入 / 输出每个智能指数任务成本
Gemini 4 Argon(high)优惠价2 / 10 美元1.99 美元
Gemini 4 Argon(high)标准价4 / 20 美元3.98 美元
GPT-6 Astra(max)10 / 50 美元3.26 美元
GPT-6.1 Sol(max)官方未按同一口径公布约 0.74 美元,换算所得

Sol 那一行并不是官方公布的每任务成本,而是用报告里给出的 2.7 倍关系对 1.99 美元反推出来的,放在这里只是为了看方向,不能当作报价使用。

15% 的幻觉率,同级最低

这份独立报告里最锋利的结论不是能力分数。在 AA-Omniscience 上,这项评测同时考察答得对与不知道时肯不肯说不知道,Gemini 4 Argon 的幻觉率是 15%,是智能指数 45 分以上所有模型里最低的一个,对比之下 GPT-6 Astra 是 51%,GPT-6.1 Sol 是 54%。

把准确率那一半放进来,画面就更细。Argon 答对的比例是 50%,比 Gemini 3.1 Pro Preview 低 5 分,比 GPT-6 Astra 的 63% 低 13 分。而在 AA-Omniscience 的综合分上,三款模型只差 1 分以内,Argon 和 Sol 是 42 分,Astra 是 43 分。

这个拆分说明的是一款宁可拒答也不硬猜的模型。对于无人值守、要连续跑很长任务链的工作来说,答错的代价比答不出更高,所以指数记录下来的这个取舍,价值大过头条上的能力提升。

Artificial Analysis 的两张并排柱状图。左边是 AA-Omniscience 准确率,最高 67% 递减到 16%。右边是不幻觉率,即 1 减去幻觉率,Gemini 4 Argon 以 85% 排在最前面
AA-Omniscience 的两半。Argon 在不编这一点上排第一,在知道答案这件事上处在中游。来源为 Artificial Analysis。

智能体能力大幅补课,但还不是第一

上一代 Gemini 最弱的一环就是智能体,这次独立跑分显示补课幅度不小。Gemini 4 Argon 在 AutomationBench-AA 上以 78% 排第一,领先 max 档的 Claude Sonnet 5.5 七个百分点,而这项基准考的是能否端到端跑完真实的业务流程。

终端类任务给出的是另一半答案。在 Terminal Bench 4 上,Argon 只有 57%,比 Gemini 3.1 Pro Preview 高 53 分,但同时落后三款模型,Claude Sonnet 5.5 是 64%,Claude Opus 5.5 是 60%,GPT-6 Astra 是 59%。

在考察知识工作的 AA-Briefcase 上,Argon 拿到 1494 Elo,靠的是 65% 的评分细则通过率,这也是 Artificial Analysis 记录到的最高值。不过分项并不好看,分析质量为 1576 Elo,呈现质量只有 1308 Elo。

Artificial Analysis 的两张柱状图。AutomationBench-AA 上 Gemini 4 Argon 以 77.5% 排第一,其后是 Claude Sonnet 5.5 的 71.3%、Claude Opus 5.5 的 69.5% 和 DeepSWE 的 68.9%。Terminal-Bench 4.0 上 Claude Sonnet 5.5 以 63.6% 排第一,其后是 Claude Opus 5.5 的 59.6% 和 GPT-6 Astra 的 59.1%,Gemini 4 Argon 为 57.1%
AutomationBench-AA 与 Terminal-Bench 4.0,两项都由 Artificial Analysis 独立评测。

同一项基准,两套结论

Terminal-bench 4.0 同时出现在两张表里,而它们对谁领先的说法并不一致。谷歌的表把 Argon 放在 57.4%,落后 Claude Opus 5.5 九个百分点。独立跑分把 Argon 放在 57%,落后的是 Claude Sonnet 5.5 的 64%,Opus 5.5 是 60%,GPT-6 Astra 是 59%。Argon 自己的分数几乎一样,围绕它的说法却完全不同。

厂商表格也是某些结果的唯一出处。Harvey 法律智能体基准只在那里出现,Argon 19.6%,GPT-6 Astra 是 5.4%,Claude Opus 5.5 是 3.8%。考察 256k 到 1M 超长上下文的 GraphWalks 也只在官方口径下显示出超过十个百分点以上的领先。这两项都还没有独立复现。

两张表回答的是不同的问题。厂商表说明的是在厂商自己选定的框架和设定下,模型能做到什么。独立表说明的是换个人来跑,它又是什么样。对一款仍然只开放给审核过合作方的模型来说,没有消费者入口,也没有任何可以被重复的会话,只有后一种数字能被房间外的人核查。

Terminal-bench 4.0谷歌公布的表格Artificial Analysis 实跑
Gemini 4 Argon57.4%57%
Claude Opus 5.566.4%,该表中的领先者60%
Claude Sonnet 5.5未列入64%,本次实跑的领先者
GPT-6 Astra不是该行最高的那个点59%

两张表都没有错。它们的评测框架、提示词和推理档位都不一样,这正是为什么单独一个排名数字从来不该被单独看待。

拿到第二份意见之后该怎么做

还有一个独立细节解释了长链路任务为什么变得可行。Artificial Analysis 测试了一个叫 Long Decode Continuation 的 Gemini API 特性,它会把长响应暂停,再通过后续调用续写,所以推理可以跑到 100 万输出 token 而不触发请求超时,上一代的输出上限是 6.4 万。上下文窗口为 100 万 token,输入支持文本、图像、视频和语音,输出为文本。

开放范围并没有因为这些数据而改变。Argon 仍然只给 Fairwind 项目中经过审核的防御机构,付费 API 客户和 Google AI Ultra 订阅者是下一批,没有日期。上面所有结果现在都无法在普通账号里复现,这也是把两张表都当作方向性参考的最强理由。

等待期里真正值得做的事,正好是独立数字奖励的那一件。拿今天能调用的模型建一套固定提示词,把输出记下来,等 Argon 开放后用同一套题原样重跑。一款新模型和你自己的基线比,比它和任何别人的表比都更有意义,包括这一篇。

  • Argon 目前只能通过 Fairwind 项目接触。
  • 输出上限从 6.4 万 token 提升到 100 万 token。
  • 现在建好的固定提示词集合,是日后测试 Argon 最省事的方式。

常见问题

Gemini 4 Argon 的独立跑分是多少?

Artificial Analysis 在自家智能指数上给出 53 分,与 GPT-6 Astra 的 53 分持平,比 GPT-6.1 Sol 的 52 分高 1 分。这个分数比 Gemini 3.1 Pro Preview 高 23 分,比 Gemini 3.8 Flash 高 12 分。

为什么独立跑分和谷歌官方数字不一样?

因为两者测的不是同一件事。厂商表格报的是自家设定下跑出来的成绩,Artificial Analysis 用自己的评测集、提示词和评分器重跑一遍,推理档位和外围封装都可能不同,即使基准名字一样也是如此。

Gemini 4 Argon 每个任务要花多少钱?

按当前五折优惠价,Artificial Analysis 测得每个智能指数任务 1.99 美元,同档推理下的 GPT-6 Astra 是 3.26 美元。优惠结束后同一任务升到 3.98 美元,约为 GPT-6 Astra 的 1.2 倍。

为什么 Argon 用的 token 更多反而更便宜?

因为折扣打在单价上,不是打在用量上。Argon 平均每个任务输出约 6.2 万 token,GPT-6 Astra 是 2.7 万,所以省钱来自更低的单价,而不是做得更少。

15% 的幻觉率是什么水平?

在 AA-Omniscience 上为 15%,是智能指数 45 分以上模型里最低的一个。GPT-6 Astra 是 51%,GPT-6.1 Sol 是 54%。不过它的准确率只有 50%,低于 GPT-6 Astra 的 63%。

Gemini 4 Argon 的智能体能力是最强的吗?

还不是。它在 AutomationBench-AA 上以 78% 排第一,领先 Claude Sonnet 5.5 七个百分点。但在 Terminal Bench 4 上只有 57%,落后 Claude Sonnet 5.5 的 64%、Claude Opus 5.5 的 60% 和 GPT-6 Astra 的 59%。

100 万 token 输出上限是怎么实现的?

靠一个叫 Long Decode Continuation 的 Gemini API 特性。它会把长响应暂停,再通过后续调用续写,所以推理可以跑到 100 万输出 token 而不触发请求超时。上一代的输出上限是 6.4 万 token。

本站现在能调用 Gemini 4 Argon 吗?

不能。Argon 目前只开放给 Fairwind 项目中经过审核的防御机构,付费 API 客户和 Google AI Ultra 订阅者是下一批,没有时间表。本站工作台跑的是 Gemini 3.8 Flash,也是目前真正能调用的模型。

拿自己的基线去量它

工作台只列出账号真正能调用的模型,每次请求前都会给出服务端报价。

进入聊天工作台