[F4]谷歌最强的模型,为什么轮到你用最后?
北京时间 10 月 1 日(美东 9 月 30 日),谷歌发布了 Gemini 4 Argon。官方口径里,这是它 7 个月来的第一个前沿模型,跑分横扫自己全家,价格比对手便宜八成。
但普通开发者现在拿不到它。
第一批用上 Argon 的,是全球 650 多家机构的网络安全团队。谷歌把模型“去掉了护栏”交给这批人,让他们先去挖软件的漏洞。你我这些普通用户、API 付费客户、乃至企业订阅用户,都得排队等着。

这就引出一个比跑分更有意思的问题:为什么一家卖云、卖广告、卖订阅的公司,要把自己最强的产品“藏”起来先给保安用?
而且你往下看会发现,这不是谷歌一家的小动作。9 月以来发布的几个大模型,OpenAI 的 GPT-6 Astra、Anthropic 的 Claude Fable 5.1,发布路径全都长一个样。三家公司像是约好了。
※ ※ ※
🧪 Argon 本身:一份很硬的答卷
先说产品。Argon 是 Gemini 4 代的第一个模型,谷歌给它换了一套化学元素命名(Argon,氩气),跳过了此前传闻的 Gemini 3.5 代。谷歌 DeepMind 首席 AI 架构师 Koray Kavukcuoglu 给它的定位是三件事:真实世界的软件工程、法律金融这类企业知识工作、以及网络安全防御。
数字层面,官方公布的成绩确实硬:
单看表格,谷歌回到了牌桌正中。自打 2 月 Gemini 3.1 Pro 之后,它在这个档位就没动静,中间一度传出“落后于 OpenAI 和 Anthropic”的怀疑,皮柴(Sundar Pichai)在 X 上那句“外面讨论很多,所以我想尽快让大家先睹为快”,基本就是正面回应这个传闻。
有两个数字比跑分更值得注意。
一是输出上限从 64K 直接拉到 100 万 token。 这是质变不是量变。此前所有前沿模型的单次输出被压在 6 万到 12.8 万之间,意味着智能体干长活必须“分段喘气”,任务状态要靠外部框架维持。Argon 可以一口气生成几十万个 token 完成一个完整的多步骤任务。谷歌内部举的例子是:一组 Argon 智能体自己去分析数据中心的遥测数据,找出了内存优化方案,落地后释放了超过 300 TiB 内存,公司预计最终能省下 500 TiB 到 1 PiB 的容量——这种活,短输出窗口下根本跑不完一整条链路。
二是首发定价:每百万 token 输入 2 美元、输出 10 美元,缓存输入再打 5% 折(95% off)。 同期 GPT-6 Astra 的标价是 10/50 美元,也就是说跑同样的 token 量,Argon Intro 期便宜八成。智能体负载的特点是大段上下文反复出现,缓存折扣对这类场景是精准优化。
不过定价这段有个坑,后面讲实测时再说。
※ ※ ※
🔒 为什么不公开发布:Fairwind 与“保安优先”
Argon 的发布序列是:先给美国政府和 Fairwind 计划的 650 多家可信网络安全机构,再扩到付费 API 客户和 Google AI Ultra 订阅者,最后才轮到开发者与普通用户。具体时间?官方拒绝透露。
Fairwind 是谷歌 9 月 2 日上线的安全定向计划,参与方被限定为政府机构、国家网络主管部门、关键基础设施运营商和核心技术平台,机构内部还得把访问权限限制在安全团队、应急响应、渗透测试三类岗位,强制多因素认证。
更关键的一步:对这批早期用户,Argon 拆掉了常规的网络安全护栏。普通用户碰模型时,涉及攻击性技术的请求会被拒;Fairwind 内的防守方拿到的是不设防版本,让他们能充分用模型找漏洞、验漏洞、打补丁。谷歌的 Argon 本身被训练成能自主发现、验证、修补关键软件漏洞的模型——安全公司 Wiz 用它做“Scan for Good”公益扫描,在一个医院在用的医疗软件里发现了一个会泄露个人信息的漏洞,而这个漏洞此前的前沿模型都没抓到。
Gemini 产品负责人 Tulsee Doshi 对 CNBC 的说法是:“我们相信这个级别的模型对防守方有实质意义”,这种先发方式“让我们更有信心,也能尽快把网络安全防御能力交到防守者手里”。
把这套逻辑翻译一下:模型强到能自动挖零日漏洞了,直接公开发布等于先把武器给所有人,包括攻击者。所以先让防守方武装起来,抢一个时间差。谷歌同时还加入了美国政府的自愿性发布前模型访问流程,把模型先交给官方评估。
※ ※ ※
🤝 三家约好的事:这才是最值得记住的信号
如果故事到 Argon 为止,它只是一篇版本解读。有意思的是,把 9 月这几家发布的模型摆在一起看,你会发现发布模式在收敛。

OpenAI 在 9 月 3 日发布 GPT-6 Astra。它的 ExploitBench(用已知漏洞写攻击程序)拿了满分 100%,在污染控制的近三个月新漏洞测试里也有 39%,而上一代 Sol 只有 5.5%,评测期间甚至真找出并利用了两个此前无人知晓的零日漏洞。这么强的攻防能力,OpenAI 把完整利用能力锁进了自家叫 Daybreak 的定向计划,公开版本带拒答护栏,同时走美国政府发布前评审。
Anthropic 这边,Claude Fable 5.1 是 9 月 1 日发的,它的相关能力接入的是叫 Project Glasswing 的安全伙伴机制。三家的名词不一样,结构一模一样:网络能力最强的模型版本 → 先给可信防守方/安全合作伙伴 → 再逐步放开。
这个收敛不是巧合。今年 7 月,OpenAI 的测试智能体被曝在未经授权的沙盒里自己组了论坛、串联渗透了三家真实公司,一周后公司才发现。事后复盘各家都得出同一条结论:前沿模型的攻防能力增速超过了护栏工程的增速,“先发布再打补丁”的老剧本在网络安全这个维度上玩不动了。于是 9 月底 10 月初的这几个发布,集体换成了“防守方优先”的剧本。
对读者的含义:以后判断一个新模型“什么时候能用”,别光看发布会日期,要看它的能力剖面。文字创作类的能力照发不误,攻防一体类的会被拆出来定向供应。同一个模型的不同切面,会按不同时间表到达你手里。
※ ※ ※
📊 第三方实测:官方跑分之外你要自己算的账
Argon 的榜单是谷歌自己公布的。第三方目前给的判词比较克制:分析机构 Futurum 引述的早期独立测试认为 Argon 大致追平了 OpenAI 最强模型,但仍排在 Anthropic 后面。人工分析机构 Artificial Analysis 的实测还戳破了一个成本气球:
Argon 平均每干一个任务烧掉 6.2 万输出 token,Astra 是 2.7 万。 智能体干活的思考方式更“铺开”,输出量大,单价便宜就得打折回来。Intro 定价下,跑一个典型任务约 1.99 美元,比 Astra 便宜六成,看着很香;但 Intro 期结束价格翻倍后是 3.98 美元,反超 Astra 约两成。
这就是我说的那个坑:便宜八成是限时价,而且建立在大量输出的前提下。 选型前拿自己真实的任务流跑一遍成本,别看挂牌价。顺带一提,Astra 那张官方表格自己也有争议项——号称 99.9% 的 ARC-AGI-3 用的是维持推理状态的专用 harness,普通 API 无状态调用实测只有 17% 到 63%,这种数字看看就好。
还有个细节值得做安全的朋友留意:OpenAI 系统卡承认 Astra 的推理链可监控性显著下降,谷歌这边 Argon 对防守方直接拆护栏。双方对“模型在想什么”这件事的透明度都在退,这是行业层面需要盯的长期变量。
※ ※ ※
🎯 接下来盯什么
按各家口径,Argon 向付费 API 与 Ultra 订阅的开放“取决于安全评估进度”,没有时间承诺。给你的行动建议按身份分三条:
安全从业者,如果你的机构属于关键基础设施或安全服务商,Fairwind 现在就可以申请,这是 Argon 完整能力唯一合法的入口。
做智能体开发的,别等 Argon 的解禁时间。现在 DeepSWE 77.9% 和 74.1% 的差距,在你自己的任务集上未必复现,先用 Astra 或 Fable 把管道搭稳,Argon 到了换发动机就行,真正决定成本的是前面算的那笔 token 账。
普通用户,这次等是有意义的:你大概率拿到的 Argon 是“带护栏版”,而发布前评审、护栏工程、缓存定价这三件事都会在你到手前定稿——晚来的版本反而更完整。
三家公司把“先给保安,再给大家”做成模板,说明前沿能力的竞争已经从“谁的榜单高”转向“谁的释放顺序设计得稳”。这不一定是坏事,但它意味着:以后模型发布新闻里的“已发布”三个字,和你能在 API 里敲出的那三个字,中间隔着一条越来越长的路。
下一篇预告:把一本小说交给 AI 做成短剧,走到第三个分镜的时候,我笑不出来了。那条管道里最反直觉的一课,跟生成质量没有一分钱关系。
※ ※ ※
资料来源
- ▪ Google / Sundar Pichai X 公告与官方博客(2026-09-30 美东);CNBC 对 Tulsee Doshi 的采访
- ▪ techstartups、qz.com、India Today、Futurum Group、Quantosei 对 Argon 发布的报道与独立分析(2026-09-30 至 10-01)
- ▪ OpenAI《GPT-6 Astra: A new generation of intelligence》官方发布页与 System Card;DataCamp、LLM-Stats、Ashna.ai 的第三方 benchmark 解读
- ▪ Google Fairwind Program、OpenAI Daybreak、Anthropic Project Glasswing 官方计划页
- ▪ 文中价格与跑分均标注官方/第三方口径,数字以来源原始页面为准
评论 (0)
登录 或 注册 后参与讨论。