止观
AI前沿观察

OpenAI 把太阳月亮星星编成一家,又放了个通宵干活的点

9 月这一个月,OpenAI 连发了三次东西:9 月 3 日的 GPT-6 Astra,9 月 22 日的 GPT-6 Sol 和 Luna,还有 9 月 29 日 DevDay 上的 Dots。发布会词一个比一个响,“AGI 时代”都喊出来了(Axios 的原标题)。我的第一反应不是牛逼,是先翻价格表。

翻完我承认,这次真让我坐直了。因为这家公司第一次把“智能”按水电煤的规格来定价了——一度电、一吨水、一档工业用电,明码标价,各取所需。这比任何 benchmark 数字都更能说明行业到了哪一步。

※ ※ ※

三个名字,三档电价

先说命名。Astra 是星,Sol 是太阳,Luna 是月亮。营销部这次难得没偷懒:名字本身就是产品说明书。

看官方 API 价目(每百万 token,美元):

模型输入输出定位
GPT-6 Astra$10$50最难的端到端工作:深度推理、研究、电脑操作
GPT-6 Sol$2$10日常复杂任务与软件开发,“每天用的那款”
GPT-6 Luna$0.10$0.50高频窄任务:摘要、抽取、分类、路由

从 Luna 到 Astra,输入价差一百倍。注意,这不是十年前的价差,是同一代模型、同一批论文、同一个九月里的价差。

更狠的是官方自己的对照:Sol 和 Luna 比三个月前的 GPT-5.6 同档直接降价 50%,理由是缓存和推理效率改进,“省下来的直接还给用户”。发布同一天,Amazon Bedrock 就宣布两款模型 GA(TechCrunch、AWS 官方通稿可查)——企业渠道一天打通,这不像新品,像基础设施交割。

我认识的做 agent 的人,过去半年的痛苦都绕不开一件事:任务链里 90% 的环节根本不需要旗舰模型,但架子搭起来了就换不下来,因为分类、抽取这些“小活”一旦出错,后面全崩。Luna 的定价等于承认了这个架构真相:一条 agent 流水线的合理形态,本来就该是 Luna 打底、Sol 干重活、Astra 只在真正难的节点出场。OpenAI 现在把三档都做好了,还带同一个 1M 上下文窗口——分层调用从一个你自建的能力,变成平台原生的一张账单。

※ ※ ※

基准测试的口径变了,这才是行内人该盯的

Astra 发布那两天,各家报的都是“第一”。Sol 和 Luna 这次,OpenAI 自己发的对比全是另一种句式:

  • ▪ DeepSWE v1.1(真实代码库长任务):Sol max 档 68.8%,比 Claude Fable 5 的最高分 69.9% 只差 1.1 个百分点——但每任务成本低约 80%。Luna max 档 66.6%,和 Opus 5、Fable 5 的 medium 档相当,成本分别是它们的 7% 和 4%。
  • ▪ OSWorld 2.0(电脑操作):Sol xhigh 档 60.5%,对 Opus 5 medium 档的 60.3%,赢一点点,便宜 80%。
  • ▪ 事实性:内部评测(拿真实对话里用户标记过的事实错误回归测试),Sol 的错误率约为前代一半,“接近 Astra 级”。

看出来了吗?没有一项在争“世界第一”,每一项都在争“同分最低成本”和“同成本最高分”。发布材料的重心从能力曲线挪到 cost-intelligence 曲线,这不是文案风格问题,是竞争维度真的换赛道了。

这里有个普通读者容易错过、但做工程的人应该立刻拿小本本记下的旋钮:effort(推理档位)。Astra 支持 low/medium/high/xhigh/max 五档。第三方 Artificial Analysis 测过:同一个评测任务,low 档成本 $0.46,max 档 $1.67,差 3.6 倍;智能分只从 57 挪到 61。

翻译成大白话:模型厂的计费表上多了一个你亲手可以拧的龙头。以前我们说“换个便宜模型”,以后说“同一模型调低一档”。用哪个模型、拧到哪一档,会成为 agent 架构里和路由逻辑同等重要的一等公民。OpenAI 公告里 Sol 和 Luna 的分数都特意标了 effort 档位(“at max effort”“at xhigh effort”),行规已经开始变了。

※ ※ ※

星星的底座:十万张卡和一条看不见的思维链

再说 Astra 本身的两个技术注脚,都在维基百科和 Fortune 的报道里。

第一,训练规模。OpenAI 研究 VP Aidan Clark 对记者说,这是他们“by far”最大的一次预训练,第一次在得州 Stargate 基地用上超过 100,000 张 GPU。算力集中到这种程度,本身就在解释为什么它敢同时把下游两档砍到那个价——不是慷慨,是推理侧的成本曲线真的弯下来了。

第二,推理新法。Astra 用了一种叫 “recurrent depth”(循环深度,也叫 looped transformers)的技术,效率换智能。但同一段报道里跟了一句要命的话:这种方式会让模型的部分甚至全部思维链不可见。安全圈对模型可监控性(monitorability)的担忧立刻起来了——你没法审计一条你看不见的推理链。考虑到今年 7 月那次 Hugging Face 事件后 OpenAI 特意推迟发布加固护栏,这条线迟早会扯进监管讨论,先记下。

顺手提醒用 API 的朋友一个账单陷阱:Astra 的 1.05M 上下文是真给,但单次输入超过 272K token 后,整单请求按输入价 2 倍、输出价 1.5 倍计费。缓存输入便宜九成($1/M),可缓存写入要按 1.25 倍收。长上下文不是免费水库,是阶梯水价。

※ ※ ※

Dots:把我们自己搭的东西,包装成产品卖给白领

9 月 29 日 DevDay 的主角是 Dots。官方口径:always-on 的自主 agent,跑在 Astra 上,你给它一个目标、划定它能自己做什么的边界,它在自己独立的电脑上跨应用干活,两次对话之间持续推进,碰到需要你判断的事再回来找你。今天起在 ChatGPT 内向 Pro 和 Business Premium 用户灰度,从 Codex 或 ChatGPT 都能唤起;可以通过 Slack、Teams 给它派活;未来是“一队 dots 替你协同工作”。还能开“专科 dot”——单独给它配身份、凭据和工具,安全侧对接微软 Agent 365。

看起来眼熟吗?太眼熟了。给 agent 一台自己的机器、常驻调度、子任务分工、结果回收人审——这套东西,任何一个在 2026 年玩过 Codex、Claude Code 加 cron 的开发者都手搓过。OpenAI 官方自己的内部数据也佐证了 agent 化的烈度:研究员按 API 价折算的日均 token 消耗,中位数超过 $600,90 分位超过 $7,000(公告原文引的)。开发者早就这么活了。

所以 Dots 真正的动作不是发明了什么,而是两件事:

一是把 harness 零售化。卡通浮空的“点”形象、起名字、像发消息一样派活——TechCrunch 的标题很刻薄但精准:“bubbly agentic avatar”,对标 Meta 的 Muse。把终端里的东西变成小白领敢点的东西,这是产品力,别小看。

二是把常驻的模型定成了 Astra。注意这点的分量:always-on 意味着电表不停。跑在 $10/$50 的模型上的 24×7 agent,OpenAI 没有细说空闲计费怎么算,这是我觉得上线前必须盯的账单黑洞。吹“Dots 替你上班”之前,先问一句:它摸鱼的时候收钱吗?

※ ※ ※

一段可以直接跑的账

选型这种事,报数字最诚实。给你一个能贴进终端跑的算账脚本——按一个典型中等任务(输入 8K token、输出 4K token)算三个档的单任务成本:

prices = {  # USD per 1M tokens: (input, output)
    "gpt-6-astra": (10, 50),
    "gpt-6-sol":   (2, 10),
    "gpt-6-luna":  (0.10, 0.50),
}
IN, OUT = 8_000, 4_000          # 一次典型任务用量
DAILY_TASKS = 10_000            # 每天一万单

for model, (pi, po) in prices.items():
    cost = IN/1e6*pi + OUT/1e6*po
    print(f"{model:12s} 单任务 ${cost:.4f}  月账单(30天) ${cost*DAILY_TASKS*30:,.0f}")

# gpt-6-astra  单任务 $0.2800  月账单(30天) $84,000
# gpt-6-sol    单任务 $0.0560  月账单(30天) $16,800
# gpt-6-luna   单任务 $0.0028  月账单(30天) $  840

同样一万单一天,选错档,月底差出一台车。API 调用姿势没变化,model id 就是 gpt-6-sol、gpt-6-luna,OpenAI SDK 直接换名即可。架构上的正确打开方式也清楚了:分类、抽取、路由这类高吞吐窄任务全部下放 Luna;写代码、改仓库、跑 agent 循环给 Sol;Astra 只在真正需要“最难端到端”的节点出场——比如 Dots 那种长驻总控。顺带一提,DevDay 上还预告了 GPT-6.1 Sol,官方话术“接近 Astra 性能、成本更低”,说明档位本身也还在内卷。

※ ※ ※

对中国读者,这事有一层更近的意味

Luna 的 $0.10/$0.50 是什么概念?对比第三方目录里同期的 DeepSeek V4 Flash(约 $0.17 输入 / $0.35 输出)——输入价被追平了,输出价还在同量级。过去两年“美国前沿模型贵、国产模型便宜打市场”的默认分工,这个九月正式作废。前沿厂商开始亲自下场打低端价格带,靠的不是补贴,是缓存和推理效率的真实改进(他们官方降价理由写得很直白)。国内还在卷参数量的团队,该把工程重心挪到推理成本上了——这一仗的弹药不在训练集群,在 serving 层。

另一个眼熟的点:Luna 的定位(高频判断:分类、是非、抽取、带置信度路由)和我最近实测的百炼 decision-model-preview 几乎是同一个物种——决策层模型。OpenAI 用一整个产品档来回答的需求,国内用预览免费模型在试。这个细分会不会像 embedding 一样变成大厂标配,值得盯。

※ ※ ※

我的取舍:一张选型表和一句狠话

如果只留一张表给我自己用:

你在做什么用什么别做什么
复杂推理、关键决策、最难的一段Astra(effort 按需调低)别全流程锁 max 档,3.6 倍成本买 4 分智能
编码 agent、日常专业工作Sol别拿它跑批量抽取,价格差 20 倍
摘要/分类/抽取/路由的海量小任务Luna别担心能力,官方数字同分成本只有旗舰零头
7×24 值守、跨应用自主干活Dots(Pro/Premium)开通前先弄清空闲计费口径,always-on 的账单是按小时长出来的

这个九月真正发生的不是“更强的模型来了”。是智能第一次有了清晰的批发价、零售价和阶梯价,然后 OpenAI 顺手把“雇个 AI 同事”摆上了货架。价格体系一旦立起来,卷的就只剩工程了。

最后留一个我到现在没找到答案、上线前必须替你们问的问题:Dots 的 dot 们可以组队协同,专科 dot 各自持身份持凭据。当半夜三点你的 dot 用你给的凭据做出一个错误但合规的动作——事故报告上签字的那一栏,写的到底是谁的名字?

作者:魏少冬

※ ※ ※

数据口径:定价与基准均引自 OpenAI 官方公告(openai.com/index/introducing-gpt-6-sol-and-luna、developers.openai.com 模型页)、TechCrunch 2026-09-22/09-29、AWS Bedrock 公告、Wikipedia GPT-6 词条及 Artificial Analysis 实测,检索时间 2026-09-30。

评论 (0)