9 月 22 日这一天有点密集。Anthropic 先发布了 Claude Opus 5.5,大约一个小时后,OpenAI 上线了 GPT-6 Sol 和 GPT-6 Luna 两个新档位。两家的时间点撞在一起,主题也撞在一起——都不是「我又强了多少」,而是「同样的活,现在更便宜了」。
两边的打法出奇一致:不比榜首,比单价
先看 Anthropic。新版本 Claude Opus 5.5 是在 Opus 5 的基础上升级,距离上一代 Opus 更新大约两个月,延续了这家公司一贯的迭代节奏。Anthropic 自己的说法是,Opus 5.5 是「我们呼吁给前沿模型降速之后的第一个模型」,发布前照例交给 METR 和 Frontier Design 等外部评测方测试,在其最全面的对齐测试上拿到迄今为止最好的分数。
再看 OpenAI。GPT-6 Sol 和 Luna 不是新旗舰,而是在 GPT-6 Astra 之下的两个档位。官方的原话是:最吃重、最重要的项目仍然需要 Astra 的深度,但实际工作发生在不同的规模、节奏和预算里,所以要把 Astra 那一代的智能「分摊」到更快、更便宜的模型上。Sol 面向复杂编码与智能体工作流,Luna 面向高频、聚焦的任务。
换句话说,两家这次卖的不是能力上限,而是成本曲线上的位置。这在 2026 年下半年是个很明确的信号:推理成本本身,已经变成了产品竞争的主战场。
OpenAI 这一手:把 50% 的降幅直接写在公告里
OpenAI 这次把降价数字说得很直白:GPT-6 版本的 Sol 和 Luna,API 价格比它们所替代的 GPT-5.6 同档模型便宜约 50%。官方解释是缓存与推理效率的提升,让这些模型能以更低成本服务,于是把省下来的钱直接让给用户和客户。
能力上,两个新模型都比 GPT-5.6 同档略强,但明显在 Astra 之下。官方给了一组衡量「性价比」的对位数据:在 OSWorld 2.0 离线测试里,GPT-6 Sol 在 xhigh 档位拿到 60.5%,与 Claude Opus 5 在 medium 档位的 60.3% 基本持平,而单任务成本低约 80%;GPT-6 Luna 在 max 档位能超过 GPT-5.6 Sol 在 medium 档位的表现,成本只有后者的十分之一。
可用范围方面,两个模型先上 ChatGPT Work 与 Codex,覆盖 Plus、Pro、Business、Enterprise 和 Edu 用户;免费与 Go 用户可以在桌面端用到 Luna。企业管理员需要手动开启新模型。有一点容易踩坑:这两个模型目前进的是 Work 和 Codex,还不在普通的 Chat 里。另外,OpenAI 这次没有发 GPT-6 Terra,外界普遍认为中型档位被砍掉,最终只留小、大、超大三个层级。
OpenAI 还罕见地公开了内部用量:按 API 价格折算,公司内部研究员的日均 token 消耗,中位数已经超过 600 美元,九十分位超过 7000 美元。这个数字被用来解释为什么「编码 Agent 的成本」值得单独优化——当智能体接的任务越来越长,持续使用的账单本身就变成了门槛。
Anthropic 这一手:先把「跑得慢」修掉,再谈便宜
Opus 5.5 的定价调整幅度不小。输入每百万 token 4 美元、输出 20 美元,比 Opus 5 低 20%;缓存读取每百万 token 0.20 美元,比 Opus 5 低 60%。Anthropic 强调,缓存读取占智能体与编码类工作成本的绝大部分,所以这一项降六成,对实际账单的影响比表面数字大得多。官方测算,默认设置下跑典型工作负载,成本比 Opus 5 低约 40%。速度上,输出生成比 Opus 5 快三成以上。
生成速度这件事,Anthropic 用几个具体案例做了说明。有早期测试者用它完成了 68 万行代码的迁移,耗时不到一天,而这类工作通常要一个工程团队花上几周。另一个案例是审 20 万行代码库并顺手修掉问题,Opus 5.5 用了不到三小时,Opus 5 则超过 20 小时、消耗 2.5 倍 token。内部测试里,Opus 5.5 和更高一档的 Fable 5.1 同时把 HAProxy 从 C 重写成 Rust,两边几乎都通过了 HAProxy 自己的回归测试,但 Opus 5.5 用 9.5 小时完成,Fable 5.1 用了 12 小时,成本还低 51%。
对位竞品时,Anthropic 给出的说法是:在 FrontierCode 默认档位下,Opus 5.5 能赢 GPT-6 Astra,成本约为后者的五分之一;在 Terminal Bench 4.0 上与 Astra 打平,成本约为四成;在 CursorBench 上比 GPT-5.6 Sol 高 11 分,成本约为三分之一。这些数字都来自厂商自测,横向参考即可。
除了降价,Anthropic 还提高了 Pro、Max、Team 三个档位的五小时用量上限,并给订阅用户一次可自行择时使用的额度重置。另外官方预告 Claude Sonnet 5.5 与 Haiku 5.5 会在数周内到来,性能、效率与安全上有同样的改进。
两份成绩单的「口径」并不一样
把两边的数字放在一起看,会发现它们其实没法直接比。
Anthropic 主打的是「同价位我更强」:拿 Opus 5.5 去对 Astra、Fable 5.1、GPT-5.6 Sol,强调的是在单位成本下赢下更多任务。OpenAI 主打的是「同能力我更便宜」:拿 Sol、Luna 去对 GPT-5.6 同档,强调的是每一代换代就把价格砍一半。一个在比每美元买到的能力,一个在比同档位的价格曲线。
更实际的问题是,这些数字绝大多数来自厂商自测或早期测试者的个案,测试集、档位设置(medium、xhigh、max)都不一样,跨型号对比时误差很大。真正可比的只有一件事:同一条工作流,换模型之后账单和耗时有没有下降。这也是为什么两家这次都强调「缓存」和「推理效率」——那才是账单里最真实的部分。
对开发者和普通用户分别意味着什么
对开发者来说,这一轮变化最直接的后果是「换模型」这件事的收益变大了。编码 Agent 的成本大头在缓存的重复读取,Anthropic 把这项降了六成,而 OpenAI 把同档 API 价砍半,两者都在削弱「上下文越长越不敢用」的顾虑。多模型路由、按任务复杂度分发到不同档位,从优化手段变成了默认做法。
对普通用户来说,短期能感知的变化有限。GPT-6 Sol 和 Luna 目前主要在 Work 和 Codex 里,普通聊天还进不去;免费与 Go 用户能在桌面端用到 Luna,算是把一部分成本下降传导了出来。Opus 5.5 方面,订阅用户的额度上限提高、并多了一次可用可存的重置机会,这对重度使用者更实在。
更值得关注的是节奏。两家在同一天用同一个逻辑发布产品,说明前沿模型之间的差距正在被压缩到「同档位差几个点」的量级。接下来真正拉开差距的,大概率不再是某次评测的榜首,而是谁能把单位成本压得更低、同时把缓存和长任务的稳定性做得更好。



