OpenAI 发布 GPT-6 Astra:首个摸到「Critical」网安门槛的模型,普通用户啥时候能用上

9 月 3 日,OpenAI 放出了自家新一代旗舰模型 GPT-6 Astra。这距离上一代 GPT-5 系列发布已经过去了一年多,所以这次升级的分量不言而喻。官方给它安的帽子很高——「世界上最智能、最对齐的模型」,但真正让圈内人坐不住的,是它头一回触碰到了 OpenAI 安全框架里的「Critical」网络安全门槛。

能力全面开花,数学和代码尤其亮眼

先看官方给出来的成绩单。GPT-6 Astra 在几个关键基准上几乎刷满了:FrontierMath Tier 4 拿到 98%ARC-AGI-3 拿到 99.9%ExploitBench 更是直接 100%。这个 ExploitBench 是专门考模型「根据已知漏洞写出可执行攻击代码」的,拿满分意味着它的网安能力已经强到需要被认真对待的程度。

在更贴近实际工作的测试里,Astra 也普遍领先上一代 GPT-5.6 Sol:OSWorld 2.0 上它拿到 72.6%(Sol 是 65.7%),而且完成任务的平均时间从约 75 分钟压缩到了约 40 分钟,效率提升了将近一半。Terminal-Bench 4.0 上它是 57.9%,对比 Sol 的 37.3% 优势明显。

数学这边还有个挺有意思的花絮:官方称 Astra 帮忙推进了两个关于素数间隔的公开难题的进展,其中一个界限从 240 改进到了 186。这些成果都附带了证明和支撑材料,不是随口一说。

电脑操作能力大幅增强,Codex 也更「长情」了

对普通用户影响最大的,可能还是它在电脑操作(computer use)上的进步。简单说,就是 ChatGPT 现在能更像一个真人助理那样,帮你填表单、整理日程、上网查资料、改文档、做表格和 PPT、建网站,甚至能在你干活的时候在后台自己跑。

如果你平时用 Codex 写代码,这次也有个实用的新变化。以前长对话一旦塞满上下文窗口,模型就只能把之前的内容「压缩」成一段摘要,过程中难免丢掉一些关键细节——比如某个修复为什么失败、某个组件到底怎么工作的。现在 Astra 版的 Codex 可以跨上下文窗口记笔记,而且更早的上下文窗口还能被检索到。换句话说,它开始「记得住」漫长的调试过程了。这个功能目前还是实验性的,默认过几周才会全面打开。

为什么这次要「挤牙膏」式地开放

和以往「发布即全量」不同,Astra 这次的开放节奏明显收着:先给少量机构,随后几天才逐步推送到 ChatGPT Plus、Pro、Business 和 Enterprise 用户,企业版还需要管理员手动开启,默认是关的。

原因就在于那个「Critical」评级。按照 OpenAI 自己的 Preparedness Framework,Astra 是第一个达到「Critical」网络安全门槛的模型——在合适的工具和权限下,它能自主发现未知漏洞、开发利用方式,甚至在不被人一步步引导的情况下完成一整套攻击链。官方在评估里提到,Astra 在针对 20 个高危 V8 漏洞的测试中,任意代码执行率远超前代,还顺手发现并利用了两个此前未知的零日漏洞(已经上报给了维护者)。

正因如此,OpenAI 在发布前刻意放缓了节奏,加强了针对网络滥用和未授权操作的防护,并加了一层「破坏性操作」的监控——一旦检测到可能的风险,模型会暂停或停下任务,让用户确认。这种「能力越强、管得越严」的思路,估计会成为后续旗舰模型发布的新常态。

价格和可用性,值得留意

对开发者来说,Astra 的 API 定价是 每百万输入 token 10 美元、每百万输出 token 50 美元,还有一个快 2.5 倍但要双倍价格的 Fast 模式。相比上一代,单价确实更贵了,但 OpenAI 的说法是「更强的推理意味着更少的失败重试」,最终按「完成一个任务」来算成本反而可能更低。

至于普通用户,最关心的还是什么时候能亲手用上。目前 Plus、Pro 用户会在这几天陆续收到推送,企业版要等管理员开通。需要提醒的是,这类旗舰能力往往也会跟着地区、语言和订阅档位有所差异,能不能第一时间体验,还得看自己的账号和所在地区。

从「发布更聪明的大模型」到「发布一个需要小心翼翼放出的大模型」,OpenAI 这次的变化其实挺耐人寻味。当一个模型的网安能力强到连自家都要层层设防时,AI 和安全的边界,确实被推到了一个全新的位置。

放到大环境里看,这代旗舰卷的是什么

把 Astra 放进当下的竞争格局,会看得更清楚。这一整年,各家都在往同一个方向发力:让模型不只是「聊天」,而是能真正动手干活。Anthropic 的 Claude 早早把电脑操作做成了招牌,Google 的 Gemini 也在推多模态和长上下文,OpenAI 这次拿 Astra 的「电脑操作 + Codex 长情记忆」回应,等于把「Agent 能力」这场仗又往前推了一步。

对普通用户来说,这其实是件好事。模型越「能干」,意味着你交代一个复杂任务时,它越能自己拆解、自己执行、自己兜底,而不是每一步都得你盯着。当然,能力越强,越需要信任——这也是为什么 OpenAI 这次宁可放慢节奏,也要先把安全护栏搭起来。

最后给点实在的建议:如果你只是普通 ChatGPT 用户,不必急着追新,等系统推送就行;如果你是重度 Codex 用户,那个「跨上下文记笔记」的功能值得第一时间去开;如果你是开发者,可以盯一下 API 的定价和额度,按「完成一个任务的总成本」来评估值不值得切换。旗舰年年有,适合自己工作流的才是真香。