如果你最近打开 ChatGPT,发现回答突然「不只是字」了——问足球越位规则,它先给你画一张球场示意图;问七速自行车怎么调,先出一张标注齿轮位置的图,还能点;让它算退休储蓄,它直接给出一个能拖着滑块改数字的计算器——那不是你本地安装了插件,而是 OpenAI 真的把界面本身做进了模型里。
这套东西叫 Intelligent UI(智能界面)。OpenAI 产品经理 Aarush Selvan 对 TechCrunch 的说法很直接:ChatGPT 长期以来基本是一个纯文本界面,而真正有帮助的回答往往不止于文字。这句话听起来平淡,却解释了为什么这次更新值得关注:AI 助手第一次大规模地把「输出格式」的决定权交给了模型自己,而不是交给一段 Markdown 或者一段代码。
推送节奏与档位划分:谁先拿到,谁用不上
先把时间线和权限说清楚,因为这直接决定你什么时候能看到变化。OpenAI 于 10 月 7 日(周三)宣布并开始全球推送 GPT-6 与 Intelligent UI,首批覆盖 ChatGPT 的 Plus、Pro、Business 与 Enterprise 用户;10 月 8 日(周四)起扩展到 Free 与 Go 档位。付费档拿到的是 GPT-6 Sol,免费档拿到的是效率更高的 GPT-6 Luna。
有几个限制值得注意,因为它们经常被含糊地写成「全体用户都能用」。OpenAI 帮助中心的说明里明确写着:GPT-6 仅限于 Chat 标签页,Work 与 Codex 使用的模型没有变化;GPT-6 Astra 在开启 Pro 深度推理时并不支持 Intelligent UI;语音模式与 Work 标签页里同样用不了。也就是说,如果你的账号习惯性开着最强推理档、或者一直在语音里提问,功能可能「明明上线了却始终不出现」。
它是怎么做到的:一套可流式渲染的组件库
技术路径上,OpenAI 的说法是:Intelligent UI 使用了一套原生的、可流式输出的组件库,配套一个编译器,在模型生成内容的同时就处理界面。这是它与以往「先等文字生成完、再贴一段代码块」最本质的差别——组件是随生成过程逐段渲染出来的,你不需要等完整答案落盘才看到第一张图。
训练环节覆盖的不只是内容本身,还包括版面、视觉呈现和交互方式的选择。换句话说,模型学会的不是「怎么画图」,而是「这一类问题该不该给图、该给哪种图、该做成可点击还是可滚动」。OpenAI 自己的说法是,GPT-6 学到了什么时候交互式呈现更有帮助、什么时候纯文字就够;同时官方也坦承在设计判断力上还有提升空间。
这个「判断」恰恰是最不确定的一环。目前所有佐证材料都来自 OpenAI 自己给出的演示案例——七速自行车结构图、麻将牌面分类、退休储蓄计算器、AA 分账工具、小游戏、菜谱联动、多日徒步地图。没有第三方任务集的测试数据,也没有公开的对比胜率。所以它提供的是一个心智模型(模型有时会主动给你一个界面),而不是「下一个问题一定出图」的承诺。
官方演示里最能说明问题的那几屏
把这几屏并排放在一起看,能看出OpenAI 想覆盖的两类场景。
第一类是信息组织类。菜谱那一屏是好例子:食材照片下方是可滚动的分类列表,步骤与配图绑定。你不需要把内容复制到别处,因为它本身就是按需组织的。同样逻辑下,问麻将怎么打会出现按牌型分组的牌面,问自行车结构会出现按部位高亮的标注图,问飞机机翼如何产生升力会生成对应的示意图。OpenAI 自己给的框架是一句话:有些内容适合并排比较。
第二类是工具类。中间那屏交互式理财计算器是关键信号——它在回答里内联生成,顶部是可切换的投资/房贷/分账三个标签,下面是可拖动的数字输入和实时更新的图表。分账、储蓄测算这类原本需要你另开一个表格工具或自己心算的事情,现在在对话里就地完成了。这正是 OpenAI 产品经理所说的「把事情做完」,而不只是「讲清楚」。
办公场景里最先被改写的三件事
对普通用户和办公场景来说,真正会立刻产生差别的不是炫技,而是下面三件事。
第一,探索型沟通的往返次数会下降。过去用文字解释一个空间结构或机械结构,模型给一段描述,你看不懂,追问,再描述,再追问。自行车那张图把车架、车轮、传动、刹车、驾驶舱做成了可点击标签,你点「传动」,图上直接高亮并展开解释。省下来的不是「读」的时间,而是「来回确认」的时间。
第二,需要动手算的环节前移了。分账、储蓄测算、装修预算这类任务,以前是「问 AI 思路 → 打开表格软件 → 手动录公式」。现在计算器直接内联在回答里,改一个数字,结果当场变。对会议中的临时测算、提案里的粗算、乃至家务里的分配问题,这个变化是能感知的。
第三,答案的形态从「可阅读」变成「可操作」。这是范式层面的变化,也是最容易被低估的一点。当回答里带着可点击控件时,它就不再是终点,而是一个可以继续操作的起点——你调完参数可以继续追问「按这个结果帮我写个方案」。多轮之间的界限因此被抹平了。
关于GPT-6.1 Sol 的超快模式,需要单独澄清
同期还有一个容易被和本文事件混为一谈的更新:GPT-6.1 Sol 新增了 Ultrafast(极速)服务档位,官方称其为「接近 Astra 的智能水平、最高可达标准档 8 倍速度」。这个数字看起来和 Interactive UI 是一回事,实际服务对象完全不同。
关键差异在于入口:Ultrafast 是面向 API、Codex 与 ChatGPT Work 的服务档位,普通 Chat 聊天模式并不提供 GPT-6.1 Sol。在产品端,它出现在 Work 与 Codex 中,开放范围为 Pro 500 美元档以及符合条件的 Enterprise、Edu 方案,且企业管理员需要手动开启。API 侧则向所有 API 用户开放,并设有独立于标准与快速档的速率限制。
把它和 Intelligent UI 分开看,逻辑就清楚了:Intelligent UI 改变的是「答案长什么样」,服务全部 ChatGPT 用户;Ultrafast 改变的是「算得多快」,只面向付费最高档和工作场景。两者共同构成本轮 GPT-6 家族的产品逻辑——一边把交互形态普及化,一边把高端算力继续做成分层服务。
几个实际使用中的边界
最后说几句使用上的实话。
它有「关闭」的余地。OpenAI 提供了减少视觉元素的控制,也可以在自定义指令里写明「只回答纯文本,不要图表和表单」。这不是一个严格意义上的开关开关,但足以在需要纯文本的场景下约束模型。
模型选择器可能需要手动切换。如果你的下拉菜单里还是旧模型,先手动切到 Sol 或 Luna,再去排查为什么没出控件。功能开关本身没有独立的 UI 入口。
状态保留是有限的。部分交互元素(比如清单)刷新当前对话后可以保留状态,但跨对话线程不保留。这对把一份可交互结果当成长期资料来用的做法是个限制。
要有预期管理。OpenAI 展示的都是精心挑选的案例,而早期示例集中在图表和表单。当场景变得复杂——比如要求一个包含大量互相冲突控件的仪表盘——系统大概率会给出不稳定的结果。官方自己也把「设计判断力」列为待改进项。所以把它当作「复杂任务的补充能力」,而不是「所有问题都会被渲染成完美界面」,是更贴合实际的用法。
写在最后
GPT-6 加 Intelligent UI 的这次推送,指标意义其实不如形态意义大。行业里比模型跑分更值得关注的问题是:AI 的输出正在从「文本」变成「界面」,而这件事第一次以产品的形态落到了数亿用户的对话窗口里。
这件事的连锁反应会比发布本身更持久。当答案里带着可点击的按钮和实时重算的图表,AI 就不再只是一个「告诉你怎么做」的窗口,而更接近一个「顺手把事办了」的工具。同时也需要警惕另一面——当模型在生成答案的同一刻决定了内容的组织形式与呈现结构,信息的筛选逻辑也随之转移到了模型那一侧。这大概才是接下来更值得讨论的部分。
相关阅读:

