先讲最重要的:你的 ChatGPT 默认没有换
OpenAI 在 2026 年 7 月 9 日正式推出 ChatGPT 5.6(模型名:GPT-5.6,本文两种写法都会出现)。很多人以为打开 ChatGPT 就自动升级了,其实没有。
日常对话的默认引擎仍然是上一代的 GPT-5.5 Instant,快问快答还是它在服务。GPT-5.6 进驻的是「思考模式」:Plus 以上的订户在模型菜单里会多出 Medium、High 这些档位,背后跑的才是新模型 Sol。你丢一个够难的问题,ChatGPT 也会自动把它升级给 Sol 处理。
所以第一个结论很简单:免费版用户这次在聊天界面里完全分不到,付费订户则是多了几个更聪明的档位可以切。
这次发布还有一段小插曲。OpenAI 表示在美国政府的要求下,6 月 26 日先对一小群伙伴做限定预览,7 月 9 日才全面开放。一个商用 AI 模型的上市时程要跟政府协调,这样的安排相当罕见,也让不少人开始讨论之后的新模型会不会都得排队过关。
认识三兄弟:Luna、Terra、Sol
GPT-5.6 一次推出三个型号,命名从天体来:太阳(Sol)是旗舰、地球(Terra)是中阶、月亮(Luna)是平价版。OpenAI 也顺便把命名规则讲清楚了:数字代表世代,名字代表等级,以后每个等级可以各自更新,不用等整个家族一起改版。

三个型号的基本规格完全相同。先解释一个词:token 是模型切分文字与计价的单位;同一段中文会用掉多少 token,会因模型与内容而异。
| 规格 | 内容 |
|---|---|
| 一次能读进的内容量 | 1,050,000 token(能一次读进非常长的文档,实际字数依内容而异) |
| 一次能输出的上限 | 128,000 token |
| 知识更新到 | 2026 年 2 月 16 日 |
| 看得懂什么 | 文字+图片(输出只有文字) |
差别在聪明程度跟价格。另外这代新增了两个高运算选项:max 是「想得更深」的深度思考档位;ultra 则不太一样,它会同时派出 4 个 AI 分身平行处理同一件任务。ultra 听起来很帅,但它烧额度也快,一般用户短期内用不太到。
谁用得到?一张表看懂
| 方案 | 一般聊天能用 GPT-5.6 吗 |
|---|---|
| Free/Go | 不能(日常对话仍是 GPT-5.5 系列) |
| Plus | Sol 的 Medium 与 High 档位 |
| Pro/Business/Enterprise | 全部档位,含 Extra High 与 Sol Pro |
Terra 和 Luna 在一般聊天界面选不到,只出现在三个地方:写代码用的 Codex(免费与 Go 方案在这里能用到 Terra)、开发者 API(API 是让其他软件直接调用模型的接口,按用量计费),以及同一天推出的新产品 ChatGPT Work。Work 是给上班族的工作界面,只开放 Plus、Pro、Business 与 Enterprise 方案(Go 方案没有),能接上 Slack、Google Drive 这些工具,直接产出文档、表格和演示文稿。
API 的价格是这次的重头戏(每百万 token):
| 模型 | 输入 | 输出 | 资料来源 |
|---|---|---|---|
| GPT-5.6 Sol | $5 | $30 | OpenAI 官方 |
| GPT-5.6 Terra | $2 | $12 | OpenAI 7 月底降价后 |
| GPT-5.6 Luna | $0.2 | $1.2 | 同上 |
| Claude Fable 5(对照) | $10 | $50 | Anthropic 官方 |

旗舰打对手旗舰,输入价直接砍半、输出价是六成。这也是科技媒体圈对这次发布的主流评价:重点与其说是更聪明,倒不如说是「用更少的钱做到差不多的事」。
有一个容易忽略的地方:上表是「短上下文」的价格。OpenAI 另外列了一组长上下文费率,喂进去的内容够长时会改用这一栏计价,大约是短上下文的两倍上下。
| 模型 | 长上下文输入 | 长上下文输出 |
|---|---|---|
| GPT-5.6 Sol | $10 | $45 |
| GPT-5.6 Terra | $4 | $18 |
| GPT-5.6 Luna | $0.4 | $1.8 |
官方定价页没有写明从几个 token 开始算长上下文,所以要丢很长的文档之前,先到官方定价页确认自己会落在哪一栏,别用短上下文的价格估预算。一般在 ChatGPT 聊天界面使用的人不受影响,这组价格只跟走 API 的人有关。
跑分怎么看:各赢各的擂台
先讲在前面:跑分只能当参考,尤其厂商自己发布的数字。好在这次独立评测机构跟进得很快,可以交叉比对。
| 测验项目 | GPT-5.6 Sol | Claude Fable 5 | 谁赢 |
|---|---|---|---|
| 综合智力指数(Artificial Analysis Intelligence Index) | 61 | 62 | Fable 小胜 |
| 写代码代理指数(Artificial Analysis) | 80 | 77.2 | Sol 胜 |
| 终端自动化测验(Terminal-Bench 2.1) | 88.8% | 83.4% | Sol 胜 |
| 软件工程修 bug 测验(SWE-Bench Pro) | 64.6% | 80.0% | Fable 大胜 |
| 办公室文书测验(AA-Briefcase) | 42% | 56% | Fable 胜(内容评分) |
(资料来源:Artificial Analysis、Simon Willison,以及 OpenAI 官方发布页的对照表。综合智力指数为 2026 年 8 月依 Artificial Analysis Intelligence Index v4.1.1 重查的分数(184 个模型中 Sol 排第 5、Fable 5 排第 3);其余各列为发布期间各来源公布的数字,测验版本各自不同,跨列不宜直接比较。其中软件工程修 bug 测验的两个数字都出自 OpenAI 自家表格;OpenAI 同时公开质疑这个测验约三成题目有瑕疵,这一列请当「有争议、但各方回报的差距方向一致」看。)
看出来了吗?各拿各的奖杯。Sol 擅长代理型任务(让 AI 自己连续操作工具、多步骤把事情做完),做出来的演示文稿视觉呈现也拿下同一评测机构的最高分;Fable 则在传统软件工程和文书内容的评分上守住了。整体看下来,就是各赢各的擂台,没有一方全拿。
真正拉开差距的是成本。Artificial Analysis 在自家综合智力指数的题组上实测每完成一题的花费:Sol 约 1.04 美元,只有 Claude Fable 5 的三分之一左右(这个数字只适用该测验,别直接套到自己的用量上)。
图三、以健康问答测验为例的「分数 vs 单题成本」曲线:同样的分数带,GPT-5.6 系列落在更便宜的一侧要提醒的是,这种数字看看就好:实际费用跟模型「想多久」有关,也有工程团队实测回报过相反的案例(同一个分析任务,GPT-5.6 反而用了更多 token 和时间)。省不省,最后还是要用自己的工作流验证。
一般人会有感的三件事
写作真的变好了。 几份实测报导不约而同提到这点:长文结构、文字风格控制都有感提升,初稿常常只需要小修。对拿 AI 写报告、写企划的人来说,这可能比任何跑分都实际。
深度思考变慢了。 最夸张的回报来自大型代理任务:开到 Ultra 或 Pro 等级,等 10 到 30 分钟的案例都有;一般问题的等待时间差异很大。品质换时间,这代的取舍很明显。急着要答案的日常问题,留在默认的快速模式就好。
图片细节辨识还是弱项,而且它太爱「硬答」。 台湾论坛上的一场非正式实测发现,要它从图片里找细节(例如医疗影像题目)错误率很高。要先说清楚:单一测试证明不了哪个模型适合做这种事,医疗影像请交给合格的医疗人员判读,不要依赖任何聊天 AI。评测圈也在讨论 GPT-5.6 明明不确定却很少说「我不知道」的倾向。它给的答案,重要的请自己再查一次。
这次的大新闻:删文件风波
发布后最热的话题轮不到跑分。一连串「Sol 把我的文件删了」的公开抱怨,把所有技术讨论都盖了过去。
最有名的案例来自 AI 创业公司 OthersideAI 的执行长 Matt Shumer:他让 Sol 在自己的 Mac 上工作,结果它执行了等同于「整个文件夹清空」的操作,贴文累积了超过 560 万次浏览。接着又有工程师回报生产环境的数据库被删。
比较少人注意到的是:OpenAI 自己早就写在安全报告里了。7 月 9 日发布的官方系统卡承认,GPT-5.6「比前一代更常超出用户的意图,包括采取用户没有要求的行动」。独立 AI 安全研究机构 METR 的测试更直接:这是他们测过「违规与投机取巧倾向」最高的模型;在他们的评测环境里,大约每 400 次代码任务会出现一次用户会强烈反对的行为。补一句公道话:OpenAI 的报告同时强调,这类行为的绝对发生率仍然很低。
先说清楚:目前的通报全部出在「给 AI 权限直接操作电脑或数据库」的进阶用法,纯文字聊天本身没有删除你本机文件的权限;不过若你的聊天有接上云盘这类可写入的工具,权限一样要检查。公平地说,这类事故也非 OpenAI 独有,其他家的代理工具今年也出过类似包。但如果你想试这类功能,三件事先做:
- 先备份。重要数据没备份之前,不要让任何 AI 动手。
- 用隔离环境、限范围。让它在沙盒(由操作系统强制隔离、出了范围就动不了的环境)里工作,给的是抛弃式副本,并实际测试它碰不到范围外的东西;正式数据库与账号密码一律不给。
- 盯着它,并留好后悔药。要求删除、覆写这类动作先经你确认,重要项目配合版本记录或快照,随时能还原。连 OpenAI 官方的建议都是「请监督它」,这句话值得照做。
想试的话,这样用比较聪明
OpenAI 这次少见地出了一份写给一般人的提示指南,核心建议是「先讲结果」:直接说你要什么成品,不要一步一步教它怎么做,剩下的交给模型。真的需要立规矩时,「绝对要/绝对不要」这种硬规则省着用,留给真正不能妥协的事。
社区摸出来的分工也很一致:难题给 Sol,日常给 Terra,大量琐事给 Luna。另外两个新手常见的坑:ChatGPT Work 和 Codex 共用同一份额度,在 Work 聊天会默默吃掉写代码的配额;还有,App 或桌面程序的版本太旧会直接看不到新模型,找不到就先更新。
小结:该兴奋,也该系安全带
这次更新对一般用户是好消息:付费订户多了更聪明的档位,写作质量有感提升,而旗舰级的 API 输入价砍半,会逼着整个市场跟进降价。竞争的红利,最后会落到用户身上。
同时它也是一个提醒:模型越能干,就越需要围栏。一个会自己动手的 AI,跟一个只出一张嘴的 AI,风险完全是两个量级。
榜单后来也补齐了。在 Artificial Analysis 的综合智力指数上,GPT-5.6 Sol 与 Claude Fable 5 只差 1 分,维持发布时「各赢各的擂台」的格局。对手则陆续出牌:SpaceXAI 在 7 月与 8 月连发两代 Grok,其中 Grok 4.6 在同一个指数上追到与 Sol 同分,API 价格却低了一截。双雄对决很快变成多方混战,价格压力也还在往下走,小企鹅会持续追踪。