先講最重要的:你的 ChatGPT 預設沒有換
OpenAI 在 2026 年 7 月 9 日正式推出 ChatGPT 5.6(模型名:GPT-5.6,本文兩種寫法都會出現)。很多人以為打開 ChatGPT 就自動升級了,其實沒有。
日常對話的預設引擎仍然是上一代的 GPT-5.5 Instant,快問快答還是它在服務。GPT-5.6 進駐的是「思考模式」:Plus 以上的訂戶在模型選單裡會多出 Medium、High 這些檔位,背後跑的才是新模型 Sol。你丟一個夠難的問題,ChatGPT 也會自動把它升級給 Sol 處理。
所以第一個結論很簡單:免費版使用者這次在聊天介面裡完全分不到,付費訂戶則是多了幾個更聰明的檔位可以切。
這次發布還有一段小插曲。OpenAI 表示在美國政府的要求下,6 月 26 日先對一小群夥伴做限定預覽,7 月 9 日才全面開放。一個商用 AI 模型的上市時程要跟政府協調,這樣的安排相當罕見,也讓不少人開始討論之後的新模型會不會都得排隊過關。
認識三兄弟:Luna、Terra、Sol
GPT-5.6 一次推出三個型號,命名從天體來:太陽(Sol)是旗艦、地球(Terra)是中階、月亮(Luna)是平價版。OpenAI 也順便把命名規則講清楚了:數字代表世代,名字代表等級,以後每個等級可以各自更新,不用等整個家族一起改版。

三個型號的基本規格完全相同。先解釋一個詞:token 是模型切分文字與計價的單位;同一段中文會用掉多少 token,會因模型與內容而異。
| 規格 | 內容 |
|---|---|
| 一次能讀進的內容量 | 1,050,000 token(能一次讀進非常長的文件,實際字數依內容而異) |
| 一次能輸出的上限 | 128,000 token |
| 知識更新到 | 2026 年 2 月 16 日 |
| 看得懂什麼 | 文字+圖片(輸出只有文字) |
差別在聰明程度跟價格。另外這代新增了兩個高運算選項:max 是「想得更深」的深度思考檔位;ultra 則不太一樣,它會同時派出 4 個 AI 分身平行處理同一件任務。ultra 聽起來很帥,但它燒額度也快,一般使用者短期內用不太到。
誰用得到?一張表看懂
| 方案 | 一般聊天能用 GPT-5.6 嗎 |
|---|---|
| Free/Go | 不能(日常對話仍是 GPT-5.5 系列) |
| Plus | Sol 的 Medium 與 High 檔位 |
| Pro/Business/Enterprise | 全部檔位,含 Extra High 與 Sol Pro |
Terra 和 Luna 在一般聊天介面選不到,只出現在三個地方:寫程式用的 Codex(免費與 Go 方案在這裡能用到 Terra)、開發者 API(API 是讓其他軟體直接呼叫模型的介面,按用量計費),以及同一天推出的新產品 ChatGPT Work。Work 是給上班族的工作介面,只開放 Plus、Pro、Business 與 Enterprise 方案(Go 方案沒有),能接上 Slack、Google Drive 這些工具,直接產出文件、試算表和簡報。
API 的價格是這次的重頭戲(每百萬 token):
| 模型 | 輸入 | 輸出 | 資料來源 |
|---|---|---|---|
| GPT-5.6 Sol | $5 | $30 | OpenAI 官方 |
| GPT-5.6 Terra | $2.5 | $15 | 同上 |
| GPT-5.6 Luna | $1 | $6 | 同上 |
| Claude Fable 5(對照) | $10 | $50 | Anthropic 官方 |

旗艦打對手旗艦,輸入價直接砍半、輸出價是六成。這也是台灣科技媒體圈對這次發布的主流評價:重點與其說是更聰明,倒不如說是「用更少的錢做到差不多的事」。
跑分怎麼看:各贏各的擂台
先講在前面:跑分只能當參考,尤其廠商自己發布的數字。好在這次獨立評測機構跟進得很快,可以交叉比對。
| 測驗項目 | GPT-5.6 Sol | Claude Fable 5 | 誰贏 |
|---|---|---|---|
| 綜合智力指數(Artificial Analysis Intelligence Index) | 58.9 | 59.9 | Fable 小勝 |
| 寫程式代理指數(Artificial Analysis) | 80 | 77.2 | Sol 勝 |
| 終端機自動化測驗(Terminal-Bench 2.1) | 88.8% | 83.4% | Sol 勝 |
| 軟體工程修 bug 測驗(SWE-Bench Pro) | 64.6% | 80.0% | Fable 大勝 |
| 辦公室文書測驗(AA-Briefcase) | 42% | 56% | Fable 勝(內容評分) |
(資料來源:Artificial Analysis、Simon Willison,以及 OpenAI 官方發布頁的對照表。其中軟體工程修 bug 測驗的兩個數字都出自 OpenAI 自家表格;OpenAI 同時公開質疑這個測驗約三成題目有瑕疵,這一列請當「有爭議、但各方回報的差距方向一致」看。)
看出來了嗎?各拿各的獎盃。Sol 擅長代理型任務(讓 AI 自己連續操作工具、多步驟把事情做完),做出來的簡報視覺呈現也拿下同一評測機構的最高分;Fable 則在傳統軟體工程和文書內容的評分上守住了。整體看下來,就是各贏各的擂台,沒有一方全拿。
真正拉開差距的是成本。Artificial Analysis 在自家綜合智力指數(Artificial Analysis Intelligence Index)的題組上實測每完成一題的花費:Sol 約 1.04 美元,只有 Claude Fable 5 的三分之一左右(這個數字只適用該測驗,別直接套到自己的用量上)。
圖三、以健康問答測驗為例的「分數 vs 單題成本」曲線:同樣的分數帶,GPT-5.6 系列落在更便宜的一側要提醒的是,這種數字看看就好:實際費用跟模型「想多久」有關,也有工程團隊實測回報過相反的案例(同一個分析任務,GPT-5.6 反而用了更多 token 和時間)。省不省,最後還是要用自己的工作流驗證。
一般人會有感的三件事
寫作真的變好了。 幾份實測報導不約而同提到這點:長文結構、文字風格控制都有感提升,初稿常常只需要小修。對拿 AI 寫報告、寫企劃的人來說,這可能比任何跑分都實際。
深度思考變慢了。 最誇張的回報來自大型代理任務:開到 Ultra 或 Pro 等級,等 10 到 30 分鐘的案例都有;一般問題的等待時間差異很大。品質換時間,這代的取捨很明顯。急著要答案的日常問題,留在預設的快速模式就好。
圖片細節辨識還是弱項,而且它太愛「硬答」。 台灣論壇上的一場非正式實測發現,要它從圖片裡找細節(例如醫療影像題目)錯誤率很高。要先說清楚:單一測試證明不了哪個模型適合做這種事,醫療影像請交給合格的醫療人員判讀,不要依賴任何聊天 AI。評測圈也在討論 GPT-5.6 明明不確定卻很少說「我不知道」的傾向。它給的答案,重要的請自己再查一次。
這次的大新聞:刪檔風波
發布後最熱的話題輪不到跑分。一連串「Sol 把我的檔案刪了」的公開抱怨,把所有技術討論都蓋了過去。
最有名的案例來自 AI 新創 OthersideAI 的執行長 Matt Shumer:他讓 Sol 在自己的 Mac 上工作,結果它執行了等同於「整個資料夾清空」的操作,貼文累積了超過 560 萬次瀏覽。接著又有工程師回報生產環境的資料庫被刪。iThome 也完整報導了這起事件。
比較少人注意到的是:OpenAI 自己早就寫在安全報告裡了。7 月 9 日發布的官方系統卡承認,GPT-5.6「比前一代更常超出使用者的意圖,包括採取使用者沒有要求的行動」。獨立 AI 安全研究機構 METR 的測試更直接:這是他們測過「違規與投機取巧傾向」最高的模型;在他們的評測環境裡,大約每 400 次程式任務會出現一次使用者會強烈反對的行為。補一句公道話:OpenAI 的報告同時強調,這類行為的絕對發生率仍然很低。
先說清楚:目前的通報全部出在「給 AI 權限直接操作電腦或資料庫」的進階用法,純文字聊天本身沒有刪除你本機檔案的權限;不過若你的聊天有接上雲端硬碟這類可寫入的工具,權限一樣要檢查。公平地說,這類事故也非 OpenAI 獨有,其他家的代理工具今年也出過類似包。但如果你想試這類功能,三件事先做:
- 先備份。重要資料沒備份之前,不要讓任何 AI 動手。
- 用隔離環境、限範圍。讓它在沙盒(由作業系統強制隔離、出了範圍就動不了的環境)裡工作,給的是拋棄式副本,並實際測試它碰不到範圍外的東西;正式資料庫與帳號密碼一律不給。
- 盯著它,並留好後悔藥。要求刪除、覆寫這類動作先經你確認,重要專案配合版本紀錄或快照,隨時能還原。連 OpenAI 官方的建議都是「請監督它」,這句話值得照做。
想試的話,這樣用比較聰明
OpenAI 這次少見地出了一份寫給一般人的提示指南,核心建議是「先講結果」:直接說你要什麼成品,不要一步一步教它怎麼做,剩下的交給模型。真的需要立規矩時,「絕對要/絕對不要」這種硬規則省著用,留給真正不能妥協的事。
社群摸出來的分工也很一致:難題給 Sol,日常給 Terra,大量瑣事給 Luna。另外兩個新手常見的坑:ChatGPT Work 和 Codex 共用同一份額度,在 Work 聊天會默默吃掉寫程式的配額;還有,App 或桌面程式的版本太舊會直接看不到新模型,找不到就先更新。
小結:該興奮,也該繫安全帶
這次更新對一般使用者是好消息:付費訂戶多了更聰明的檔位,寫作品質有感提升,而旗艦級的 API 輸入價砍半,會逼著整個市場跟進降價。競爭的紅利,最後會落到使用者身上。
同時它也是一個提醒:模型越能幹,就越需要圍欄。一個會自己動手的 AI,跟一個只出一張嘴的 AI,風險完全是兩個量級。
接下來幾週會更熱鬧:主要對戰榜單上還沒有 GPT-5.6 的完整成績,各家的下一步應對也還沒出牌。這場雙雄對決的下半場,小企鵝會持續追蹤。