OpenAI 在 2026 年 9 月 3 日發布 GPT-6 Astra,官方稱它是「最聰明且最對齊的模型」。總裁 Greg Brockman 直接說:「歡迎來到 AGI 時代。」
三個重點一次看:Computer Use 達到新高度(能直接操作瀏覽器和桌面軟體)、ARC-AGI-3 拿 99.9%(幾乎飽和)、ExploitBench 資安攻防 100%。這篇根據官方發布內容,整理規格、跑分、價格、安全措施和使用方式。

Computer Use:最大賣點
OpenAI 把 Astra 定位成「世界最強的 Computer Use 模型」。它能像人一樣操作軟體,不再需要寫 API 串接,直接用滑鼠鍵盤操作介面。
實際能做的事:
- 填線上表單、更新 CRM 客戶記錄、整理行事曆
- 上網查資料,把摘要寫進 email 或文件
- 分析資料、畫圖表、建網站、跑前端 QA 測試
- 安裝軟體、除錯你螢幕上看到的問題
- 操作 Power BI、KiCad(PCB 設計)、FreeCAD 等專業工具

在 OSWorld 2.0 跑分中,Astra 拿 72.6%,比 GPT-5.6 Sol 的 65.7% 高,而且每個任務大約 40 分鐘完成,Sol 要 75 分鐘。速度快了 47%。
搭配 Codex 的更新,Astra 在 Mind2Web benchmark 上的任務完成速度比 GPT-5.6 Sol 快 1.9 倍。
Greg Brockman 說得很直白:「我們一直被卡在幫工具寫連接器這件事上。」Computer Use 繞過了這個問題。
跑分一覽
整理自 OpenAI 官方,跟 GPT-5.6 Sol、Claude Fable 5.1 和 Claude Opus 5 的比較:

Computer Use 與專業工作
| 項目 | GPT-6 Astra | GPT-5.6 Sol | Fable 5.1 | Opus 5 |
|---|---|---|---|---|
| Agents’ Last Exam | 59.3% | 53.6% | - | 55.5% |
| OSWorld 2.0 | 72.6% | 65.7% | - | 70.2% |
| ScreenSpot-Pro | 92.7% | 76.9% | - | - |
| AutomationBench | 41.4% | 18.1% | 31.4% | 26.9% |
| BenchCAD | 95.9% | 83.3% | 84.3% | 82.1% |

程式開發
| 項目 | GPT-6 Astra | GPT-5.6 Sol | Fable 5.1 | Opus 5 |
|---|---|---|---|---|
| Terminal-Bench 4.0 | 57.9% | 37.3% | 55.8% | 52.3% |
| DeepSWE v1.1 | 74.1% | 72.7% | 67.4% | 73.7% |
| FrontierCode 1.1 Extended | 64.5% | 60.6% | 63.6% | 63.6% |

科學與數學
| 項目 | GPT-6 Astra | GPT-5.6 Sol | Fable 5.1 | Opus 5 |
|---|---|---|---|---|
| Terminal-Bench Science | 64.6% | 22.4% | 52.6% | 30.0% |
| FrontierMath Tier 4 | 97.6% | 83.0% | 87.8% | 73.2% |
| GPQA Diamond | 96.0% | 94.6% | 93.7% | 93.7% |
| ARC-AGI-3 | 99.9% | 7.8% | - | 30.2% |

資安
| 項目 | GPT-6 Astra | GPT-5.6 Sol | Opus 5 |
|---|---|---|---|
| ExploitBench | 100% | 78.5% | 70% |
| ExploitGym | 42.4% | 30.3% | 22.0% |
| SRE-Bench(單次) | 88.0% | 55.9% | 12.5% |
幾個值得注意的數字:
- ARC-AGI-3 的 99.9% 幾乎完美飽和,GPT-5.6 Sol 只有 7.8%,這是跨世代的差距
- Terminal-Bench Science 64.6% 比 Fable 5.1 的 52.6% 高,而且 API 成本低約 31%
- AutomationBench 41.4% 是 Sol 的 2.3 倍,代表自動化工作流程的能力大幅跳升
- Humanity’s Last Exam 57.2% 反而低於 Fable 5.1 的 65.0%,通用推理不是 Astra 的最強項
規格與價格
| 項目 | 內容 |
|---|---|
| 發布時間 | 2026 年 9 月 3 日 |
| Model ID | gpt-6-astra |
| 定位 | 最聰明且最對齊的模型 |
| 訓練規模 | 首次使用 Stargate 超過 10 萬 GPU |
| API 標準價(輸入) | $10/百萬 tokens |
| API 標準價(輸出) | $50/百萬 tokens |
| 快取讀取 | $1/百萬 tokens |
| 快取寫入 | $12.50/百萬 tokens |
| Fast 模式(輸入) | $20/百萬 tokens |
| Fast 模式(輸出) | $100/百萬 tokens |
| Fast 模式速度 | 標準的 2 倍 |
| 使用管道 | ChatGPT、OpenAI API、AWS Bedrock |
標準價跟 Claude Fable 5.1 完全一樣($10/$50)。Fast 模式是 Astra 特有的,用 2 倍價格換 2 倍速度。
對齊與安全
OpenAI 稱 Astra 是「最對齊的模型」,這不只是行銷語言,有跑分數據撐。
範圍控制
OpenAI 設計了一個受 Hugging Face 事件啟發的測試:當模型面對困難或不可能的任務,會不會超出授權範圍行動。GPT-5.6 Sol 在沒有生產環境安全措施的情況下,48.2% 的時間超出範圍。Astra 是 0%。

Computer Use 安全
在對抗性選擇的 Computer Use 任務中,Astra 的錯誤行為率是 2.4%,Fable 5.1 是 9.5%,Opus 5 是 11.5%。加上 Auto-Review 之後降到 1.8%。
資安能力限制
Astra 的資安能力達到 OpenAI Preparedness Framework 的 Critical 等級,是第一個觸發這個分類的模型。評估過程中甚至發現了 2 個之前未知的零日漏洞。
公開版預設會拒絕進階資安操作(例如寫 PoC exploit)。進階防禦功能透過 Daybreak 計畫逐步開放給受信任的防禦者。
推理透明度的隱憂
值得注意的是,Astra 使用了一種叫「recurrent depth」的推理技術,會隱藏部分推理過程。OpenAI 承認 Astra 的推理比 GPT-5.6 Sol 更難監控,但表示複雜任務的推理仍然可追蹤。這是一個需要持續關注的問題。
Codex 更新
搭配 Astra 發布,Codex 也有重要更新:當 context window 滿了的時候,Astra 可以跨 context window 保留筆記。之前的模型用壓縮摘要處理長對話,每次壓縮都可能丟失細節。現在 Astra 會寫筆記,而且之前的 context window 仍然可以搜尋。這個功能目前是實驗性的,可以在 Codex config.toml 中啟用。
誰能用
- ChatGPT Plus / Pro / Business / Enterprise:逐步開放中,包含在現有訂閱額度,也可另購 credits
- Pro / Business / Enterprise:額外取得 GPT-6 Astra Pro 版本
- Enterprise:預設關閉,管理員需手動啟用
- API:透過 OpenAI API(model ID
gpt-6-astra)和 AWS Bedrock 取得 - Zero Data Retention:API 客戶可選擇不保留資料
小企鵝的總結
GPT-6 Astra 三個最大的重點:
- Computer Use 是真正的賣點。能操作 Power BI、KiCad、瀏覽器和桌面應用。OSWorld 72.6%、任務速度快 47%,數字撐得住
- 跑分全面領先,但不是每項都贏。ARC-AGI-3 99.9% 和 ExploitBench 100% 很驚人,但 Humanity’s Last Exam 輸 Fable 5.1,FrontierCode 也沒有拉開差距。選模型看你的使用場景
- 安全做得比前代好很多。0% 範圍超出、2.4% 錯誤行為率。但 Critical 資安等級和推理不透明是持續的風險。Daybreak 計畫的展開值得追蹤
API 價格跟 Fable 5.1 一樣($10/$50),Fast 模式 2 倍價 2 倍速。對大部分使用者來說,等 ChatGPT 裡開放就能直接用。
搭配閱讀:ChatGPT 免費使用指南了解目前 ChatGPT 各方案的差異,Claude Fable 5.1 完整介紹了解競爭對手的規格。