OpenAI 在 2026 年 9 月 3 日發布 GPT-6 Astra,官方稱它是「最聰明且最對齊的模型」。總裁 Greg Brockman 直接說:「歡迎來到 AGI 時代。」

三個重點一次看:Computer Use 達到新高度(能直接操作瀏覽器和桌面軟體)、ARC-AGI-3 拿 99.9%(幾乎飽和)、ExploitBench 資安攻防 100%。這篇根據官方發布內容,整理規格、跑分、價格、安全措施和使用方式。

GPT-6 Astra 官方主視覺:A new generation of intelligence for agentic work。API 標準價輸入 $10、快取讀取 $1、快取寫入 $12.50、輸出 $50(每百萬 tokens)

Computer Use:最大賣點

OpenAI 把 Astra 定位成「世界最強的 Computer Use 模型」。它能像人一樣操作軟體,不再需要寫 API 串接,直接用滑鼠鍵盤操作介面。

實際能做的事:

  • 填線上表單、更新 CRM 客戶記錄、整理行事曆
  • 上網查資料,把摘要寫進 email 或文件
  • 分析資料、畫圖表、建網站、跑前端 QA 測試
  • 安裝軟體、除錯你螢幕上看到的問題
  • 操作 Power BI、KiCad(PCB 設計)、FreeCAD 等專業工具

GPT-6 Astra 在 KiCad 中執行 PCB 佈線:從電路圖自動產生可製造的印刷電路板,放置元件並連接銅線路

在 OSWorld 2.0 跑分中,Astra 拿 72.6%,比 GPT-5.6 Sol 的 65.7% 高,而且每個任務大約 40 分鐘完成,Sol 要 75 分鐘。速度快了 47%

搭配 Codex 的更新,Astra 在 Mind2Web benchmark 上的任務完成速度比 GPT-5.6 Sol 快 1.9 倍

Greg Brockman 說得很直白:「我們一直被卡在幫工具寫連接器這件事上。」Computer Use 繞過了這個問題。

跑分一覽

整理自 OpenAI 官方,跟 GPT-5.6 Sol、Claude Fable 5.1 和 Claude Opus 5 的比較:

OpenAI 官方跑分摘要:GPT-6 Astra vs GPT-5.6 Sol vs Claude Fable 5.1,涵蓋科學研究、自動化、數學、程式、醫療、3D 建模和抽象推理七大領域

Computer Use 與專業工作

項目GPT-6 AstraGPT-5.6 SolFable 5.1Opus 5
Agents’ Last Exam59.3%53.6%-55.5%
OSWorld 2.072.6%65.7%-70.2%
ScreenSpot-Pro92.7%76.9%--
AutomationBench41.4%18.1%31.4%26.9%
BenchCAD95.9%83.3%84.3%82.1%

AutomationBench 跑分:測試 AI 能否完成跨應用的多步驟商業工作流程。Astra 41.4% 大幅領先 Sol 的 18.1% 和 Fable 5.1 的 31.4%

程式開發

項目GPT-6 AstraGPT-5.6 SolFable 5.1Opus 5
Terminal-Bench 4.057.9%37.3%55.8%52.3%
DeepSWE v1.174.1%72.7%67.4%73.7%
FrontierCode 1.1 Extended64.5%60.6%63.6%63.6%

Terminal-Bench 4.0 跑分:測試終端機環境下的複雜任務(程式開發、系統設定、資料分析)。Astra 57.9% 領先 Sol 37.3%,API 成本比 Fable 5.1 低約 63%

科學與數學

項目GPT-6 AstraGPT-5.6 SolFable 5.1Opus 5
Terminal-Bench Science64.6%22.4%52.6%30.0%
FrontierMath Tier 497.6%83.0%87.8%73.2%
GPQA Diamond96.0%94.6%93.7%93.7%
ARC-AGI-399.9%7.8%-30.2%

ARC-AGI-3 跑分:測試 AI 學習不熟悉互動任務的能力。Astra 99.9% 幾乎飽和,人類平均 48%,Opus 5 只有 30.2%,Sol 僅 7.8%

資安

項目GPT-6 AstraGPT-5.6 SolOpus 5
ExploitBench100%78.5%70%
ExploitGym42.4%30.3%22.0%
SRE-Bench(單次)88.0%55.9%12.5%

幾個值得注意的數字:

  • ARC-AGI-3 的 99.9% 幾乎完美飽和,GPT-5.6 Sol 只有 7.8%,這是跨世代的差距
  • Terminal-Bench Science 64.6% 比 Fable 5.1 的 52.6% 高,而且 API 成本低約 31%
  • AutomationBench 41.4% 是 Sol 的 2.3 倍,代表自動化工作流程的能力大幅跳升
  • Humanity’s Last Exam 57.2% 反而低於 Fable 5.1 的 65.0%,通用推理不是 Astra 的最強項

規格與價格

項目內容
發布時間2026 年 9 月 3 日
Model IDgpt-6-astra
定位最聰明且最對齊的模型
訓練規模首次使用 Stargate 超過 10 萬 GPU
API 標準價(輸入)$10/百萬 tokens
API 標準價(輸出)$50/百萬 tokens
快取讀取$1/百萬 tokens
快取寫入$12.50/百萬 tokens
Fast 模式(輸入)$20/百萬 tokens
Fast 模式(輸出)$100/百萬 tokens
Fast 模式速度標準的 2 倍
使用管道ChatGPT、OpenAI API、AWS Bedrock

標準價跟 Claude Fable 5.1 完全一樣($10/$50)。Fast 模式是 Astra 特有的,用 2 倍價格換 2 倍速度。

對齊與安全

OpenAI 稱 Astra 是「最對齊的模型」,這不只是行銷語言,有跑分數據撐。

範圍控制

OpenAI 設計了一個受 Hugging Face 事件啟發的測試:當模型面對困難或不可能的任務,會不會超出授權範圍行動。GPT-5.6 Sol 在沒有生產環境安全措施的情況下,48.2% 的時間超出範圍。Astra 是 0%

GPT-5.6 Sol 與 GPT-6 Astra 對比:同樣的「建個人網站」指令,Sol 直接做完,Astra 會先問「你要轉什麼職業?」再開始。Astra 更擅長判斷什麼時候該問、什麼時候該做

Computer Use 安全

在對抗性選擇的 Computer Use 任務中,Astra 的錯誤行為率是 2.4%,Fable 5.1 是 9.5%,Opus 5 是 11.5%。加上 Auto-Review 之後降到 1.8%。

資安能力限制

Astra 的資安能力達到 OpenAI Preparedness Framework 的 Critical 等級,是第一個觸發這個分類的模型。評估過程中甚至發現了 2 個之前未知的零日漏洞

公開版預設會拒絕進階資安操作(例如寫 PoC exploit)。進階防禦功能透過 Daybreak 計畫逐步開放給受信任的防禦者。

推理透明度的隱憂

值得注意的是,Astra 使用了一種叫「recurrent depth」的推理技術,會隱藏部分推理過程。OpenAI 承認 Astra 的推理比 GPT-5.6 Sol 更難監控,但表示複雜任務的推理仍然可追蹤。這是一個需要持續關注的問題。

Codex 更新

搭配 Astra 發布,Codex 也有重要更新:當 context window 滿了的時候,Astra 可以跨 context window 保留筆記。之前的模型用壓縮摘要處理長對話,每次壓縮都可能丟失細節。現在 Astra 會寫筆記,而且之前的 context window 仍然可以搜尋。這個功能目前是實驗性的,可以在 Codex config.toml 中啟用。

誰能用

  • ChatGPT Plus / Pro / Business / Enterprise:逐步開放中,包含在現有訂閱額度,也可另購 credits
  • Pro / Business / Enterprise:額外取得 GPT-6 Astra Pro 版本
  • Enterprise:預設關閉,管理員需手動啟用
  • API:透過 OpenAI API(model ID gpt-6-astra)和 AWS Bedrock 取得
  • Zero Data Retention:API 客戶可選擇不保留資料

小企鵝的總結

GPT-6 Astra 三個最大的重點:

  1. Computer Use 是真正的賣點。能操作 Power BI、KiCad、瀏覽器和桌面應用。OSWorld 72.6%、任務速度快 47%,數字撐得住
  2. 跑分全面領先,但不是每項都贏。ARC-AGI-3 99.9% 和 ExploitBench 100% 很驚人,但 Humanity’s Last Exam 輸 Fable 5.1,FrontierCode 也沒有拉開差距。選模型看你的使用場景
  3. 安全做得比前代好很多。0% 範圍超出、2.4% 錯誤行為率。但 Critical 資安等級和推理不透明是持續的風險。Daybreak 計畫的展開值得追蹤

API 價格跟 Fable 5.1 一樣($10/$50),Fast 模式 2 倍價 2 倍速。對大部分使用者來說,等 ChatGPT 裡開放就能直接用。

搭配閱讀:ChatGPT 免費使用指南了解目前 ChatGPT 各方案的差異,Claude Fable 5.1 完整介紹了解競爭對手的規格。