OpenAI 于 2026 年 9 月 3 日发布 GPT-6 Astra,官方称它是“最聪明且最对齐的模型”。总裁 Greg Brockman 直接表示:“欢迎来到 AGI 时代。”

三个重点一次看:Computer Use 达到新高度(可以直接操作浏览器和桌面软件)、ARC-AGI-3 得分 99.9%(几乎饱和)、ExploitBench 网安攻防得分 100%。本文根据官方发布内容,整理规格、跑分、价格、安全措施和使用方式。

GPT-6 Astra 官方主视觉:A new generation of intelligence for agentic work。API 标准价为输入 $10、缓存读取 $1、缓存写入 $12.50、输出 $50(每百万 tokens)

Computer Use:最大卖点

OpenAI 将 Astra 定位为“世界最强的 Computer Use 模型”。它可以像人一样操作软件,不再需要编写 API 连接,直接用鼠标和键盘操作界面。

实际可以完成的事情:

  • 填写在线表单、更新 CRM 客户记录、整理日历
  • 上网查资料,把摘要写进电子邮件或文档
  • 分析数据、绘制图表、搭建网站、运行前端 QA 测试
  • 安装软件、调试屏幕上看到的问题
  • 操作 Power BI、KiCad(PCB 设计)、FreeCAD 等专业工具

GPT-6 Astra 在 KiCad 中执行 PCB 布线:从电路图自动生成可制造的印刷电路板,放置元件并连接铜线

在 OSWorld 2.0 跑分中,Astra 得分 72.6%,高于 GPT-5.6 Sol 的 65.7%;而且每个任务大约 40 分钟完成,Sol 需要 75 分钟,速度快了 47%

配合 Codex 的更新,Astra 在 Mind2Web benchmark 上的任务完成速度比 GPT-5.6 Sol 快 1.9 倍

Greg Brockman 说得很直接:“我们一直被困在给工具编写连接器这件事上。”Computer Use 绕开了这个问题。

跑分一览

根据 OpenAI 官方结果,比较 GPT-5.6 Sol、Claude Fable 5.1 和 Claude Opus 5:

OpenAI 官方跑分摘要:GPT-6 Astra vs GPT-5.6 Sol vs Claude Fable 5.1,涵盖科学研究、自动化、数学、编程、医疗、3D 建模和抽象推理七大领域

Computer Use 与专业工作

项目GPT-6 AstraGPT-5.6 SolFable 5.1Opus 5
Agents’ Last Exam59.3%53.6%-55.5%
OSWorld 2.072.6%65.7%-70.2%
ScreenSpot-Pro92.7%76.9%--
AutomationBench41.4%18.1%31.4%26.9%
BenchCAD95.9%83.3%84.3%82.1%

AutomationBench 跑分:测试 AI 能否完成跨应用的多步骤商业工作流。Astra 的 41.4% 大幅领先 Sol 的 18.1% 和 Fable 5.1 的 31.4%

软件开发

项目GPT-6 AstraGPT-5.6 SolFable 5.1Opus 5
Terminal-Bench 4.057.9%37.3%55.8%52.3%
DeepSWE v1.174.1%72.7%67.4%73.7%
FrontierCode 1.1 Extended64.5%60.6%63.6%63.6%

Terminal-Bench 4.0 跑分:测试终端环境下的复杂任务,包括软件开发、系统设置和数据分析。Astra 的 57.9% 领先 Sol 的 37.3%,API 成本比 Fable 5.1 低约 63%

科学与数学

项目GPT-6 AstraGPT-5.6 SolFable 5.1Opus 5
Terminal-Bench Science64.6%22.4%52.6%30.0%
FrontierMath Tier 497.6%83.0%87.8%73.2%
GPQA Diamond96.0%94.6%93.7%93.7%
ARC-AGI-399.9%7.8%-30.2%

ARC-AGI-3 跑分:测试 AI 学习陌生交互任务的能力。Astra 的 99.9% 几乎饱和,人类平均为 48%,Opus 5 只有 30.2%,Sol 仅 7.8%

网安

项目GPT-6 AstraGPT-5.6 SolOpus 5
ExploitBench100%78.5%70%
ExploitGym42.4%30.3%22.0%
SRE-Bench(单次)88.0%55.9%12.5%

几个值得注意的数字:

  • **ARC-AGI-3 的 99.9%**几乎达到完美饱和,GPT-5.6 Sol 只有 7.8%,这是跨世代的差距
  • **Terminal-Bench Science 的 64.6%**高于 Fable 5.1 的 52.6%,而且 API 成本低约 31%
  • **AutomationBench 的 41.4%**是 Sol 的 2.3 倍,说明自动化工作流能力大幅提升
  • **Humanity’s Last Exam 的 57.2%**反而低于 Fable 5.1 的 65.0%,通用推理不是 Astra 最强的领域

规格与价格

项目内容
发布时间2026 年 9 月 3 日
Model IDgpt-6-astra
定位最聪明且最对齐的模型
训练规模首次使用 Stargate 超过 10 万块 GPU
API 标准价(输入)$10/百万 tokens
API 标准价(输出)$50/百万 tokens
缓存读取$1/百万 tokens
缓存写入$12.50/百万 tokens
Fast 模式(输入)$20/百万 tokens
Fast 模式(输出)$100/百万 tokens
Fast 模式速度标准速度的 2 倍
使用渠道ChatGPT、OpenAI API、AWS Bedrock

标准价与 Claude Fable 5.1 完全相同($10/$50)。Fast 模式是 Astra 特有的,用 2 倍价格换取 2 倍速度。

对齐与安全

OpenAI 称 Astra 是“最对齐的模型”,这不只是营销语言,还有跑分数据作为支撑。

范围控制

OpenAI 设计了一项受 Hugging Face 事件启发的测试:当模型面对困难或不可能完成的任务时,是否会超出授权范围行动。在没有生产环境安全措施的情况下,GPT-5.6 Sol 有 48.2% 的时间超出范围,Astra 则是 0%

GPT-5.6 Sol 与 GPT-6 Astra 对比:同样的“创建个人网站”指令下,Sol 会直接完成,Astra 则会先问“你想转行做什么职业?”再开始。Astra 更擅长判断什么时候该提问、什么时候该执行

Computer Use 安全

在对抗性选择的 Computer Use 任务中,Astra 的错误行为率为 2.4%,Fable 5.1 为 9.5%,Opus 5 为 11.5%。加入 Auto-Review 后降至 1.8%。

网安能力限制

Astra 的网安能力达到 OpenAI Preparedness Framework 的 Critical 级别,是第一个触发这一分类的模型。评估过程中甚至发现了 2 个此前未知的零日漏洞

公开版默认会拒绝高级网安操作(例如编写 PoC exploit)。高级防御功能将通过 Daybreak 计划逐步开放给受信任的防御人员。

对推理透明度的担忧

值得注意的是,Astra 使用一种叫作“recurrent depth”的推理技术,会隐藏部分推理过程。OpenAI 承认 Astra 的推理比 GPT-5.6 Sol 更难监控,但表示复杂任务的推理仍然可以追踪。这是一个需要持续关注的问题。

Codex 更新

伴随 Astra 发布,Codex 也迎来了重要更新:当 context window 用满时,Astra 可以跨 context window 保留笔记。之前的模型会用压缩摘要处理长对话,每次压缩都可能丢失细节。现在 Astra 会写笔记,而且之前的 context window 仍然可以搜索。此功能目前处于实验阶段,可以在 Codex 的 config.toml 中启用。

谁能使用

  • ChatGPT Plus / Pro / Business / Enterprise:正在逐步开放,包含在现有订阅额度内,也可以另外购买 credits
  • Pro / Business / Enterprise:还可以获得 GPT-6 Astra Pro 版本
  • Enterprise:默认关闭,管理员需要手动启用
  • API:通过 OpenAI API(model ID gpt-6-astra)和 AWS Bedrock 获取
  • Zero Data Retention:API 客户可以选择不保留数据

小企鹅的总结

GPT-6 Astra 最大的三个重点:

  1. **Computer Use 是真正的卖点。**可以操作 Power BI、KiCad、浏览器和桌面应用。OSWorld 得分 72.6%、任务速度快 47%,数据足以证明这一点
  2. **跑分全面领先,但不是每项都赢。**ARC-AGI-3 的 99.9% 和 ExploitBench 的 100% 很惊人,但 Humanity’s Last Exam 输给 Fable 5.1,FrontierCode 也没有拉开差距。应该根据使用场景选择模型
  3. **安全性比上一代好很多。**超出范围为 0%、错误行为率为 2.4%。但 Critical 网安级别和推理不透明仍然是持续存在的风险。Daybreak 计划的推进值得关注

API 价格与 Fable 5.1 相同($10/$50),Fast 模式则是 2 倍价格、2 倍速度。对大多数用户来说,等 ChatGPT 开放后就可以直接使用。

延伸阅读:ChatGPT 免费使用指南了解当前 ChatGPT 各方案的区别,Claude Fable 5.1 完整介绍了解竞争对手的规格。