Grok 4.6 是什么:主打长时间代理任务的模型
Grok 4.6 是 SpaceXAI 推出的模型。先交代公司背景,因为这一两年变化很大:Grok 原本是 Elon Musk 的 AI 公司 xAI 做的;2026 年 2 月 SpaceX 把 xAI 整个并进来,6 月 12 日 SpaceX 以代号 SPCX 挂牌上市(详见 SpaceX 公司深度分析),7 月 6 日 xAI 正式改名 SpaceXAI。
官方给它的一句话定位是:在前一代的基础上,特别加强「长时间运行的代理」与「更有企图心的互动与视觉成品」。这两个词先翻成白话:
- 代理(agent):让 AI 自己连续多步骤用工具把事情做完。例如读你的代码、改好几个文件、跑测试、失败了自己再修,全程不用你一步一步下指令。
- 互动与视觉成品:不只给你一段文字,而是直接做出一个能点、能看、排版完整的东西:一个小网站、一份仪表板、一份有版面的文档。
换句话说,它的目标从「答得准不准」往「能不能自己把事情做完」移动。这个定位决定了它的长处与短处,下面全部围绕这一点展开。
官方发布视频把诉求整理得比文字清楚,46 秒可以看完:
视频:SpaceXAI 官方发布视频(来源:x.ai/news/grok-4-6,为方便阅读已压缩)
规格用一张表讲完。
| 规格 | 内容 |
|---|---|
| 一次能读进的内容量 | 500,000 token(与前代相同) |
| 看得懂什么 | 文字+图片(输出只有文字,且没有输出长度上限) |
| 思考力道可调 | 低、中、高(默认)、极高 四段 |
| 模型代号 | grok-4.6 |
| 发表日 | 2026 年 8 月 12 日 |
(资料来源:SpaceXAI 开发者文档与官方 Release Notes。token 是模型切分文字与计价的单位,同一段中文会用掉多少 token 依内容而异。)
Grok 4.6 强在哪:从「回答问题」走向「做完一件事」
官方对这一代的整个叙事重心,是让模型撑得久。

这不只是营销词,官方公布的数字确实往这个方向偏。把前代到这代的进步幅度摊开来看,进步最多的三项全是「要连续跑很多步」的任务型测验:
这张图的实用读法是:你如果只拿它问问题、写短文,体感不会有太大差别;差别要在「交代一件事让它自己做完」的用法上才吃得到。
官方训练说明也对得上。这代做了比前代更长的补充训练,并且用 4.5 这个旧模型去重新生成训练用的示范数据,再用模型自动筛掉有问题的记录。强化学习阶段则喂了大量代理任务环境,包括核心运算优化、网页开发、计算机辅助设计等等。简单说:用上一代当老师,专门教这一代怎么把长任务做完。
官方另外提到一个有意思的观察:在比较长的任务里,开始看到模型会自己先验证再往下做,做完一步先检查对不对,才继续。这是代理任务最花钱也最容易翻车的环节,能自己收敛的话省的不只是时间。
实务上诉求分成三块。
第一块:更懂你的工具与团队怎么运作。

第二块:处理具体、琐碎、有专业脉络的工程任务。 官方视频直接列出一串技能名称当例子,都是实务上很吃经验的细活:

第三块:做出来的东西比较像成品。 官方说法是,给一个具体的产品想法,它能在一次就把应用的结构和视觉语言立起来,不用来回调很多轮。视频里示范的成品长这样:

这一块要提醒一下:这是官方精选的展示画面,不是随机抽样。它证明「模型做得到」,不代表「你每次都会拿到这个水准」。
Grok 4.6 的成绩单:官方自己的表最诚实
先看独立的那一份。评测机构 Artificial Analysis 的综合智力指数(九项测验合成的分数),Grok 4.6 拿到 61 分,在榜上 183 个模型里排第 6。
这个数字有两件事值得说。第一,它印证了官方的说法:公告写「在这个指数上追平 GPT-5.6 Sol」,独立那边确实也是 61 对 61。第二,把四个模型放在同一张图上,你会发现真正的故事是大家挤在一起:
第一名跟第三名差 1 分。以一般用户的体感来说,这种差距几乎感觉不出来,真正影响你的是价格、速度,以及有没有在你用的界面里。
接着看官方自己的那一份,这张表其实比公告文字诚实得多。SpaceXAI 在公告里放了一张十项对照表,并且照惯例把每项最高分标粗体。把粗体算一算:
在厂商自己挑选的测验组合里,它只拿下十分之三。这句话值得记住:厂商公告通常会挑对自己有利的测验,而这张表即使如此,领先的仍是对手。
完整数字放在这里给想细看的人:
| 测验项目 | Grok 4.6 | Grok 4.5 | GPT-5.6 Sol | Claude Fable 5 |
|---|---|---|---|---|
| 综合智力(AA Index) | 61 | 56 | 61 | 62 |
| 真实职场产出(GDPVal-AA v2) | 1753 | 1526 | 1728 | 1741 |
| 编辑器实战(CursorBench v3.2) | 69.9% | 66.7% | 67.2% | 70.5% |
| 修 bug 长任务(DeepSWE v1.1) | 65.9% | 54% | 73% | 70% |
| 前沿代码题(FrontierCode v1.1) | 61.3% | 56.6% | 60.6% | 63.6% |
| 代理任务(APEX-Agents) | 57.5% | 47.1% | 56.7% | 59.2% |
| 终端长任务(Terminal-Bench v3.0) | 26% | 15.7% | 34.6% | 34.1% |
| 软件工程(APEX-SWE) | 56.4% | 53.6% | 未列 | 58.8% |
| 知识工作(AA-Briefcase) | 1577 | 1313 | 1502 | 1574 |
| 法律长文(Harvey LAB) | 15.8% | 12.9% | 2.5% | 11.3% |
(粗体=该项最高分。资料来源:SpaceXAI 官方公告。官方注记:对手分数取自各家自述或公开可得结果中的最佳值。GDPVal-AA 与 AA-Briefcase 为 Elo 分数,数字越大越好,与百分比不同标尺。)
看得出两个模式。Grok 4.6 赢的三项(真实职场产出、知识工作、法律长文)都偏向文书与知识工作;输得最难看的终端长任务,恰恰是最纯粹的「自己在电脑前面连续操作很久」。这跟官方主打长时间代理的叙事有点张力:长任务进步幅度最大是真的,但进步幅度大跟追上对手是两回事,它是从 15.7% 追到 26%,对手在 34% 上下。
Grok 4.6 弱在哪:两个要自己补的空格
除了成绩表上的落差,有两件事属于查不到数据,而不是查到坏消息。这个区别很重要,我不会替它乐观,也不会替它悲观。
第一,连续第二代没有安全报告。 官方公告里有一段「安全与能力」,三句话:防护已随能力调校、安全机制设计成在合法用途上尽量不挡、做了史上最广的部署前测试。三句都没有任何数字,也没有附上 model card(模型安全评估文档)。前代 Grok 4.5 就没有发,这是连续第二代。对照 Anthropic 与 OpenAI 发布当天就附完整安全报告的做法,这个缺口是实打实的。
第二,幻觉率还没有独立数字。 幻觉(hallucination)是行话,白话就是一本正经讲错话。这在前代是个大问题:Grok 4.5 在独立评测的幻觉率是 54%,比再前一代翻了一倍多。4.6 的同项成绩在本文查核当下查不到,Artificial Analysis 的该栏位仍标示无数据。
同样没有的还有中文专项成绩、实测输出速度、延迟数字;独立评测目前只有智力指数和价格是齐的。这代表任何「Grok 4.6 幻觉改善了」或「中文变好了」的说法,在有独立数字之前都没有证据支撑。想确认最新状况,回到 Artificial Analysis 的页面看有没有补上是最快的做法。
还有一个小观察:Cursor 的博客文章是与 SpaceXAI 共同发布的同一份稿子,内文几乎逐字相同。前代发布时 Cursor 还另外公布了自家的测验表(并且在脚注诚实承认训练数据混进自家代码旧快照),这次没有这一份。少了一个交叉核对的来源。
Grok 4.6 的价格:牌价便宜,但有一格容易忽略
以旗舰等级的模型来说,它的牌价站在便宜的那一端,而且跟前代完全一样。
| 项目 | Grok 4.5 | Grok 4.6 |
|---|---|---|
| 输入 | $2 | $2 |
| 输出 | $6 | $6 |
| 缓存输入 | $0.30 | $0.50 |
| 超过 20 万 token 后(输入/缓存/输出) | $4/$0.60/$12 | $4/$1/$12 |
(单位:美元/每百万 token。资料来源:Grok 4.6 文档与 Grok 4.5 文档。)
跨代唯一调涨的是「缓存输入」这一格,从 0.3 涨到 0.5 美元,幅度约三分之二。缓存输入指的是重复读同样内容时的优惠价,例如你的代码库、系统提示这种每次都要重读一遍的东西。对一般用户这格无感,但对真的在跑代理任务的人来说,这正是用量最大的一格:让 AI 连续跑二十步,前面十九步的脉络每一步都要重读一次。
换句话说,涨价涨在这代主打的用法上。这是个值得先算清楚的细节,不影响它整体便宜的定位。
另外两个要注意的地方沿用自前代:单次请求达到 20 万 token 时,整笔请求跳成两倍价,先前的部分也一起变贵;以及官方提到有一个速度较快的变体版本,价格是两倍。
哪里用得到 Grok 4.6
首发的渠道是这些:
| 渠道 | 说明 |
|---|---|
| Cursor | 代码编辑器,与 SpaceXAI 联合发布 |
| Grok Build | SpaceXAI 自家的开发者界面 |
| SpaceXAI API | 开发者按用量计费的界面,模型代号 grok-4.6 |
| OpenRouter/Vercel/Cloudflare | 第三方平台转接 |
官方公告发布时未同步宣布 grok.com、X 平台与 Grok 手机 app 的上线时间,所以这一代的首发重心明显放在开发者。消费端的实际状况会随时间变动,要确认你的账号现在用得到哪一版,以 SpaceXAI 官方公告与 app 内的说明为准。
Grok 4.6 跟 GPT-5.6、Claude 怎么选
把上面的证据收敛成一张表:
| 你的情境 | 建议 |
|---|---|
| 跨文件改代码、跑量 | Grok 4.6 划算,牌价站在便宜的一端 |
| 交代一件事让它自己做完 | 它的主场,但终端类的长任务仍落后对手约 8 个百分点 |
| 文书、报告、知识工作 | 这是它成绩最好的一块,官方表上三项第一都在这里 |
| 要求文字质量与界面品味 | Claude 仍是社区公认的质量守门员 |
| 高风险内容、对外文字 | 建议 Claude 或 GPT。连两代没有公开安全报告,幻觉率也没有新数字 |
GPT-5.6 详见 ChatGPT 5.6 一次看懂;更广的对比详见 Claude vs ChatGPT。
一句话版本:把「要自己做完的粗活」交给它最划算,需要质量跟安全感的活交给 Claude 或 GPT,钱包决定比例。
小结:它卖的是「做完一件事」的能力
Grok 4.6 整条产品线是一致的:能力往长任务走、首发先进开发者渠道、涨价涨在代理用量最大的那一格。它很清楚自己在对谁说话。
判断它值不值得,关键不在跑分高低,而在你的用法。如果你只是问答、写短文,这一代带给你的差别很小;如果你会把一整件事交出去让它自己做完,进步幅度最大的正好是这一块。
也别忘了那两个空格。连续两代没有安全报告,幻觉率也还没有新的独立数字。这两栏目前是空白,还谈不上好坏,重要的输出自己再查证一次,是现阶段最实际的自保方式。小企鹅会持续追踪。