Grok 4.6 是什么:主打长时间代理任务的模型

Grok 4.6 是 SpaceXAI 推出的模型。先交代公司背景,因为这一两年变化很大:Grok 原本是 Elon Musk 的 AI 公司 xAI 做的;2026 年 2 月 SpaceX 把 xAI 整个并进来,6 月 12 日 SpaceX 以代号 SPCX 挂牌上市(详见 SpaceX 公司深度分析),7 月 6 日 xAI 正式改名 SpaceXAI。

官方给它的一句话定位是:在前一代的基础上,特别加强「长时间运行的代理」与「更有企图心的互动与视觉成品」。这两个词先翻成白话:

  • 代理(agent):让 AI 自己连续多步骤用工具把事情做完。例如读你的代码、改好几个文件、跑测试、失败了自己再修,全程不用你一步一步下指令。
  • 互动与视觉成品:不只给你一段文字,而是直接做出一个能点、能看、排版完整的东西:一个小网站、一份仪表板、一份有版面的文档。

换句话说,它的目标从「答得准不准」往「能不能自己把事情做完」移动。这个定位决定了它的长处与短处,下面全部围绕这一点展开。

官方发布视频把诉求整理得比文字清楚,46 秒可以看完:

视频:SpaceXAI 官方发布视频(来源:x.ai/news/grok-4-6,为方便阅读已压缩)

规格用一张表讲完。

规格内容
一次能读进的内容量500,000 token(与前代相同)
看得懂什么文字+图片(输出只有文字,且没有输出长度上限)
思考力道可调低、中、高(默认)、极高 四段
模型代号grok-4.6
发表日2026 年 8 月 12 日

(资料来源:SpaceXAI 开发者文档官方 Release Notes。token 是模型切分文字与计价的单位,同一段中文会用掉多少 token 依内容而异。)

Grok 4.6 强在哪:从「回答问题」走向「做完一件事」

官方对这一代的整个叙事重心,是让模型撑得久

Grok 4.6 官方发布视频画面:一条由密集刻度组成的时间轴,标题写着 Runs longer for complex work(复杂任务能跑更久)
图一、官方视频主打的第一件事:复杂任务能自己跑更久(来源:SpaceXAI 官方发布视频)

这不只是营销词,官方公布的数字确实往这个方向偏。把前代到这代的进步幅度摊开来看,进步最多的三项全是「要连续跑很多步」的任务型测验:

Grok 4.5 到 Grok 4.6 的进步幅度柱状图:修 bug 长任务从 54% 升到 65.9%、代理任务从 47.1% 升到 57.5%、终端长任务从 15.7% 升到 26%,进步幅度明显大于其他项目
图二、跨代进步幅度:修 bug 长任务、代理任务、终端长任务三项各进步约 10 个百分点,明显高于其他项目(数据为厂商自测)

这张图的实用读法是:你如果只拿它问问题、写短文,体感不会有太大差别;差别要在「交代一件事让它自己做完」的用法上才吃得到

官方训练说明也对得上。这代做了比前代更长的补充训练,并且用 4.5 这个旧模型去重新生成训练用的示范数据,再用模型自动筛掉有问题的记录。强化学习阶段则喂了大量代理任务环境,包括核心运算优化、网页开发、计算机辅助设计等等。简单说:用上一代当老师,专门教这一代怎么把长任务做完。

官方另外提到一个有意思的观察:在比较长的任务里,开始看到模型会自己先验证再往下做,做完一步先检查对不对,才继续。这是代理任务最花钱也最容易翻车的环节,能自己收敛的话省的不只是时间。

实务上诉求分成三块。

第一块:更懂你的工具与团队怎么运作。

Grok 4.6 官方视频画面:中央文字 Knows more about your tools(更懂你用的工具),两侧扇形展开 GitHub、Slack、Figma、Notion、Redis 等常见开发与协作工具的图标
图三、官方主打对常见开发与协作工具的理解(来源:SpaceXAI 官方发布视频)

第二块:处理具体、琐碎、有专业脉络的工程任务。 官方视频直接列出一串技能名称当例子,都是实务上很吃经验的细活:

Grok 4.6 官方视频画面:Skill 技能清单,包含 Separate Refactor From Feature、Git LFS Cache、Hermetic Git in Bazel、Mobile Kotlin Swift、Factory Automation Software 等项目
图四、官方视频列出的技能例子:把重构和新功能拆开、Git 大文件缓存、跨仓库同步等(来源:SpaceXAI 官方发布视频)

第三块:做出来的东西比较像成品。 官方说法是,给一个具体的产品想法,它能在一次就把应用的结构和视觉语言立起来,不用来回调很多轮。视频里示范的成品长这样:

Grok 4.6 官方视频画面:一份名为 Mount Epoch 的登山路线文档,左侧是雪山照片,右侧是衬线字体排版的路线清单,版面完整像正式出版品
图五、官方视频示范的视觉成品:排版与层次已接近可直接使用的状态(来源:SpaceXAI 官方发布视频)

这一块要提醒一下:这是官方精选的展示画面,不是随机抽样。它证明「模型做得到」,不代表「你每次都会拿到这个水准」。

Grok 4.6 的成绩单:官方自己的表最诚实

先看独立的那一份。评测机构 Artificial Analysis 的综合智力指数(九项测验合成的分数),Grok 4.6 拿到 61 分,在榜上 183 个模型里排第 6。

这个数字有两件事值得说。第一,它印证了官方的说法:公告写「在这个指数上追平 GPT-5.6 Sol」,独立那边确实也是 61 对 61。第二,把四个模型放在同一张图上,你会发现真正的故事是大家挤在一起

综合智力指数柱状图:Claude Fable 5 为 62 分、Grok 4.6 为 61 分、GPT-5.6 Sol 为 61 分、前代 Grok 4.5 为 56 分,四根柱子高度接近
图六、Artificial Analysis 综合智力指数:第一名与第三名只差 1 分,前代与这代差 5 分

第一名跟第三名差 1 分。以一般用户的体感来说,这种差距几乎感觉不出来,真正影响你的是价格、速度,以及有没有在你用的界面里。

接着看官方自己的那一份,这张表其实比公告文字诚实得多。SpaceXAI 在公告里放了一张十项对照表,并且照惯例把每项最高分标粗体。把粗体算一算:

官方成绩表的第一名分布图:十项测验中,Grok 4.6 拿下三项第一,GPT-5.6 Sol 拿下两项,Claude Fable 5 拿下五项
图七、在 SpaceXAI 自己公布的十项对照表里,Grok 4.6 拿下三项第一,Claude Fable 5 拿五项、GPT-5.6 Sol 拿两项

在厂商自己挑选的测验组合里,它只拿下十分之三。这句话值得记住:厂商公告通常会挑对自己有利的测验,而这张表即使如此,领先的仍是对手。

完整数字放在这里给想细看的人:

测验项目Grok 4.6Grok 4.5GPT-5.6 SolClaude Fable 5
综合智力(AA Index)61566162
真实职场产出(GDPVal-AA v2)1753152617281741
编辑器实战(CursorBench v3.2)69.9%66.7%67.2%70.5%
修 bug 长任务(DeepSWE v1.1)65.9%54%73%70%
前沿代码题(FrontierCode v1.1)61.3%56.6%60.6%63.6%
代理任务(APEX-Agents)57.5%47.1%56.7%59.2%
终端长任务(Terminal-Bench v3.0)26%15.7%34.6%34.1%
软件工程(APEX-SWE)56.4%53.6%未列58.8%
知识工作(AA-Briefcase)1577131315021574
法律长文(Harvey LAB)15.8%12.9%2.5%11.3%

(粗体=该项最高分。资料来源:SpaceXAI 官方公告。官方注记:对手分数取自各家自述或公开可得结果中的最佳值。GDPVal-AA 与 AA-Briefcase 为 Elo 分数,数字越大越好,与百分比不同标尺。)

看得出两个模式。Grok 4.6 赢的三项(真实职场产出、知识工作、法律长文)都偏向文书与知识工作;输得最难看的终端长任务,恰恰是最纯粹的「自己在电脑前面连续操作很久」。这跟官方主打长时间代理的叙事有点张力:长任务进步幅度最大是真的,但进步幅度大追上对手是两回事,它是从 15.7% 追到 26%,对手在 34% 上下。

Grok 4.6 弱在哪:两个要自己补的空格

除了成绩表上的落差,有两件事属于查不到数据,而不是查到坏消息。这个区别很重要,我不会替它乐观,也不会替它悲观。

第一,连续第二代没有安全报告。 官方公告里有一段「安全与能力」,三句话:防护已随能力调校、安全机制设计成在合法用途上尽量不挡、做了史上最广的部署前测试。三句都没有任何数字,也没有附上 model card(模型安全评估文档)。前代 Grok 4.5 就没有发,这是连续第二代。对照 Anthropic 与 OpenAI 发布当天就附完整安全报告的做法,这个缺口是实打实的。

第二,幻觉率还没有独立数字。 幻觉(hallucination)是行话,白话就是一本正经讲错话。这在前代是个大问题:Grok 4.5 在独立评测的幻觉率是 54%,比再前一代翻了一倍多。4.6 的同项成绩在本文查核当下查不到,Artificial Analysis 的该栏位仍标示无数据。

同样没有的还有中文专项成绩、实测输出速度、延迟数字;独立评测目前只有智力指数和价格是齐的。这代表任何「Grok 4.6 幻觉改善了」或「中文变好了」的说法,在有独立数字之前都没有证据支撑。想确认最新状况,回到 Artificial Analysis 的页面看有没有补上是最快的做法。

还有一个小观察:Cursor 的博客文章是与 SpaceXAI 共同发布的同一份稿子,内文几乎逐字相同。前代发布时 Cursor 还另外公布了自家的测验表(并且在脚注诚实承认训练数据混进自家代码旧快照),这次没有这一份。少了一个交叉核对的来源。

Grok 4.6 的价格:牌价便宜,但有一格容易忽略

以旗舰等级的模型来说,它的牌价站在便宜的那一端,而且跟前代完全一样。

项目Grok 4.5Grok 4.6
输入$2$2
输出$6$6
缓存输入$0.30$0.50
超过 20 万 token 后(输入/缓存/输出)$4/$0.60/$12$4/$1/$12

(单位:美元/每百万 token。资料来源:Grok 4.6 文档Grok 4.5 文档。)

跨代唯一调涨的是「缓存输入」这一格,从 0.3 涨到 0.5 美元,幅度约三分之二。缓存输入指的是重复读同样内容时的优惠价,例如你的代码库、系统提示这种每次都要重读一遍的东西。对一般用户这格无感,但对真的在跑代理任务的人来说,这正是用量最大的一格:让 AI 连续跑二十步,前面十九步的脉络每一步都要重读一次。

换句话说,涨价涨在这代主打的用法上。这是个值得先算清楚的细节,不影响它整体便宜的定位。

另外两个要注意的地方沿用自前代:单次请求达到 20 万 token 时,整笔请求跳成两倍价,先前的部分也一起变贵;以及官方提到有一个速度较快的变体版本,价格是两倍。

哪里用得到 Grok 4.6

首发的渠道是这些:

渠道说明
Cursor代码编辑器,与 SpaceXAI 联合发布
Grok BuildSpaceXAI 自家的开发者界面
SpaceXAI API开发者按用量计费的界面,模型代号 grok-4.6
OpenRouter/Vercel/Cloudflare第三方平台转接

官方公告发布时未同步宣布 grok.com、X 平台与 Grok 手机 app 的上线时间,所以这一代的首发重心明显放在开发者。消费端的实际状况会随时间变动,要确认你的账号现在用得到哪一版,以 SpaceXAI 官方公告与 app 内的说明为准。

Grok 4.6 跟 GPT-5.6、Claude 怎么选

把上面的证据收敛成一张表:

你的情境建议
跨文件改代码、跑量Grok 4.6 划算,牌价站在便宜的一端
交代一件事让它自己做完它的主场,但终端类的长任务仍落后对手约 8 个百分点
文书、报告、知识工作这是它成绩最好的一块,官方表上三项第一都在这里
要求文字质量与界面品味Claude 仍是社区公认的质量守门员
高风险内容、对外文字建议 Claude 或 GPT。连两代没有公开安全报告,幻觉率也没有新数字

GPT-5.6 详见 ChatGPT 5.6 一次看懂;更广的对比详见 Claude vs ChatGPT

一句话版本:把「要自己做完的粗活」交给它最划算,需要质量跟安全感的活交给 Claude 或 GPT,钱包决定比例。

小结:它卖的是「做完一件事」的能力

Grok 4.6 整条产品线是一致的:能力往长任务走、首发先进开发者渠道、涨价涨在代理用量最大的那一格。它很清楚自己在对谁说话。

判断它值不值得,关键不在跑分高低,而在你的用法。如果你只是问答、写短文,这一代带给你的差别很小;如果你会把一整件事交出去让它自己做完,进步幅度最大的正好是这一块

也别忘了那两个空格。连续两代没有安全报告,幻觉率也还没有新的独立数字。这两栏目前是空白,还谈不上好坏,重要的输出自己再查证一次,是现阶段最实际的自保方式。小企鹅会持续追踪。

延伸阅读