Grok 4.6 是什麼:主打長時間代理任務的模型

Grok 4.6 是 SpaceXAI 推出的模型。先交代公司背景,因為這一兩年變化很大:Grok 原本是 Elon Musk 的 AI 公司 xAI 做的;2026 年 2 月 SpaceX 把 xAI 整個併進來,6 月 12 日 SpaceX 以代號 SPCX 掛牌上市(詳見 SpaceX 公司深度分析),7 月 6 日 xAI 正式改名 SpaceXAI。

官方給它的一句話定位是:在 Grok 4.5 的基礎上,特別加強「長時間運行的代理」與「更有企圖心的互動與視覺成品」。這兩個詞先翻成白話:

  • 代理(agent):讓 AI 自己連續多步驟用工具把事情做完。例如讀你的程式碼、改好幾個檔案、跑測試、失敗了自己再修,全程不用你一步一步下指令。
  • 互動與視覺成品:不只給你一段文字,而是直接做出一個能點、能看、排版完整的東西:一個小網站、一份儀表板、一份有版面的文件。

換句話說,它的目標從「答得準不準」往「能不能自己把事情做完」移動。這個定位決定了它的長處與短處,下面全部圍繞這一點展開。

官方發布影片把訴求整理得比文字清楚,46 秒可以看完:

影片:SpaceXAI 官方發布影片(來源:x.ai/news/grok-4-6,為方便閱讀已壓縮)

規格用一張表講完。

規格內容
一次能讀進的內容量500,000 token(與前代相同)
看得懂什麼文字+圖片(輸出只有文字,且沒有輸出長度上限)
思考力道可調低、中、高(預設)、極高 四段
模型代號grok-4.6
發表日2026 年 8 月 12 日

(資料來源:SpaceXAI 開發者文件官方 Release Notes。token 是模型切分文字與計價的單位,同一段中文會用掉多少 token 依內容而異。)

Grok 4.6 強在哪:從「回答問題」走向「做完一件事」

官方對這一代的整個敘事重心,是讓模型撐得久

Grok 4.6 官方發布影片畫面:一條由密集刻度組成的時間軸,標題寫著 Runs longer for complex work(複雜任務能跑更久)
圖一、官方影片主打的第一件事:複雜任務能自己跑更久(來源:SpaceXAI 官方發布影片)

這不只是行銷詞,官方公布的數字確實往這個方向偏。把前代到這代的進步幅度攤開來看,進步最多的三項全是「要連續跑很多步」的任務型測驗:

Grok 4.5 到 Grok 4.6 的進步幅度長條圖:修 bug 長任務從 54% 升到 65.9%、代理任務從 47.1% 升到 57.5%、終端機長任務從 15.7% 升到 26%,進步幅度明顯大於其他項目
圖二、跨代進步幅度:修 bug 長任務、代理任務、終端機長任務三項各進步約 10 個百分點,明顯高於其他項目(資料為廠商自測)

這張圖的實用讀法是:你如果只拿它問問題、寫短文,體感不會有太大差別;差別要在「交代一件事讓它自己做完」的用法上才吃得到

官方訓練說明也對得上。這代做了比前代更長的補充訓練,並且用 4.5 這個舊模型去重新生成訓練用的示範資料,再用模型自動篩掉有問題的紀錄。強化學習階段則餵了大量代理任務環境,包括核心運算最佳化、網頁開發、電腦輔助設計等等。簡單說:用上一代當老師,專門教這一代怎麼把長任務做完。

官方另外提到一個有意思的觀察:在比較長的任務裡,開始看到模型會自己先驗證再往下做,做完一步先檢查對不對,才繼續。這是代理任務最花錢也最容易翻車的環節,能自己收斂的話省的不只是時間。

實務上訴求分成三塊。

第一塊:更懂你的工具與團隊怎麼運作。

Grok 4.6 官方影片畫面:中央文字 Knows more about your tools(更懂你用的工具),兩側扇形展開 GitHub、Slack、Figma、Notion、Redis 等常見開發與協作工具的圖示
圖三、官方主打對常見開發與協作工具的理解(來源:SpaceXAI 官方發布影片)

第二塊:處理具體、瑣碎、有專業脈絡的工程任務。 官方影片直接列出一串技能名稱當例子,都是實務上很吃經驗的細活:

Grok 4.6 官方影片畫面:Skill 技能清單,包含 Separate Refactor From Feature、Git LFS Cache、Hermetic Git in Bazel、Mobile Kotlin Swift、Factory Automation Software 等項目
圖四、官方影片列出的技能例子:把重構和新功能拆開、Git 大檔快取、跨儲存庫同步等(來源:SpaceXAI 官方發布影片)

第三塊:做出來的東西比較像成品。 官方說法是,給一個具體的產品想法,它能在一次就把應用的結構和視覺語言立起來,不用來回調很多輪。影片裡示範的成品長這樣:

Grok 4.6 官方影片畫面:一份名為 Mount Epoch 的登山路線文件,左側是雪山照片,右側是襯線字體排版的路線清單,版面完整像正式出版品
圖五、官方影片示範的視覺成品:排版與層次已接近可直接使用的狀態(來源:SpaceXAI 官方發布影片)

這一塊要提醒一下:這是官方精選的展示畫面,不是隨機抽樣。它證明「模型做得到」,不代表「你每次都會拿到這個水準」。

Grok 4.6 的成績單:官方自己的表最誠實

先看獨立的那一份。評測機構 Artificial Analysis 的綜合智力指數(九項測驗合成的分數),Grok 4.6 拿到 61 分,在榜上 183 個模型裡排第 6。

這個數字有兩件事值得說。第一,它印證了官方的說法:公告寫「在這個指數上追平 GPT-5.6 Sol」,獨立那邊確實也是 61 對 61。第二,把四個模型放在同一張圖上,你會發現真正的故事是大家擠在一起

綜合智力指數長條圖:Claude Fable 5 為 62 分、Grok 4.6 為 61 分、GPT-5.6 Sol 為 61 分、前代 Grok 4.5 為 56 分,四根長條高度接近
圖六、Artificial Analysis 綜合智力指數:第一名與第三名只差 1 分,前代與這代差 5 分

第一名跟第三名差 1 分。以一般使用者的體感來說,這種差距幾乎感覺不出來,真正影響你的是價格、速度,以及有沒有在你用的介面裡。

接著看官方自己的那一份,這張表其實比公告文字誠實得多。SpaceXAI 在公告裡放了一張十項對照表,並且照慣例把每項最高分標粗體。把粗體算一算:

官方成績表的第一名分布圖:十項測驗中,Grok 4.6 拿下三項第一,GPT-5.6 Sol 拿下兩項,Claude Fable 5 拿下五項
圖七、在 SpaceXAI 自己公布的十項對照表裡,Grok 4.6 拿下三項第一,Claude Fable 5 拿五項、GPT-5.6 Sol 拿兩項

在廠商自己挑選的測驗組合裡,它只拿下十分之三。這句話值得記住:廠商公告通常會挑對自己有利的測驗,而這張表即使如此,領先的仍是對手。

完整數字放在這裡給想細看的人:

測驗項目Grok 4.6Grok 4.5GPT-5.6 SolClaude Fable 5
綜合智力(AA Index)61566162
真實職場產出(GDPVal-AA v2)1753152617281741
編輯器實戰(CursorBench v3.2)69.9%66.7%67.2%70.5%
修 bug 長任務(DeepSWE v1.1)65.9%54%73%70%
前沿程式題(FrontierCode v1.1)61.3%56.6%60.6%63.6%
代理任務(APEX-Agents)57.5%47.1%56.7%59.2%
終端機長任務(Terminal-Bench v3.0)26%15.7%34.6%34.1%
軟體工程(APEX-SWE)56.4%53.6%未列58.8%
知識工作(AA-Briefcase)1577131315021574
法律長文(Harvey LAB)15.8%12.9%2.5%11.3%

(粗體=該項最高分。資料來源:SpaceXAI 官方公告。官方註記:對手分數取自各家自述或公開可得結果中的最佳值。GDPVal-AA 與 AA-Briefcase 為 Elo 分數,數字越大越好,與百分比不同標尺。)

看得出兩個模式。Grok 4.6 贏的三項(真實職場產出、知識工作、法律長文)都偏向文書與知識工作;輸得最難看的終端機長任務,恰恰是最純粹的「自己在電腦前面連續操作很久」。這跟官方主打長時間代理的敘事有點張力:長任務進步幅度最大是真的,但進步幅度大追上對手是兩回事,它是從 15.7% 追到 26%,對手在 34% 上下。

Grok 4.6 弱在哪:兩個要自己補的空格

除了成績表上的落差,有兩件事屬於查不到資料,而不是查到壞消息。這個區別很重要,我不會替它樂觀,也不會替它悲觀。

第一,連續第二代沒有安全報告。 官方公告裡有一段「安全與能力」,三句話:防護已隨能力調校、安全機制設計成在合法用途上盡量不擋、做了史上最廣的部署前測試。三句都沒有任何數字,也沒有附上 model card(模型安全評估文件)。前代 Grok 4.5 就沒有發,這是連續第二代。對照 Anthropic 與 OpenAI 發布當天就附完整安全報告的做法,這個缺口是實打實的。

第二,幻覺率還沒有獨立數字。 幻覺(hallucination)是行話,白話就是一本正經講錯話。這在前代是個大問題:Grok 4.5 在獨立評測的幻覺率是 54%,比再前一代翻了一倍多。4.6 的同項成績在本文查核當下查不到,Artificial Analysis 的該欄位仍標示無資料。

同樣沒有的還有中文專項成績、實測輸出速度、延遲數字;獨立評測目前只有智力指數和價格是齊的。這代表任何「Grok 4.6 幻覺改善了」或「中文變好了」的說法,在有獨立數字之前都沒有證據支撐。想確認最新狀況,回到 Artificial Analysis 的頁面看有沒有補上是最快的做法。

還有一個小觀察:Cursor 的部落格文章是與 SpaceXAI 共同發布的同一份稿子,內文幾乎逐字相同。前代發布時 Cursor 還另外公布了自家的測驗表(並且在註腳誠實承認訓練資料混進自家程式碼舊快照),這次沒有這一份。少了一個交叉檢核的來源。

Grok 4.6 的價格:牌價便宜,但有一格容易忽略

以旗艦等級的模型來說,它的牌價站在便宜的那一端,而且跟前代完全一樣。

項目Grok 4.5Grok 4.6
輸入$2$2
輸出$6$6
快取輸入$0.30$0.50
超過 20 萬 token 後(輸入/快取/輸出)$4/$0.60/$12$4/$1/$12

(單位:美元/每百萬 token。資料來源:Grok 4.6 文件Grok 4.5 文件。)

跨代唯一調漲的是「快取輸入」這一格,從 0.3 漲到 0.5 美元,幅度約三分之二。快取輸入指的是重複讀同樣內容時的優惠價,例如你的程式碼庫、系統提示這種每次都要重讀一遍的東西。對一般使用者這格無感,但對真的在跑代理任務的人來說,這正是用量最大的一格:讓 AI 連續跑二十步,前面十九步的脈絡每一步都要重讀一次。

換句話說,漲價漲在這代主打的用法上。這是個值得先算清楚的細節,不影響它整體便宜的定位。

另外兩個要注意的地方沿用自前代:單次請求達到 20 萬 token 時,整筆請求跳成兩倍價,先前的部分也一起變貴;以及官方提到有一個速度較快的變體版本,價格是兩倍。

哪裡用得到 Grok 4.6

首發的管道是這些:

管道說明
Cursor程式編輯器,與 SpaceXAI 聯合發布
Grok BuildSpaceXAI 自家的開發者介面
SpaceXAI API開發者按用量計費的介面,模型代號 grok-4.6
OpenRouter/Vercel/Cloudflare第三方平台轉接

官方公告發布時未同步宣布 grok.com、X 平台與 Grok 手機 app 的上線時間,所以這一代的首發重心明顯放在開發者。消費端的實際狀況會隨時間變動,要確認你的帳號現在用得到哪一版,以 SpaceXAI 官方公告與 app 內的說明為準。Grok 免費版的中文使用方式,可以看這篇教學

Grok 4.6 跟 GPT-5.6、Claude 怎麼選

把上面的證據收斂成一張表:

你的情境建議
跨檔案改程式、跑量Grok 4.6 划算,牌價站在便宜的一端
交代一件事讓它自己做完它的主場,但終端機類的長任務仍落後對手約 8 個百分點
文書、報告、知識工作這是它成績最好的一塊,官方表上三項第一都在這裡
要求文字品質與介面品味Claude 仍是社群公認的品質守門員
高風險內容、對外文字建議 Claude 或 GPT。連兩代沒有公開安全報告,幻覺率也沒有新數字
中文長文寫作沒有任何一方有 Grok 4.6 的中文成績,先拿短任務自己試最準

GPT-5.6 詳見 ChatGPT 5.6 一次看懂;Google 陣營詳見 Gemini 3.6 Flash 一次看懂

一句話版本:把「要自己做完的粗活」交給它最划算,需要品質跟安全感的活交給 Claude 或 GPT,錢包決定比例。

小結:它賣的是「做完一件事」的能力

Grok 4.6 整條產品線是一致的:能力往長任務走、首發先進開發者管道、漲價漲在代理用量最大的那一格。它很清楚自己在對誰說話。

判斷它值不值得,關鍵不在跑分高低,而在你的用法。如果你只是問答、寫短文,這一代帶給你的差別很小;如果你會把一整件事交出去讓它自己做完,進步幅度最大的正好是這一塊

也別忘了那兩個空格。連續兩代沒有安全報告,幻覺率也還沒有新的獨立數字。這兩欄目前是空白,還談不上好壞,重要的輸出自己再查證一次,是現階段最實際的自保方式。小企鵝會持續追蹤。

延伸閱讀