Grok 4.6 是什麼:主打長時間代理任務的模型
Grok 4.6 是 SpaceXAI 推出的模型。先交代公司背景,因為這一兩年變化很大:Grok 原本是 Elon Musk 的 AI 公司 xAI 做的;2026 年 2 月 SpaceX 把 xAI 整個併進來,6 月 12 日 SpaceX 以代號 SPCX 掛牌上市(詳見 SpaceX 公司深度分析),7 月 6 日 xAI 正式改名 SpaceXAI。
官方給它的一句話定位是:在 Grok 4.5 的基礎上,特別加強「長時間運行的代理」與「更有企圖心的互動與視覺成品」。這兩個詞先翻成白話:
- 代理(agent):讓 AI 自己連續多步驟用工具把事情做完。例如讀你的程式碼、改好幾個檔案、跑測試、失敗了自己再修,全程不用你一步一步下指令。
- 互動與視覺成品:不只給你一段文字,而是直接做出一個能點、能看、排版完整的東西:一個小網站、一份儀表板、一份有版面的文件。
換句話說,它的目標從「答得準不準」往「能不能自己把事情做完」移動。這個定位決定了它的長處與短處,下面全部圍繞這一點展開。
官方發布影片把訴求整理得比文字清楚,46 秒可以看完:
影片:SpaceXAI 官方發布影片(來源:x.ai/news/grok-4-6,為方便閱讀已壓縮)
規格用一張表講完。
| 規格 | 內容 |
|---|---|
| 一次能讀進的內容量 | 500,000 token(與前代相同) |
| 看得懂什麼 | 文字+圖片(輸出只有文字,且沒有輸出長度上限) |
| 思考力道可調 | 低、中、高(預設)、極高 四段 |
| 模型代號 | grok-4.6 |
| 發表日 | 2026 年 8 月 12 日 |
(資料來源:SpaceXAI 開發者文件與官方 Release Notes。token 是模型切分文字與計價的單位,同一段中文會用掉多少 token 依內容而異。)
Grok 4.6 強在哪:從「回答問題」走向「做完一件事」
官方對這一代的整個敘事重心,是讓模型撐得久。

這不只是行銷詞,官方公布的數字確實往這個方向偏。把前代到這代的進步幅度攤開來看,進步最多的三項全是「要連續跑很多步」的任務型測驗:
這張圖的實用讀法是:你如果只拿它問問題、寫短文,體感不會有太大差別;差別要在「交代一件事讓它自己做完」的用法上才吃得到。
官方訓練說明也對得上。這代做了比前代更長的補充訓練,並且用 4.5 這個舊模型去重新生成訓練用的示範資料,再用模型自動篩掉有問題的紀錄。強化學習階段則餵了大量代理任務環境,包括核心運算最佳化、網頁開發、電腦輔助設計等等。簡單說:用上一代當老師,專門教這一代怎麼把長任務做完。
官方另外提到一個有意思的觀察:在比較長的任務裡,開始看到模型會自己先驗證再往下做,做完一步先檢查對不對,才繼續。這是代理任務最花錢也最容易翻車的環節,能自己收斂的話省的不只是時間。
實務上訴求分成三塊。
第一塊:更懂你的工具與團隊怎麼運作。

第二塊:處理具體、瑣碎、有專業脈絡的工程任務。 官方影片直接列出一串技能名稱當例子,都是實務上很吃經驗的細活:

第三塊:做出來的東西比較像成品。 官方說法是,給一個具體的產品想法,它能在一次就把應用的結構和視覺語言立起來,不用來回調很多輪。影片裡示範的成品長這樣:

這一塊要提醒一下:這是官方精選的展示畫面,不是隨機抽樣。它證明「模型做得到」,不代表「你每次都會拿到這個水準」。
Grok 4.6 的成績單:官方自己的表最誠實
先看獨立的那一份。評測機構 Artificial Analysis 的綜合智力指數(九項測驗合成的分數),Grok 4.6 拿到 61 分,在榜上 183 個模型裡排第 6。
這個數字有兩件事值得說。第一,它印證了官方的說法:公告寫「在這個指數上追平 GPT-5.6 Sol」,獨立那邊確實也是 61 對 61。第二,把四個模型放在同一張圖上,你會發現真正的故事是大家擠在一起:
第一名跟第三名差 1 分。以一般使用者的體感來說,這種差距幾乎感覺不出來,真正影響你的是價格、速度,以及有沒有在你用的介面裡。
接著看官方自己的那一份,這張表其實比公告文字誠實得多。SpaceXAI 在公告裡放了一張十項對照表,並且照慣例把每項最高分標粗體。把粗體算一算:
在廠商自己挑選的測驗組合裡,它只拿下十分之三。這句話值得記住:廠商公告通常會挑對自己有利的測驗,而這張表即使如此,領先的仍是對手。
完整數字放在這裡給想細看的人:
| 測驗項目 | Grok 4.6 | Grok 4.5 | GPT-5.6 Sol | Claude Fable 5 |
|---|---|---|---|---|
| 綜合智力(AA Index) | 61 | 56 | 61 | 62 |
| 真實職場產出(GDPVal-AA v2) | 1753 | 1526 | 1728 | 1741 |
| 編輯器實戰(CursorBench v3.2) | 69.9% | 66.7% | 67.2% | 70.5% |
| 修 bug 長任務(DeepSWE v1.1) | 65.9% | 54% | 73% | 70% |
| 前沿程式題(FrontierCode v1.1) | 61.3% | 56.6% | 60.6% | 63.6% |
| 代理任務(APEX-Agents) | 57.5% | 47.1% | 56.7% | 59.2% |
| 終端機長任務(Terminal-Bench v3.0) | 26% | 15.7% | 34.6% | 34.1% |
| 軟體工程(APEX-SWE) | 56.4% | 53.6% | 未列 | 58.8% |
| 知識工作(AA-Briefcase) | 1577 | 1313 | 1502 | 1574 |
| 法律長文(Harvey LAB) | 15.8% | 12.9% | 2.5% | 11.3% |
(粗體=該項最高分。資料來源:SpaceXAI 官方公告。官方註記:對手分數取自各家自述或公開可得結果中的最佳值。GDPVal-AA 與 AA-Briefcase 為 Elo 分數,數字越大越好,與百分比不同標尺。)
看得出兩個模式。Grok 4.6 贏的三項(真實職場產出、知識工作、法律長文)都偏向文書與知識工作;輸得最難看的終端機長任務,恰恰是最純粹的「自己在電腦前面連續操作很久」。這跟官方主打長時間代理的敘事有點張力:長任務進步幅度最大是真的,但進步幅度大跟追上對手是兩回事,它是從 15.7% 追到 26%,對手在 34% 上下。
Grok 4.6 弱在哪:兩個要自己補的空格
除了成績表上的落差,有兩件事屬於查不到資料,而不是查到壞消息。這個區別很重要,我不會替它樂觀,也不會替它悲觀。
第一,連續第二代沒有安全報告。 官方公告裡有一段「安全與能力」,三句話:防護已隨能力調校、安全機制設計成在合法用途上盡量不擋、做了史上最廣的部署前測試。三句都沒有任何數字,也沒有附上 model card(模型安全評估文件)。前代 Grok 4.5 就沒有發,這是連續第二代。對照 Anthropic 與 OpenAI 發布當天就附完整安全報告的做法,這個缺口是實打實的。
第二,幻覺率還沒有獨立數字。 幻覺(hallucination)是行話,白話就是一本正經講錯話。這在前代是個大問題:Grok 4.5 在獨立評測的幻覺率是 54%,比再前一代翻了一倍多。4.6 的同項成績在本文查核當下查不到,Artificial Analysis 的該欄位仍標示無資料。
同樣沒有的還有中文專項成績、實測輸出速度、延遲數字;獨立評測目前只有智力指數和價格是齊的。這代表任何「Grok 4.6 幻覺改善了」或「中文變好了」的說法,在有獨立數字之前都沒有證據支撐。想確認最新狀況,回到 Artificial Analysis 的頁面看有沒有補上是最快的做法。
還有一個小觀察:Cursor 的部落格文章是與 SpaceXAI 共同發布的同一份稿子,內文幾乎逐字相同。前代發布時 Cursor 還另外公布了自家的測驗表(並且在註腳誠實承認訓練資料混進自家程式碼舊快照),這次沒有這一份。少了一個交叉檢核的來源。
Grok 4.6 的價格:牌價便宜,但有一格容易忽略
以旗艦等級的模型來說,它的牌價站在便宜的那一端,而且跟前代完全一樣。
| 項目 | Grok 4.5 | Grok 4.6 |
|---|---|---|
| 輸入 | $2 | $2 |
| 輸出 | $6 | $6 |
| 快取輸入 | $0.30 | $0.50 |
| 超過 20 萬 token 後(輸入/快取/輸出) | $4/$0.60/$12 | $4/$1/$12 |
(單位:美元/每百萬 token。資料來源:Grok 4.6 文件與 Grok 4.5 文件。)
跨代唯一調漲的是「快取輸入」這一格,從 0.3 漲到 0.5 美元,幅度約三分之二。快取輸入指的是重複讀同樣內容時的優惠價,例如你的程式碼庫、系統提示這種每次都要重讀一遍的東西。對一般使用者這格無感,但對真的在跑代理任務的人來說,這正是用量最大的一格:讓 AI 連續跑二十步,前面十九步的脈絡每一步都要重讀一次。
換句話說,漲價漲在這代主打的用法上。這是個值得先算清楚的細節,不影響它整體便宜的定位。
另外兩個要注意的地方沿用自前代:單次請求達到 20 萬 token 時,整筆請求跳成兩倍價,先前的部分也一起變貴;以及官方提到有一個速度較快的變體版本,價格是兩倍。
哪裡用得到 Grok 4.6
首發的管道是這些:
| 管道 | 說明 |
|---|---|
| Cursor | 程式編輯器,與 SpaceXAI 聯合發布 |
| Grok Build | SpaceXAI 自家的開發者介面 |
| SpaceXAI API | 開發者按用量計費的介面,模型代號 grok-4.6 |
| OpenRouter/Vercel/Cloudflare | 第三方平台轉接 |
官方公告發布時未同步宣布 grok.com、X 平台與 Grok 手機 app 的上線時間,所以這一代的首發重心明顯放在開發者。消費端的實際狀況會隨時間變動,要確認你的帳號現在用得到哪一版,以 SpaceXAI 官方公告與 app 內的說明為準。Grok 免費版的中文使用方式,可以看這篇教學。
Grok 4.6 跟 GPT-5.6、Claude 怎麼選
把上面的證據收斂成一張表:
| 你的情境 | 建議 |
|---|---|
| 跨檔案改程式、跑量 | Grok 4.6 划算,牌價站在便宜的一端 |
| 交代一件事讓它自己做完 | 它的主場,但終端機類的長任務仍落後對手約 8 個百分點 |
| 文書、報告、知識工作 | 這是它成績最好的一塊,官方表上三項第一都在這裡 |
| 要求文字品質與介面品味 | Claude 仍是社群公認的品質守門員 |
| 高風險內容、對外文字 | 建議 Claude 或 GPT。連兩代沒有公開安全報告,幻覺率也沒有新數字 |
| 中文長文寫作 | 沒有任何一方有 Grok 4.6 的中文成績,先拿短任務自己試最準 |
GPT-5.6 詳見 ChatGPT 5.6 一次看懂;Google 陣營詳見 Gemini 3.6 Flash 一次看懂。
一句話版本:把「要自己做完的粗活」交給它最划算,需要品質跟安全感的活交給 Claude 或 GPT,錢包決定比例。
小結:它賣的是「做完一件事」的能力
Grok 4.6 整條產品線是一致的:能力往長任務走、首發先進開發者管道、漲價漲在代理用量最大的那一格。它很清楚自己在對誰說話。
判斷它值不值得,關鍵不在跑分高低,而在你的用法。如果你只是問答、寫短文,這一代帶給你的差別很小;如果你會把一整件事交出去讓它自己做完,進步幅度最大的正好是這一塊。
也別忘了那兩個空格。連續兩代沒有安全報告,幻覺率也還沒有新的獨立數字。這兩欄目前是空白,還談不上好壞,重要的輸出自己再查證一次,是現階段最實際的自保方式。小企鵝會持續追蹤。