Grok 4.5 是什麼:SpaceX 上市後的第一個新模型
Grok 4.5 是 SpaceXAI 在 2026 年 7 月 8 日發表的新模型,隔天起在 grok.com、X 平台和 Grok 手機 app 全面開放。
先交代公司背景,因為這半年變化很大。Grok 原本是 Elon Musk 的 AI 公司 xAI 做的;2026 年 2 月 SpaceX 把 xAI 整個併進來,6 月 12 日 SpaceX 以代號 SPCX 掛牌上市(詳見 SpaceX 公司深度分析),7 月 6 日 xAI 正式改名 SpaceXAI。所以 Grok 4.5 是這家「火箭加 AI」公司上市後的第一個新模型,火箭、星鏈、X 平台、Grok 全都在同一張股票裡。
它主打兩件事:寫程式,以及代理任務。代理(agent)指的是讓 AI 自己連續多步驟用工具把事情做完,例如讀你的程式碼、改好幾個檔案、跑測試、失敗了自己再修,全程不用人一步一步下指令。
先解釋一個之後會一直出現的詞:token 是模型切分文字與計價的單位,同一段中文會用掉多少 token,依內容而異。
發布還綁著一個特別的合作對象:程式編輯器 Cursor。SpaceX 在上市後不久宣布以約 600 億美元全股票收購 Cursor 的母公司 Anysphere(交易預計 2026 年第三季完成);Grok 4.5 是雙方聯合訓練的第一個成果,Cursor 官方說訓練用上了數兆 token 的真實開發資料。
規格面用一張表講完。
| 規格 | 內容 |
|---|---|
| 一次能讀進的內容量 | 500,000 token(官方 API 文件數字) |
| 看得懂什麼 | 文字+圖片(輸出只有文字) |
| 輸出速度 | 官方主打高速輸出;獨立實測數字因平台與測法而異 |
| 用得到的地方 | grok.com、X、iOS/Android app、API(給開發者按用量計費的介面)、Cursor |
(資料來源:SpaceXAI 官方文件、官方公告)
Musk 給它的定位是「Opus 等級,但更快、更省 token、更便宜」(TechCrunch 報導)。Opus 指 Anthropic 的旗艦模型 Claude Opus。這句話的後半經得起檢驗,前半有爭議,下面拆開講。
免費用得到嗎?用得到,而且沒得挑
對一般使用者,這次最直接的好消息:免費版打開就是 Grok 4.5。在 X、grok.com 或 Grok app 上,系統自動把你指派到新模型,不用付費,也沒有模型選單可以挑,Grok 官方帳號確認免費使用就是有額度限制的 Grok 4.5。對照 ChatGPT 免費版在聊天介面完全用不到 GPT-5.6,這個開放程度算大方。
付費方案分兩級:SuperGrok 月費 30 美元,買到更高的每週額度;SuperGrok Heavy 月費 300 美元,額度再往上。要留意 SuperGrok 的額度是聊天、生圖、語音共用一個池,愛生圖跟語音對話的人會消耗得特別快。
發布後最大的民怨也在這裡。不少訂戶抱怨額度比以前更快用完;還有使用者算出一筆尷尬的帳:月費 20 美元的 Cursor 方案,能用到的 Grok 寫程式額度反而比 30 美元的 SuperGrok 多。Musk 本人在底下回了一句「Fixing」(修正中)。
台灣讀者的省錢順序很清楚:先用免費版試,不夠用再考慮付費;想拿 Grok 寫程式,先比較 Cursor 方案跟 SuperGrok 哪個划算,別急著訂。台灣第一天就能用,歐盟反而因為法規延後上線(TechNews 報導)。
Grok 4.5 強在哪:埋頭做事的省錢主力
用過的工程師給它的共同形容是 workhorse,直譯是耐操的工作馬。它在代理任務裡比較少停下來問「要繼續嗎?」這種保母式確認,接了任務就埋頭做完。Epic Games 執行長 Tim Sweeney 也公開稱讚它少了多餘的文件輸出跟確認打斷。
省,是它最實在的賣點,分兩層。
第一層是省話。同樣一件軟體工程任務,xAI 公布 Grok 4.5 的輸出 token 用量約為 Claude Opus 的四分之一。輸出 token 直接等於帳單,話少就是錢少。
第二層是牌價本身便宜。API 以每百萬 token 計價:
| 模型 | 輸入 | 輸出 |
|---|---|---|
| Grok 4.5 | $2 | $6 |
| GPT-5.6 Sol | $5 | $30 |
| GPT-5.6 Terra | $2 | $12 |
| Gemini 3.6 Flash | $1.5 | $7.5 |
| Claude Fable 5 | $10 | $50 |
(單位:美元/每百萬 token。資料來源:SpaceXAI 官方文件與各家官方定價頁;Terra 為 OpenAI 7 月底降價後的價格。數位時代換算約為每百萬 token 輸入 NT$64、輸出 NT$193。)
有一個多數報導沒講清楚的地雷:單次請求達到 20 萬 token 時,整筆請求跳成兩倍價(輸入 $4、輸出 $12)。它從門檻那一刻起整筆重算,先前的部分也一起變貴,長文件、長程式碼的用法要自己抓好這條線。重複讀同樣內容的「快取輸入」另有優惠價:低於 20 萬 token 每百萬 $0.30,達門檻後為 $0.60。
牌價便宜跟「做完一件事便宜」是兩回事,好在這次兩個都成立。獨立評測機構 Artificial Analysis 實測讓各家模型自己跑完一件寫程式代理任務的平均花費,Grok 4.5 大約是 GPT-5.5 的一半、Claude Fable 5 的五分之一(見圖二)。
實務能力也有獨立佐證。AI 資料公司 Snorkel 用真實職場任務(法律、教育、醫療、品管分析這類文書工作)測了一輪,Grok 4.5 的整體通過率排第一:
| 模型 | 職場任務通過率 |
|---|---|
| Grok 4.5 | 29% |
| GPT-5.5 | 22% |
| Claude Opus 4.8 | 21% |
(資料來源:Snorkel AI 獨立評測。通過標準嚴格,要拿滿分才算過,所以各家數字都偏低。)
至於 Cursor 聯訓的成果,官方公布的寫程式測驗對照長這樣:

看得出來廠商自己的表裡,它連一個單獨領先的項目都沒有,最好的成績也只是接近並列。這張表誠實的地方,下一段會再講。
Grok 4.5 弱在哪:更會一本正經講錯話
這段是本文最重要的部分。便宜跟能做事都是真的,代價也是真的。
幻覺率翻倍。 幻覺(hallucination)是 AI 圈的行話,白話就是一本正經講錯話。Artificial Analysis 的事實性評測顯示,Grok 4.5 答對的比率比前代進步,但答錯時「自信滿滿給出錯誤答案」的比率翻了一倍多(見下表)。換成使用情境:它更常直接回你一個聽起來很篤定、其實是編出來的答案。寫程式時也有人抓到同一類毛病:它會發明不存在的套件、呼叫不存在的函式。
| 項目 | Grok 4.5 | 對照 |
|---|---|---|
| 幻覺率(AA-Omniscience 獨立評測) | 54%(前代 25%) | 同測驗的答對率 35% → 52%,有進步 |
| 有效越獄攻擊數(FAR.AI 紅隊測試) | 448 個 | Gemini 3.1 Pro 249 個;Claude 與 GPT 系列近乎 0 |
| 軟體工程修 bug 測驗(SWE-Bench Pro) | 64.7% | Claude Fable 5 80.4% |
安全防護是受測四家裡最弱的。 AI 安全研究機構 FAR.AI 做了一輪自動化越獄測試(越獄=用特製指令繞過模型的安全防護,讓它輸出本來該拒絕的內容),對每個危險題目自動生成上千個變形去攻擊。結果 Grok 被找出的有效攻擊多達數百個,同場的 Claude 跟 GPT 系列幾乎全數擋下(報導)。研究團隊還算出攻破 Grok 的成本只要 58 美元,是所有受測模型裡最便宜的。
這一代沒有發安全報告。 xAI 過去每個主要版本都會發 model card(模型安全評估文件),Grok 4.5 到本文查核日為止還沒有。對照 Anthropic 與 OpenAI 發布當天就附上安全報告的做法,這是個透明度缺口。
最難的軟體工程測驗仍輸 Claude 一截。 圖三那張廠商自己的表就承認了:修 bug 類的長時程任務,Claude Fable 5 明顯領先。社群的品味投票也偏向 Claude:介面設計、文筆這類「做出來好不好看、寫出來像不像人」的軟指標,多數重度使用者還是留在 Claude 那邊。
自家測驗受訓練資料污染影響。 Cursor 在官方文章的註腳承認,訓練資料不小心混進了 Cursor 自家程式碼的舊快照,所以 Grok 4.5 在 Cursor 自家測驗的分數有「先看過考題」的嫌疑,相關分數後來從發布素材撤下。願意自己招,算誠實;這也提醒你,廠商自測的數字都要打折看。
跟 GPT-5.6、Claude 怎麼選
發布三週後,社群沉澱出的分工輪廓已經蠻清楚:
| 你的情境 | 建議 |
|---|---|
| 寫程式量大、在意成本 | Grok 4.5,搭 Cursor 或 API 最划算 |
| 文字品質、介面品味、高風險內容 | Claude,社群公認的品質守門員 |
| 已訂 ChatGPT Plus | 留著就好;GPT-5.6 與 Grok 4.5 還沒有完整的公開對比,先照原本的工作流用 |
| 免費仔想用最新模型 | Grok 免費版自動給 4.5;Gemini 免費版也能選 3.6 Flash |
GPT-5.6 詳見 ChatGPT 5.6 一次看懂;Google 陣營詳見 Gemini 3.6 Flash 一次看懂。
一句話版本:跑量的粗活交給 Grok,需要品質跟安全感的活交給 Claude 或 GPT,錢包決定比例。
中文能力:目前是資料空窗
寫給中文讀者的文章,這段必須誠實:官方跟獨立評測手上都沒有 Grok 4.5 的中文專項成績。Artificial Analysis 有中文能力排行榜,截稿時榜上查不到 Grok 4.5 的成績。
社群訊號也偏薄。有中文使用者抱怨長輸出後中文品質退化,寫到一兩千字後語法開始崩,這類說法未經任何正式驗證;也有中文圈開發者實測後給出「寫程式一流、中文寫作偏弱」的評價。方向大致一致,證據等級不高。
務實建議:中文長文寫作先別把 Grok 當主力,拿免費版自己試短任務最準。Grok 免費版的中文使用方式,可以看這篇教學。
小結:價格戰是紅利,繫好安全帶再上車
Grok 4.5 對一般使用者的意義,比較大的其實是價格壓力。它用夠強的能力把旗艦等級的輸出價直接往下拉一階;同一個 7 月底,OpenAI 也調降了 Terra 與 Luna 的價格,高價策略的每一家都得重新算帳。廠商打價格戰,紅利最後落在使用者身上。
它同時也是這波獨立評測裡「能力與防護落差」特別刺眼的一個:更會做事,也更會唬爛,越獄測試的防護成績還墊底。所以用它的自保原則就一條:重要的輸出,自己再查一次。查資料、寫報告,關鍵數字回到原始來源核對;讓它動手做事,給的權限跟資料範圍越小越好。
接下來就看對手怎麼接招:OpenAI 已在 7 月底調降部分型號的價格,Anthropic 會不會跟進,決定這波紅利能滾多大。小企鵝會持續追蹤。