先給答案

effort 是你告訴 Claude「這件事值得花多少力氣」的設定。這篇的數據和圖表來自 Anthropic 的 Thariq 的文章〈Using Claude Code: Spending your effort〉(X 原文、claude.dev 互動版),選法和例子則是小企鵝按新手常遇到的工作重新整理的。

趕時間的話,看這張圖就夠了:

該用哪個 effort?

effort 在調什麼

想像你請朋友幫忙看一份文件。跟他說「幫我掃一眼」,他會看完大意就還你;跟他說「明天要送印,拜託仔細看」,他會逐字核對,順便幫你改掉幾個他覺得不順的地方。effort 就是這句交代。照 Thariq 的觀察,它調的是 Claude 自己做多少驗證、測多少邊界情況,以及替你下多少判斷。

邊界情況(edge case)指的是平常不會遇到、一遇到就出錯的特殊狀況,像是空白輸入、超大檔案、奇怪的符號。

所以 effort 開高會帶來兩件事。Claude 會自己多檢查幾輪,也會替你多做幾個決定。 前者通常是好事,後者要看你想不想自己掌舵。

用你的任務對照

先想想你手上的工作比較像下面哪一種:

等級你的任務長這樣代價
low改錯字、改一段文案、丟幾個點子來回討論等待較短,token 用量相對少
medium照著寫好的規格,幫現有工具加一個功能等待和 token 用量都在中間
high修一個只在特定情況才出現的 bug等待明顯變長,token 明顯變多
max把一個完整的小工具交給 Claude,自己不在旁邊盯等待較久,token 用量相對多

表上沒列的 xhigh 介於 high 和 max 之間,想比 high 再仔細一點、又不想等 max 那麼久時可以用。

token 是 AI 處理文字的計算單位,可以粗略想成字數,用量越多越花錢,也越快吃完方案的額度。等級不用一開始就決定好,在 Claude Code 裡輸入 /effort,對話到一半也能隨時切換。

代價差多少?Thariq 拿同一句「做一個個人健身紀錄 app」測試,low 約 1.5 分鐘,max 約 67 分鐘,max 版本多了不少 Claude 自己決定加的功能。

同一個需求花的時間

什麼時候適合開高

判斷方法很簡單,問自己三件事:

  1. 做錯了代價大不大?
  2. 這件事藏著多少特殊狀況?
  3. 你會不會在旁邊看著、隨時糾正?

前兩題答「大」「多」、第三題答「不會」,就值得開高。反過來,簡單、好檢查、你會一路盯著的事,low 或 medium 就夠了,多等的時間換不到什麼。

Thariq 分析了 Terminal-Bench 3.0(一套由社群出題的測驗集)的結果,數據也是這個方向。例如一題要寫 HTML 過濾器、擋掉所有偷塞 JavaScript 的寫法,Fable 5.1 在 low 只過了 5 次裡的 1 次,開到 xhigh 則 5 次全過。按領域看 Fable 5.1 從 low 開到最高 effort 的通過率:

哪些工作開高 effort 差異明顯

資安(64% → 87%)和硬體(34% → 75%)漲幅明顯,這兩種工作都很吃反覆驗證。營運(12% → 22%)和媒體(18% → 30%)的漲幅就小得多。測驗裡的營運題,是照規定跑完一家公司的月底貿易統計申報,小企鵝的理解是,這種照規則一步步做的工作,多檢查幾輪幫助比較有限。

開高也救不了的情況

effort 加強的主要是檢查,不保證能修正方向。Thariq 在貼文回覆裡說,除非需求非常模糊,不同 effort 下 Claude 幾乎都走同一條路。他的分析也指出,開高能減少漏掉邊界情況造成的失敗,但一開始選錯方法的,開高也救不回來。

開高 effort 改善了什麼

Fable 5.1 在 low 和 max 各做 370 次,通過數、測試沒抓到的 bug、看漏需求都變好了,唯獨「需求有兩種讀法,選錯邊」從 25 次增加到 47 次。effort 越高,Claude 越會替你做假設。需求模稜兩可時,開高不會自動選對讀法。 挑錯了,就是花更多時間做錯的東西。

解法在你這邊:

  • 寫出「做完長什麼樣子」,例如要有哪幾個畫面、資料存在哪裡。
  • 列出不要做的事,免得 Claude 自己加料。
  • 發現一句話有兩種讀法,自己先選一種寫進去。
  • 先用 low 或 medium 做出第一版,確認方向對了,最後再切到 high 做完整驗證(Thariq 自己做新功能也是這樣切換)。

Thariq 也發現,先把需求寫成一份詳細的規格(spec)再交給不同模型、不同 effort 去做,這次各版本就很接近。先寫清楚需求,再決定 effort。

小企鵝的總結

小企鵝自己有一組 AI 團隊在分工,effort 大概是這樣配的:

  • 每天的調度和分派工作:high
  • 照著寫好的規格做例行開發:medium
  • 策略和系統架構的決定:xhigh

這是讀完 Thariq 這篇之後重新分配的。effort 買到的是檢查,方向要靠清楚的需求。 規格寫清楚的工作,medium 就很夠用;真正需要開高的,是那些做錯代價很大、又藏著很多特殊狀況的事。

延伸閱讀

參考資料