先给答案

effort 是你告诉 Claude“这件事值得花多少精力”的设置。这篇的数据和图表来自 Anthropic 的 Thariq 的文章《Using Claude Code: Spending your effort》(X 原文、claude.dev 互动版),选法和例子则是小企鹅按新手常遇到的工作重新整理的。Anthropic 的服务目前不直接对中国大陆开放。

赶时间的话,看这张图就够了:

该用哪个 effort?

effort 在调什么

想象你请朋友帮忙看一份文档。跟他说“帮我扫一眼”,他会看完大意就还给你;跟他说“明天要付印,拜托仔细看”,他会逐字核对,顺便帮你改掉几个他觉得不顺的地方。effort 就是这句交代。按 Thariq 的观察,它调整的是 Claude 自己做多少验证、测多少边界情况,以及替你做多少判断。

边界情况(edge case)指的是平常不会遇到、一遇到就出错的特殊状况,比如空白输入、超大文件、奇怪的符号。

所以 effort 开高会带来两件事。Claude 会自己多检查几轮,也会替你多做几个决定。 前者通常是好事,后者要看你想不想自己掌舵。

对照你的任务

先想想你手上的工作比较像下面哪一种:

等级你的任务是这样代价
low改错字、改一段文案、丢几个点子来回讨论等待较短,token 用量相对少
medium照着写好的规格,帮现有工具加一个功能等待和 token 用量都在中间
high修一个只在特定情况下才出现的 bug等待明显变长,token 明显变多
max把一个完整的小工具交给 Claude,自己不在旁边盯等待较久,token 用量相对多

表上没列的 xhigh 介于 high 和 max 之间,想比 high 再仔细一点、又不想等 max 那么久时可以用。

token 是 AI 处理文本的计算单位,可以粗略理解成字数,用量越多越花钱,也越快用完套餐的额度。等级不用一开始就决定好,在 Claude Code 里输入 /effort,对话到一半也能随时切换。

代价差多少?Thariq 拿同一句“做一个个人健身记录 app”测试,low 约 1.5 分钟,max 约 67 分钟,max 版本多了不少 Claude 自己决定添加的功能。

同一个需求花的时间

什么时候适合开高

判断方法很简单,问自己三件事:

  1. 做错了代价大不大?
  2. 这件事藏着多少特殊情况?
  3. 你会不会在旁边看着、随时纠正?

前两题回答“大”“多”、第三题回答“不会”,就值得开高。反过来,简单、好检查、你会一路盯着的事,low 或 medium 就够了,多等的时间换不到什么。

Thariq 分析了 Terminal-Bench 3.0(一套由社区出题的测试集)的结果,数据也体现了这个方向。例如有一道题要写 HTML 过滤器,挡掉所有偷偷塞入 JavaScript 的写法,Fable 5.1 在 low 只通过了 5 次里的 1 次,开到 xhigh 则 5 次全通过。按领域看 Fable 5.1 从 low 开到最高 effort 的通过率:

哪些工作开高 effort 差异明显

网络安全(64% → 87%)和硬件(34% → 75%)涨幅明显,这两种工作都很依赖反复验证。运营(12% → 22%)和媒体(18% → 30%)的涨幅就小得多。测试里的运营题,是按规定完成一家公司的月底贸易统计申报。小企鹅的理解是,这种照规则一步步做的工作,多检查几轮帮助比较有限。

开高也解决不了的情况

effort 加强的主要是检查,不保证能修正方向。Thariq 在帖子回复里说,除非需求非常模糊,不同 effort 下 Claude 几乎都走同一条路。他的分析也指出,开高能减少因漏掉边界情况造成的失败,但一开始选错方法的话,开高也救不回来。

开高 effort 改善了什么

Fable 5.1 在 low 和 max 各做 370 次,通过数、测试没发现的 bug、遗漏需求都变少了,唯独“需求有两种理解,选错一边”从 25 次增加到 47 次。effort 越高,Claude 越会替你做假设。需求模棱两可时,开高不会自动选对理解。 选错了,就是花更多时间做错的东西。

解决办法在你这边:

  • 写出“做完是什么样子”,例如要有哪几个界面、数据存在哪里。
  • 列出不要做的事,免得 Claude 自己加内容。
  • 发现一句话有两种理解,自己先选一种写进去。
  • 先用 low 或 medium 做出第一版,确认方向对了,最后再切到 high 做完整验证(Thariq 自己做新功能也是这样切换)。

Thariq 还发现,先把需求写成一份详细的规格(spec)再交给不同模型、不同 effort 去做,这次各版本就很接近。先写清楚需求,再决定 effort。

小企鹅的总结

小企鹅自己有一支 AI 团队在分工,effort 大概是这样分配的:

  • 每天的调度和分派工作:high
  • 照着写好的规格做例行开发:medium
  • 策略和系统架构的决定:xhigh

这是读完 Thariq 这篇之后重新分配的。effort 买到的是检查,方向要靠清楚的需求。规格写清楚的工作,medium 就很够用;真正需要开高的,是那些做错代价很大、又藏着很多特殊情况的事。

延伸阅读

参考资料