实战#代码智能体#提示词

Opus 5.5 提示词怎么写:官方指南教的是减法

Opus 5.5 提示词指南的核心是减法:effort 是主控,先降档、删掉替身思考的旧指令。五档场景、该删该加的句子、Claude Code 调法。

银色 0–8 刻度盘上一只黑色旋钮,指针停在低档位置——比喻把 effort 档位调对(Retired electrician 摄影,CC0,Wikimedia Commons)

把上一代 Opus 的提示词原样搬进 5.5,多半会遇到两种情况:回复出得更慢了,token 也花得更多;有些以前屡试不爽的写法,现在要么被无视,要么直接报错。Opus 5.5 发布两周后,Anthropic 在 platform.claude.com 挂出的官方提示词指南《Prompting Claude Opus 5.5》把原因讲得很直白:这一代 thinking 常开、关不掉,思考量由 effort 档位控制。上一代靠提示词逼出来的行为,现在要么归档位管,要么就该删。

事实核查截至 2026-10-02。数字和引文全部来自官方文档原文,出处见文中链接。

要点

  • Opus 5.5 默认 effort 是 medium,官方实测在真实代码库的多步编码任务上追平或超过 Opus 5 开 high 的成绩,步数和 token 都更少。
  • 官方指南的基调是删指令:「请仔细思考再回答」删掉后回复更快、质量没有明显下降;「把推理过程写出来」可能被 reasoning_extraction 分类器直接拒答。
  • 在 Claude Code 里用 /effort 或 --effort 调档,ultrathink 关键词可以只给当前一轮加深推理,不改档位。

老提示词为什么失灵

自适应思考在 5.5 上常开,effort 成了智能、延迟和成本三者取舍的主控旋钮。麻烦在于,同一档位下 5.5 每轮想得比 Opus 5 多,xhigh 档尤其明显——把 Opus 5 的档位设置原样带过来,轮次会更长、输出更多。官方给的诊断入口就是这条:如果感觉轮次变长、成本变高,先怀疑档位,不是提示词。

好消息也有:官方口径里,5.5 的输出 token 生成速度比 Opus 5 快 30% 以上,同一个任务收尾用的 token 更少。质量这块,medium 档在真实仓库的多步编码任务上追平或超过 Opus 5 的 high 档;好几个编码评测里,low 档以低得多的成本就能接近 Opus 5 的 high。换句话说,大部分任务用不着更长的提示词,把档位放对就行。

官方原话说得干脆:想让模型少想,先降档位——降档比提示词指令更可靠地减少思考。

五个档位怎么选

5.5 系列五档全开:low、medium、high、xhigh、max。Opus 5.5 默认 medium(Opus 5 默认 high);Sonnet 5.5 在 API 上默认 high。Claude Code 文档给每档配了适用场景:

档位 适合什么 例子
low 每步都要过目的快问快答 头脑风暴、小改动
medium 5.5 默认档,范围清楚的日常活 日常编码、知识工作
high 验证吃重、边界情况多 修 bug
xhigh 更深的推理,token 花费更高 疑难杂症
max 少人盯的硬骨头 安全漏洞挖掘

几条配套规则都出自官方文档。xhigh 和 max 只在自家评测证明有质量增益时再开,官方特别提醒 max 档可能过度思考。max_tokens 要给大——思考 token 也计入输出上限,agent 编码场景官方建议直接给到 128,000,这是模型的上限。改顶层 effort 会作废提示词缓存,API 上要逐轮变档,用 per-message effort(beta)代替,缓存可以保住。Sonnet 5.5 另有 thinking: {"type": "between_tools"},在 low 到 high 档可关掉前置思考(xhigh 和 max 下会报 400)。

选档的官方方法论只有一句:别沿用旧模型的设定,用自己的评测把五档扫一遍(effort sweep),看数据说话。

先删这些句子

官方指南花了整整两节讲「删」,这在各家提示词指南里少见。

「请仔细思考再回答」——删。模型自己决定想多久,档位才是开关。官方在聊天产品里实测,删掉这类句子后回复更快开始,质量没有明显下降。

「把你的思考过程写出来」——删,还可能被拒。5.5 跑一组安全分类器,其中 reasoning_extraction 专门拦「在正文里复现内部推理」的请求,命中就是一条拒答响应。想看思路,设 display: "summarized" 从思考块读摘要;要简短解释答案、总结做过什么,不受影响。

thinking: disabled 的整套写法——5.5 每个档位都返回 400 错误。原来为关思考打的补丁(允许先说话、禁用内部标签之类)值得逐条重测,多半可以一起删。

多轮追问重想——聊天场景里 5.5 有时会把上一轮的答案重新过一遍,追问越短越亏。官方给了两句系统提示,原文照录:“Once you have answered something, treat that answer as done. On later turns, focus your thinking on what the user is asking now, and don’t go back over an earlier answer unless the user asks about it or points out a problem with it.” 实测追问回复更快、质量不受影响。代价是模型更少主动挑自己前面答案的错,长分析和多步 agent 任务别加这两句。

再加这四句

删完之后,有几句话官方明确建议加回来。

防「汇报完就停」。 长任务跑一半,模型可能写一段总结宣布下一步,然后停下等你——无人值守的 agent 会卡死在这。官方的方案是完成条件前置、挂一份清单,清单没走完就发一条续跑消息(文档里的例子是 “Your task list still has open items: migrate the remaining two endpoints and update their tests. Continue with them.”),同一任务自动续跑两三次就该停下人工看。官方还写了一段点名四类早停的系统提示段落,要从会话第一条请求就加上——中途加会改写前缀、作废之前的思考块。这段会带来略多的工具调用和输出,人类在环的应用不要用。

多应用工作流先探索再动手。 跨邮箱、文档、表格的自动化任务,关键信息常在请求没提到的地方。系统提示加一句官方原文 “Before taking any action, explore broadly with tool calls…”,实测 medium 和 max 档的正确完成率都明显提高,代价是工具调用略多。注意这句会让模型动手更大,被搜的记录里别放不可信内容。

多智能体给时间预算。 5.5 对流逝时间很敏感,让 harness 在每条消息末尾带上「elapsed 340s / 1200s」这样的进度,小团队明显更快完成,答案质量与单代理相当。预算只是参考,硬停还是要自己的超时;赶时间时模型可能少搜索、少验证,质量要自己盯。

粘贴内容打标签。 用户从别处粘进来的文本可能带着指令。给每段粘贴内容包上带同一随机 ID 的前后标签,再加一句系统说明,模型对间接注入的抵抗会更好。官方提醒这会让模型偶尔更保守,效果自己量。

Sonnet 5.5 指南里还有一条同系列的实测数据,值得照抄进系统提示。xhigh 和 max 档的模型完成任务后会自起审查轮次、顺手补测试和文档,加一句官方给的 “When the work the user asked for is done and its checks pass, stop and report. Don’t start extra rounds of review or hardening on your own, and don’t launch reviewer sub-agents unless the user asked for a review. If you think a deeper review is worth doing, say so at the end.” ——max 档编码任务实测,这句让模型不再自起 reviewer 子代理,会话成本降了约三分之一,质量没有变化。中文流传的摘要把它说成 Opus 5.5 指南的内容,出处其实是 Sonnet 5.5 那篇,写的时候留意。

落地到 Claude Code

Claude Code 里调档不用改提示词。/effort 直接设档,/effort auto 清掉保存过的档位回到模型默认;claude --effort high 管单次会话;环境变量 CLAUDE_CODE_EFFORT_LEVEL 和 settings 里的 modelSettings 按模型持久化(settings 不收 max)。/model 选择器里方向键也能拨 effort。5.5 在 Claude Code 里同样默认 medium。临时碰上硬骨头,在提示词里写 ultrathink,只给当前一轮加深推理,档位不动。

提示词本身,Claude Code 官方最佳实践的要求和 5.5 指南是一路的:任务说清楚,点名文件、场景和验证方式——「给 foo.py 写个测试,覆盖用户已登出的边界,别用 mock」比「给 foo.py 加测试」少好几轮纠偏。给模型一个能跑的检查——测试、构建或截图对比,官方原话是 “the difference between a session you watch and one you walk away from”。同一问题纠正两次,就 /clear 重开、把学到的东西写进新提示词——「一个带更好提示词的干净会话,几乎总是胜过堆满纠错的长会话」。CLAUDE.md 同理做减法:每一行问「删掉这行模型会不会犯错」,不会就删,臃肿的记忆文件会让模型连真正的指令一起忽略。

图表截图特例

读密集图表是 5.5 最反直觉的进步:官方实测,它开到最低档读图取数的准确度,超过 Opus 5 开到最高档,输出 token 只用一小部分。图表任务不用拉档位了。更难的输入另有办法——技术图纸喂高分辨率原图;再密的给一个装了 PIL 和 OpenCV 的容器,让模型自己裁剪、放大、测量、复核,这比拉到 max 档更准也更省。

前端样式的要求也要具体。「不要有 AI 味」这种写法官方点过名——avoid generic AI look 只是用一个默认审美换另一个默认审美,要说就说具体不要什么(蓝紫渐变、某几种烂大街字体),然后迭代着往清单里补。

上手三步

  1. Claude Code 里跑 /effort auto,确认 5.5 回到默认 medium,没被旧设置顶掉。
  2. 把项目提示词里的「仔细思考」「写出推理过程」删掉,重跑一个老任务,对比步数和 token。
  3. 下一个长任务给完成条件和一个能跑的检查,清单没走完就让它接着干。

档位调对、旧指令删掉之后,再谈提示词技巧才有意义——这是官方指南和上一代最大的顺序差别。想看别人怎么写 5.5 的提示词,本站拆过一批画廊提示词和一份视频工作流教程,可以对照着用。