Claude Opus 5.5 在长任务上会向用户汇报进度。Anthropic 的提示词指南把一种情况写进排查清单:无人值守的代理汇报完进度,停在任务半路。指南说明,有些汇报以文本结束这一轮,停止原因是 end_turn,后面没有工具调用。如果旧循环把这样的一轮当成任务结束,运行就停在这里。
指南的原话是:把纯文本的回合结束当作一份汇报,而不是任务已经做完的证据。中文科技站点在 9 月 26 日晚讨论了这份指南。下面的做法和接口变化,都来自 Anthropic 的提示词指南和迁移指南。
[1]
指南建议把任务的各部分放进一份清单,用待办工具或一个文件都行,让模型自己更新。如果一轮结束时还有未完成项,而且没有说明被什么挡住,应用就再发一条短的用户消息,点名那些项。指南给的例子是:清单里还有未完成项,迁移剩下的两个端点并更新它们的测试,继续做;如果某一项被挡住,说明挡在哪里。
也可以事先写好完成条件。每到回合结束,让一个更小的模型对照对话检查。没达到,就把原因当作下一条用户消息发回去。两条路都要停手:同一任务上自动续跑两到三次就停止,交给人看,不要无限重复。如果模型启动的后台命令或子代理还在跑,也不要当成做完,要等它结束,再把输出送回去。
指南说,Opus 5.5 听得进被点名的停止方式。已保存的页面列出用户见过的四种、而工作还没做完的结束方式。前三种是完整的:一份长总结宣布下一步,却没有工具调用,下一步于是没有开始;提议继续做,除非用户另有想法,然后停下来等一个不会出现的回答;列出一批决策,但按模型自己的说法,其中没有一项挡住剩下的工作。第四种在抓取到的文字里没有写完,只看到它开始说:因为这一轮已经很长,就决定先汇报。
一段加在系统提示末尾的说明,可以让模型把状态和下一轮工具调用写在同一条消息里,从而少一些先汇报再停。指南要求:危险或不可逆的动作仍由应用自己确认;有人在回路里、能够回答的场景不要加这段。加上之后,每个任务的工具调用和输出词元通常会更多。进度若写进思考块,默认显示是空的;要把 display 设为 updates,才能收到每条进度的摘要。
[1]另一组变化会让旧请求直接失败。迁移指南写明,被拒绝的设置返回 400。思考不能关掉:不传 thinking 字段,或传 adaptive,二者等价,自适应思考始终开启。设成 disabled,或手工指定 budget_tokens,都会被拒绝。工具选择只用 auto(默认)或 none。设成 any,或指定某一个工具,也会被拒绝。在 Claude API 和 Google Cloud 上,电脑操作要声明为 computer_toolset_20260801;旧的 computer_20251124 在这两处会得到 400。非默认的 temperature、top_p、top_k,以及用预填的助手回合结尾,同样被拒绝。
思考块还绑在模型和对话上。2026 年 8 月 31 日 00:00 UTC 及之后创建的账户,如果中途改了系统提示、工具或更早的消息,再回放思考块,默认返回 400。只追加、不改写的集成不用改这段代码。使用 Claude Managed Agents 的,迁移指南说除了更换模型名,不需要其他改动。
思考在每次请求上都会跑。max_tokens 同时盖住思考和正文。思考词元即使不返回给调用方,也按输出词元计费。默认 thinking.display 是 omitted,思考字段是空的,旁边仍有签名。要可读摘要,设成 summarized。读结果时要按块的类型取正文,不要假设第一块就是文字。工具循环里,思考块必须原样传回,删掉、改字或调换顺序都会被拒绝。
努力程度是调节思考量的旋钮。Opus 5.5 默认 medium,Opus 5 默认 high。指南写明,在 Anthropic 的测试里,Opus 5.5 以默认的 medium,在真实代码库的多步任务上追平或超过 Opus 5 的 high,步数和词元更少。同一档位上,Opus 5.5 每一轮想得更多,xhigh 和 max 尤其明显。沿用 Opus 5 的档位,回合会更长,输出词元也会更多。想少想一点,指南建议先降档,这比在提示词里要求它少想更稳。指南还写道,Opus 5.5 生成输出词元的速度比 Opus 5 快 30% 以上,并且往往用更少的词元做完同一项任务。
迁移指南另给了价格:Opus 5.5 为每百万输入词元 4 美元、每百万输出词元 20 美元,Opus 5 为 5 美元和 25 美元。这是价目,不是「模型变懒」的解释。停在半路,来自旧循环把一份进度汇报当成收工。
[1][2]要点
- 纯文本的 end_turn 是汇报,不是任务完成。
- 清单未完成就续跑;同一任务自动续跑两到三次后停。
- 关掉思考、强制工具、以及在 Claude API 上使用旧电脑工具,都会返回 400。
- 默认 medium 在 Anthropic 的代码测试里可以追平或超过 Opus 5 的 high,但同一档位想得更多。