Claude Code能自动调校AI应用,客服案例成本降至五分之一
2026-09-30分类:人工智能 阅读()

Anthropic 9 月28 日在开发者部落格发布文章,宣布在Claude Code 可用的claude-api skill 中加入两个新指令:/claude-api build-eval 帮开发者为自己的AI 应用建立评测集,/claude-api hillclimb 则依评测结果逐步调整提示词、模型与参数,同时防止「只在考题上变好」的过度拟合。
Anthropic 公布的内部客服案例中,Claude 把原本用Opus 4.8 高推理强度的设定,一路调整成较便宜的Sonnet 5 低推理强度。在调整过程从未看过的测试工单上,准确率从78.6% 升到90.5%,成本约只剩原本的五分之一。
客服评测从Opus 4.8 换到Sonnet 5,每张工单成本从4.6 美分降到约1 美分
这项客服评测共有44 张工单,30 张用于调整,14 张保留作为测试。起点是Opus 4.8 预设的高推理强度,调整用工单的决策准确率为74.4%,每张工单的token 成本为4.6 美分。
Claude 先检查提示词,删掉强制性的工具呼叫流程、草稿步骤与互相矛盾的规则,接着改用低推理强度的Opus 5.5,准确率升到87.8%,成本降到每张1.9 美分。文章指出,部分节省来自Opus 5.5 的定价,其输入与输出token 比Opus 4.8 便宜20%,快取读取便宜60%。
既然Opus 5.5 已经达标,Claude 又往下试更便宜的Sonnet 5 低推理强度,准确率约88.9%,成本再砍一半到每张约1 美分。最后加入分流规则与退款上限的交叉比对,Sonnet 5 在调整用工单上达到98.9%。
一次只改一处,测试集没进步就撤回
hillclimb 开始前,Claude 会先问开发者要优化什么,例如提升表现,或在表现不变下降低成本,再把评测集随机拆成调整用与测试用两组。每一轮Claude 只读调整组的失败纪录,提出一个修改。如果调整组分数上升、测试组却没动,Claude 会判断可能是过度拟合而撤回;两组都进步才保留。
文章举例,若评测题目刚好需要图片文字辨识,调整过程可能替应用加上OCR 工具,考试分数提高,实际使用却没帮助。 Anthropic 因此要求不要把失败内容直接贴进提示词,也要让答案在结构上碰不到模型,避免模型直接找到评测答案。
分数连续两到三轮停滞时,Claude 会逐一检查剩下的失败案例并按原因分类,找出题目本身有歧义、评分器出错或评测环境的问题。 Anthropic 用同一套流程调整claude-api skill 本身,通过率从66% 提升到约88%,过程中发现一题的评分器要求与题目不符,另一个评分器的说明与官方文件矛盾。
好的评测要让最强模型也拿不到满分
build-eval 会先访谈开发者,依序从正式环境的对话纪录、错误回报与客服工单、手写的5 到10 个案例,以及从程式码推导的案例中取样,并产生一个页面让开发者确认每一笔输入。评分方式优先用最便宜可行的程式比对;答案开放时才用另一个模型当评审,而且评审模型不应与受测模型相同。
Anthropic 在文中列出好评测的四个条件:题目要反映正式环境、越强的模型与越高的推理强度分数应该越高、最强模型在最高强度下仍应明显低于100%,以及每次执行的结果差异要小。文章也提醒,只挑今天模型答错的题目,量到的可能只是这个模型的弱点,而不是应用真正需要的能力。
Tags:
