
每次只改一处:让写作 Prompt 迭代有据可退
用固定材料和验收标准建立 Prompt 基线,每次只改一条规则并复测,让写作输出的改善、回归与下一步都有依据。
很多人改写作 Prompt 时,会同时加上角色、语气、格式、字数和示例。下一次输出变好了,大家却说不清是哪一条起了作用;下一次输出变差了,也很难退回一个可靠版本。
更稳的做法是:先跑出当前版本的基线,每次只改一条规则,再用同一批材料复测。 这条方法适合经常生成通知、邮件、FAQ、会议纪要和说明文的人。它解决的是 Prompt 怎么迭代,事实核对仍然要回到原始材料。
先固定三样东西
一次比较至少需要三份固定内容:
- 同一批材料。 材料要能代表真实任务,最好包含一条普通输入、一条容易越界的输入和一条信息不完整的输入。
- 同一份验收标准。 例如:日期和对象准确、读者动作明确、缺失信息单独列出、正文控制在指定长度内。
- 当前 Prompt。 先把当前版本原样保存,运行结果就是基线。
测试案例可以这样准备:
| 案例类型 | 输入材料 | 必须通过的条件 | 容易出现的失败 |
|---|---|---|---|
| 普通 | 一则已确认的产品功能通知 | 写清变化、生效时间和读者动作 | 漏掉一个动作 |
| 边界 | 材料里同时有决定、建议和待定事项 | 只把已确认内容写成确定语气 | 把建议写成决定 |
| 信息不完整 | 有对象和时间,缺少负责人 | 把负责人列为待确认项 | 用常识补出负责人 |
表格的作用是固定比较对象。换了材料,或者换了验收标准,结果就很难归因到 Prompt 的那一处改动。
可直接复制的 Prompt
把下面的
[ ] 内容替换成自己的任务。旧版 Prompt 和 新版 Prompt 都要完整粘贴;唯一改动只写一条。你是一名 Prompt 迭代评审员,负责比较同一写作任务的两个 Prompt 版本。
<task>
请使用同一批测试材料,分别运行“旧版 Prompt”和“新版 Prompt”,再按照同一份验收标准比较结果。
本轮只评估新版 Prompt 中列出的“唯一改动”。请先完成比较,再给出是否保留这条改动的建议。
</task>
<test_materials>
[粘贴 3 条或更多固定测试材料。每条材料保留编号。]
</test_materials>
<acceptance_criteria>
1. [例如:日期、数字、对象和范围与材料一致]
2. [例如:读者要完成的动作清楚]
3. [例如:缺失、冲突和待定信息单独列出]
4. [例如:正文不超过 180 字]
5. [例如:语气符合指定读者,不增加材料没有的承诺]
</acceptance_criteria>
<old_prompt>
[完整粘贴当前正在使用的 Prompt]
</old_prompt>
<new_prompt>
[完整粘贴只改了一处的新版 Prompt]
</new_prompt>
<唯一改动>
[只写一项改动。例如:在输出格式中加入“读者动作”字段。]
</唯一改动>
<evaluation_rules>
1. 对每条测试材料,分别按旧版和新版生成结果。保留两版的关键差异,不要只给总评。
2. 按验收标准逐项判断“通过、未通过或无法判断”,并为每项引用对应的输出片段。
3. 把结果分成“改善项、保持项、回归项、无法判断项”。新版新增的问题算回归项。
4. 只把新版相对旧版的变化归因于“唯一改动”。其他差异标为无法判断。
5. 如果新版有回归项,建议保留旧版,或只提出下一轮要测试的一条改动。
6. 如果新版改善至少一项、没有回归项,而且其他关键项保持通过,建议保留新版。
7. 评审完成后停止。不要顺手重写两个 Prompt,也不要添加新的验收标准。
</evaluation_rules>
<output_format>
## 评审结论 {#评审结论}
- 建议:保留新版 / 保留旧版 / 暂不判断
- 唯一改动:
- 判断依据:
## 逐案比较 {#逐案比较}
对每个测试材料分别输出:
- 案例编号与类型:
- 改善项:
- 保持项:
- 回归项:
- 无法判断项:
- 关键输出片段:
## 验收标准对照表 {#验收标准对照表}
| 验收项 | 旧版结果 | 新版结果 | 处理动作 |
| --- | --- | --- | --- |
## 下一步 {#下一步}
只写一项:保留当前版本,回退到旧版,或下一轮要测试的单一改动。
</output_format>这条 Prompt 把“生成”和“评审”分开了。模型先用两个版本处理同一批材料,再按同一标准对照;评审阶段只负责判断,避免模型一边发现问题、一边把新版 Prompt 改成第三个版本。
用一则通知看结果
下面的案例是虚构的。旧版 Prompt 只要求“写一则简洁的产品通知”;新版只增加一项:输出中必须单列“读者动作”。材料保持不变:
5 月 12 日起,团队知识库的搜索结果会优先显示标题和正文同时命中的页面。
管理员可以在设置页查看新的排序说明。旧搜索结果是否重新建立索引,产品团队尚未决定。旧版与新版各运行一次后,评审表可以是这样:
| 验收项 | 旧版结果 | 新版结果 | 处理动作 |
|---|---|---|---|
| 生效时间和变化准确 | 通过 | 通过 | 保持 |
| 管理员动作明确 | 部分通过,动作埋在正文中 | 通过,单列查看排序说明 | 改善 |
| 未决定事项保持待定 | 通过 | 通过 | 保持 |
| 没有补写重新索引安排 | 通过 | 通过 | 保持 |
| 正文长度符合上限 | 通过 | 通过 | 保持 |
这次可以保留新版,因为唯一改动带来了一个可观察的改善,旧版已经通过的项目也保持通过。
如果新版把“产品团队尚未决定”改成“系统会自动重新建立索引”,评审表就会出现回归项。此时先退回旧版,或者只测试另一条规则,例如把“待定事项”改成单独字段。评审阶段先记录结果,下一轮再改变 Prompt。
为什么要小步改
OpenAI 的模型优化指南把提示优化放在一个循环里:先用评估建立基线,再用接近真实使用的测试数据运行,依据反馈调整 Prompt,然后重复这个过程。1
Google 的提示设计指南也把迭代当成正常步骤,并列出重新措辞、调整 Prompt 内容顺序等尝试方向。页面还给出“Plan、Execute、Validate、Format”的输出检查顺序。2
Anthropic 的评估指南建议把成功标准写得具体、可测、可实现并且贴近任务;评估材料应尽量模拟真实任务,并覆盖边界案例。3
把三条建议放到中文写作里,就是四个动作:先保存基线,固定测试材料,改一处,按原标准复测。 这样做的价值是让比较结果更容易解释。它没有保证某条规则会在所有模型、所有任务上提升输出。
这条方法适合什么场景
- 产品通知: 可以观察生效时间、影响对象和读者动作有没有被保留。
- 客服回复: 可以用相同的用户问题比较语气、解决路径和缺失信息处理。
- FAQ: 可以检查答案字段是否齐全,未知问题是否被单独标出。
- 会议纪要: 可以检查决定、建议、问题和后续动作有没有混在一起。
任务变化较大时,先更新测试材料和验收标准。模型、系统指令、上下文范围或生成参数发生变化时,也要重新跑基线。一次比较只改变 Prompt 的一处,才能把结果解释清楚。
这条方法适合检查输出质量,人工仍然要核对事实。涉及医疗、法律、财务、权限和对外承诺的文字,评审表通过也只说明输出符合这份标准,不能代替负责人的审核。
30 秒复盘
- 旧版、新版是否使用了同一批材料?
- 两版是否使用了同一份验收标准?
- 本轮是否真的只改了一处?
- 新版具体改善了哪一项?
- 旧版已经通过的项目是否保持?
- 是否出现回归项或无法判断项?
- 下一步是保留、回退,还是只测试另一条规则?
如果你每次都把比较结果留下来,Prompt 就从一段“凭感觉修改的文字”变成了可以回退、可以复测的工作版本。下一次出现问题时,先找最近一条改动,再用同一批材料重跑。
Fuentes de referencia
- 1Model optimization \| OpenAI API
developers.openai.com
- 2
- 3Define success criteria and build evaluations - Claude Platform
docs.anthropic.com
Este contenido lo produjo un canal automáticamente. Con una sola frase, Neodrop puede seguir produciendo para ti.
