每次只改一处:让写作 Prompt 迭代有据可退

每次只改一处:让写作 Prompt 迭代有据可退

用固定材料和验收标准建立 Prompt 基线,每次只改一条规则并复测,让写作输出的改善、回归与下一步都有依据。

很多人改写作 Prompt 时,会同时加上角色、语气、格式、字数和示例。下一次输出变好了,大家却说不清是哪一条起了作用;下一次输出变差了,也很难退回一个可靠版本。
更稳的做法是:先跑出当前版本的基线,每次只改一条规则,再用同一批材料复测。 这条方法适合经常生成通知、邮件、FAQ、会议纪要和说明文的人。它解决的是 Prompt 怎么迭代,事实核对仍然要回到原始材料。

先固定三样东西

一次比较至少需要三份固定内容:
  1. 同一批材料。 材料要能代表真实任务,最好包含一条普通输入、一条容易越界的输入和一条信息不完整的输入。
  2. 同一份验收标准。 例如:日期和对象准确、读者动作明确、缺失信息单独列出、正文控制在指定长度内。
  3. 当前 Prompt。 先把当前版本原样保存,运行结果就是基线。
测试案例可以这样准备:
案例类型输入材料必须通过的条件容易出现的失败
普通一则已确认的产品功能通知写清变化、生效时间和读者动作漏掉一个动作
边界材料里同时有决定、建议和待定事项只把已确认内容写成确定语气把建议写成决定
信息不完整有对象和时间,缺少负责人把负责人列为待确认项用常识补出负责人
表格的作用是固定比较对象。换了材料,或者换了验收标准,结果就很难归因到 Prompt 的那一处改动。

可直接复制的 Prompt

把下面的 [ ] 内容替换成自己的任务。旧版 Prompt新版 Prompt 都要完整粘贴;唯一改动只写一条。
你是一名 Prompt 迭代评审员,负责比较同一写作任务的两个 Prompt 版本。

<task>
请使用同一批测试材料,分别运行“旧版 Prompt”和“新版 Prompt”,再按照同一份验收标准比较结果。
本轮只评估新版 Prompt 中列出的“唯一改动”。请先完成比较,再给出是否保留这条改动的建议。
</task>

<test_materials>
[粘贴 3 条或更多固定测试材料。每条材料保留编号。]
</test_materials>

<acceptance_criteria>
1. [例如:日期、数字、对象和范围与材料一致]
2. [例如:读者要完成的动作清楚]
3. [例如:缺失、冲突和待定信息单独列出]
4. [例如:正文不超过 180 字]
5. [例如:语气符合指定读者,不增加材料没有的承诺]
</acceptance_criteria>

<old_prompt>
[完整粘贴当前正在使用的 Prompt]
</old_prompt>

<new_prompt>
[完整粘贴只改了一处的新版 Prompt]
</new_prompt>

<唯一改动>
[只写一项改动。例如:在输出格式中加入“读者动作”字段。]
</唯一改动>

<evaluation_rules>
1. 对每条测试材料,分别按旧版和新版生成结果。保留两版的关键差异,不要只给总评。
2. 按验收标准逐项判断“通过、未通过或无法判断”,并为每项引用对应的输出片段。
3. 把结果分成“改善项、保持项、回归项、无法判断项”。新版新增的问题算回归项。
4. 只把新版相对旧版的变化归因于“唯一改动”。其他差异标为无法判断。
5. 如果新版有回归项,建议保留旧版,或只提出下一轮要测试的一条改动。
6. 如果新版改善至少一项、没有回归项,而且其他关键项保持通过,建议保留新版。
7. 评审完成后停止。不要顺手重写两个 Prompt,也不要添加新的验收标准。
</evaluation_rules>

<output_format>
## 评审结论 {#评审结论}
- 建议:保留新版 / 保留旧版 / 暂不判断
- 唯一改动:
- 判断依据:

## 逐案比较 {#逐案比较}
对每个测试材料分别输出:
- 案例编号与类型:
- 改善项:
- 保持项:
- 回归项:
- 无法判断项:
- 关键输出片段:

## 验收标准对照表 {#验收标准对照表}
| 验收项 | 旧版结果 | 新版结果 | 处理动作 |
| --- | --- | --- | --- |

## 下一步 {#下一步}
只写一项:保留当前版本,回退到旧版,或下一轮要测试的单一改动。
</output_format>
这条 Prompt 把“生成”和“评审”分开了。模型先用两个版本处理同一批材料,再按同一标准对照;评审阶段只负责判断,避免模型一边发现问题、一边把新版 Prompt 改成第三个版本。

用一则通知看结果

下面的案例是虚构的。旧版 Prompt 只要求“写一则简洁的产品通知”;新版只增加一项:输出中必须单列“读者动作”。材料保持不变:
5 月 12 日起,团队知识库的搜索结果会优先显示标题和正文同时命中的页面。
管理员可以在设置页查看新的排序说明。旧搜索结果是否重新建立索引,产品团队尚未决定。
旧版与新版各运行一次后,评审表可以是这样:
验收项旧版结果新版结果处理动作
生效时间和变化准确通过通过保持
管理员动作明确部分通过,动作埋在正文中通过,单列查看排序说明改善
未决定事项保持待定通过通过保持
没有补写重新索引安排通过通过保持
正文长度符合上限通过通过保持
这次可以保留新版,因为唯一改动带来了一个可观察的改善,旧版已经通过的项目也保持通过。
如果新版把“产品团队尚未决定”改成“系统会自动重新建立索引”,评审表就会出现回归项。此时先退回旧版,或者只测试另一条规则,例如把“待定事项”改成单独字段。评审阶段先记录结果,下一轮再改变 Prompt。

为什么要小步改

OpenAI 的模型优化指南把提示优化放在一个循环里:先用评估建立基线,再用接近真实使用的测试数据运行,依据反馈调整 Prompt,然后重复这个过程。1
Google 的提示设计指南也把迭代当成正常步骤,并列出重新措辞、调整 Prompt 内容顺序等尝试方向。页面还给出“Plan、Execute、Validate、Format”的输出检查顺序。2
Anthropic 的评估指南建议把成功标准写得具体、可测、可实现并且贴近任务;评估材料应尽量模拟真实任务,并覆盖边界案例。3
把三条建议放到中文写作里,就是四个动作:先保存基线,固定测试材料,改一处,按原标准复测。 这样做的价值是让比较结果更容易解释。它没有保证某条规则会在所有模型、所有任务上提升输出。

这条方法适合什么场景

  • 产品通知: 可以观察生效时间、影响对象和读者动作有没有被保留。
  • 客服回复: 可以用相同的用户问题比较语气、解决路径和缺失信息处理。
  • FAQ: 可以检查答案字段是否齐全,未知问题是否被单独标出。
  • 会议纪要: 可以检查决定、建议、问题和后续动作有没有混在一起。
任务变化较大时,先更新测试材料和验收标准。模型、系统指令、上下文范围或生成参数发生变化时,也要重新跑基线。一次比较只改变 Prompt 的一处,才能把结果解释清楚。
这条方法适合检查输出质量,人工仍然要核对事实。涉及医疗、法律、财务、权限和对外承诺的文字,评审表通过也只说明输出符合这份标准,不能代替负责人的审核。

30 秒复盘

  1. 旧版、新版是否使用了同一批材料?
  2. 两版是否使用了同一份验收标准?
  3. 本轮是否真的只改了一处?
  4. 新版具体改善了哪一项?
  5. 旧版已经通过的项目是否保持?
  6. 是否出现回归项或无法判断项?
  7. 下一步是保留、回退,还是只测试另一条规则?
如果你每次都把比较结果留下来,Prompt 就从一段“凭感觉修改的文字”变成了可以回退、可以复测的工作版本。下一次出现问题时,先找最近一条改动,再用同一批材料重跑。

Este contenido lo produjo un canal automáticamente. Con una sola frase, Neodrop puede seguir produciendo para ti.

Contenido relacionado

More from this channel