
别让 AI 只给你一版:先生成候选,再按标准选稿
用两阶段 Prompt 先生成两种取舍不同的候选稿,再按固定验收标准比较,减少反复润色时的事实遗漏和表达漂移。
很多人让 AI 写通知、邮件或说明时,只拿一版结果,然后反复说「再自然一点」「再简洁一点」。每一轮改写都可能换掉一个取舍:句子更短了,条件却被删掉;语气更温和了,读者该做什么又变得含糊。
更容易检查的做法是:先让 AI 针对同一个任务写两版,再让它用同一组标准比较两版。 第一轮负责展开选择,第二轮负责解释选择。最后由你决定采用哪一版,或者只接受评审表里指出的最小修改。
这条流程适合一项任务有多种合理写法的场景。它适合写产品通知、客户邮件、帮助文档、活动说明和项目汇报。它解决的是表达取舍,不负责裁定事实,也不替你批准对外承诺。
两轮各自负责什么
先把两轮的职责分开:
- 候选轮: 根据同一份任务卡和同一组事实,生成两版完整文本。两版需要有清楚的取舍,例如一版优先让读者马上行动,另一版优先解释背景和减少顾虑。
- 评审轮: 把两版放在同一张比较表里,逐条对照预先写好的验收标准,指出哪一版更适合当前读者,以及需要修改的具体句子。
两轮可以放在同一个对话中,也可以分成两个对话。关键是第二轮必须收到第一轮的完整候选稿、原始任务卡、事实材料和同一组验收标准。第二轮的任务是比较,不能悄悄把两版重新混成第三版。
Google 的提示设计指南把复杂任务拆成独立步骤,并建议把前一步的输出作为下一步的输入;指南也把「生成后按任务检查」列为一种可用的工作方式。1
可直接复制的 Prompt
把方括号里的内容替换成你的任务。第一轮生成候选稿后,先检查两版是否真的体现了不同取舍;确认后,再把两版连同下面的「第二轮」部分交给 AI。
你是一名中文实用写作编辑。你要帮助我比较不同表达方案,最终由我决定采用哪一版。
# 本次任务
- 成稿用途:[例如:发给已经开通团队空间的管理员]
- 读者:[写明身份、已有背景和读者读完后要完成的动作]
- 体裁:[通知 / 邮件 / FAQ / 帮助说明 / 汇报]
- 期望长度:[例如:300~450 字]
- 必须出现的信息:[逐条列出]
- 语气要求:[例如:直接、克制、让读者知道下一步]
# 事实材料
只使用下面的材料。材料没有提供的日期、数字、范围、承诺、原因和操作步骤,保留为信息缺口,不要自行补写。
[粘贴已确认的事实材料]
# 验收标准
请把下面的标准当作固定检查条件,后续比较时保持不变:
1. 事实完整:必须出现的信息全部出现,日期、数字、范围和状态与材料一致。
2. 动作明确:读者能从正文中找到自己要做的动作、入口或下一步;材料没有提供的入口保留为信息缺口。
3. 取舍清楚:每一段只承担一个作用,背景、变化、读者动作和限制条件之间不互相重复。
4. 语气合适:句子直接、克制,避免空泛的保证、夸张的形容和与读者无关的套话。
5. 边界完整:不新增材料没有支持的承诺,不扩大适用范围,不把建议写成已经确定的安排。
# 第一轮:生成两个候选稿
只生成两个候选稿,不做评审,不合并两版。
候选稿 A:优先让读者快速理解变化和下一步。保留必要背景,把读者动作放在前面。
候选稿 B:优先降低读者的疑问和顾虑。补足材料已经提供的背景,但保持事实范围不变。
每个候选稿都必须包含:
- 版本定位:用一句话说明本版的主要取舍;
- 完整成稿:只使用事实材料;
- 可能的代价:用一句话说明本版相对另一版可能牺牲了什么,例如背景较少或行动入口较晚。
两版正文必须完整,不能用「同上」代替。输出完候选稿 B 后停止。
# 第二轮:独立比较候选稿
收到候选稿 A 和 B 后,只做评审,不直接重写全文。
请用 Markdown 表格逐项比较,表格包含以下列:
| 验收标准 | 候选稿 A | 候选稿 B | 判断与依据 | 最小修改建议 |
比较规则:
1. 每个判断都引用对应候选稿中的具体句子或段落作用,不用「更好」「更自然」这类没有依据的结论。
2. 先检查硬性事实、读者动作和边界,再比较语气和节奏。
3. 指出两版共同存在的问题;共同问题不能被写成某一版的优势。
4. 如果两版都没有达到某条标准,写明「两版均未达标」,并给出只改一处的建议。
5. 推荐一版,并用一段话说明推荐理由;推荐理由必须对应上面的标准。
6. 最后列出「发布前核对」清单:事实、读者动作、范围、承诺、长度各一项。
7. 评审结束后停止,不输出合并后的第三版。这条 Prompt 里最重要的部分有三处。
- 候选稿的差异写在任务里。 「写两版」没有说明两版怎么不同,模型可能只替换几个同义词。把一版的优先级写成「快速行动」,另一版写成「降低顾虑」,比较才有意义。
- 验收标准放在生成前。 你先规定什么算合格,再看候选稿。这样可以减少看完某一版后临时改变标准的情况。
- 给评审轮设置停止条件。 评审轮交付的是比较表和最小修改建议。你确认推荐后,再单独发出「只按第 2 行建议修改」的指令,修改范围会更容易控制。
用一则虚构通知走一遍
下面的材料只是演示 Prompt 的使用方式,事实均为虚构。
任务:给已经开通「团队空间」的管理员写一则通知,说明每周一上午 10:00 会进行例行维护,维护期间无法新增成员;通知控制在 180 字以内,读者需要知道维护时间和受影响的动作。
事实材料:
- 维护时间:每周一 10:00~10:30。
- 影响范围:维护期间无法新增成员。
- 其他功能:材料没有说明是否可用。
- 处理方式:材料没有提供替代入口或补偿安排。候选稿 A 可能会把读者动作放在开头:
每周一 10:00~10:30,团队空间进行例行维护。维护期间无法新增成员,请避开这段时间操作。其他功能的可用情况请以实际页面显示为准。
候选稿 B 可能会先交代背景:
为完成团队空间的例行维护,系统将在每周一 10:00~10:30 进行维护。维护期间,管理员无法新增成员。需要处理成员变更时,请提前安排操作;其他功能的可用情况请以实际页面显示为准。
两版都保留了维护时间和受影响动作。A 让读者更快看到时间与限制,B 先解释维护原因,再给出安排建议。评审轮可以得到这样的表格:
| 验收标准 | 候选稿 A | 候选稿 B | 判断与依据 | 最小修改建议 |
|---|---|---|---|---|
| 事实完整 | 达标:写明每周一 10:00~10:30,以及维护期间无法新增成员 | 达标:写明同样的时间和限制 | 两版都覆盖任务卡中的硬性事实 | 无 |
| 动作明确 | 达标:「请避开这段时间操作」直接告诉读者怎么安排 | 达标:「请提前安排操作」给出安排建议 | 两版都给出动作,A 的动作更短 | 保留 A 的动作句,或把 B 的「提前安排」改成更具体的「提前完成成员新增」;只有材料允许时才能这样改 |
| 边界完整 | 达标:把其他功能写成「以实际页面显示为准」 | 达标:同样保留信息边界 | 两版都没有替材料补写其他功能状态 | 无 |
| 语气合适 | 达标:直接,背景较少 | 达标:较完整,句子稍长 | 选择取决于通知是否需要解释维护背景 | 如果读者已经熟悉维护安排,优先 A;如果需要说明原因,保留 B 的第一句 |
这个比较过程把「我觉得哪版顺」换成了「哪一版更符合当前任务」。读者动作、事实边界和语气取舍分别有位置可查,最后的推荐也能回到具体句子。
验收标准要写成什么样
标准越接近读者能观察到的结果,评审越容易复核。可以用下面的替换方法:
- 「写得清楚」改成「读者能在前两段找到变化、影响和下一步」。
- 「语气专业」改成「每个判断都有材料依据;正文不使用夸张保证和空泛形容」。
- 「尽可能完整」改成「必须出现日期、适用对象、受影响动作和读者下一步;材料未提供的内容保留为缺口」。
- 「更像人工写的」改成「删除重复的总结句;每段只保留一个主要作用;保留具体动作和限制条件」。
Anthropic 的提示工程文档建议先定义具体、可测量、贴近用户目标的成功标准,再构建贴近真实任务分布的评估,并覆盖边界案例。2
对于中文写作,标准不一定都要变成分数。表格里的「达标 / 未达标」通常已经够用;只有当你要长期比较同一类任务时,才值得给每条标准固定等级,例如 0 代表缺失,1 代表部分满足,2 代表完整满足。评分规则一旦改动,前后的结果就失去可比性。
什么时候适合用,什么时候先停
这条流程适合以下任务:
- 一份材料已经确认,写法有两种以上合理取舍;
- 读者对象和读者动作可以写清楚;
- 你愿意在最终发布前看一次候选比较表;
- 你需要的是表达选择,而不是让模型替你决定事实。
遇到下面的情况,先换别的步骤:
- 材料之间互相矛盾。 先做「口径冲突单」,区分材料角色、待确认项和受限表述。候选稿越多,未解决的事实冲突越容易被包装成不同文风。
- 任务属于法律、医疗、财务披露或安全通知。 AI 可以帮助整理和比较表达,事实、风险和最终批准仍要由相应责任人确认。
- 任务只有一种经过批准的固定格式。 例如字段必须逐项填入系统时,生成多版正文的收益很小;直接按字段检查更省事。
- 你还没有写清读者要做什么。 评审标准缺少读者动作时,模型只能比较句子表面,无法判断哪一版更适合任务。
评审表里的「推荐」是一项可检查的建议,最终选择仍然属于写作者。模型可以指出某一版满足了更多已写出的标准,却无法替你确认团队是否愿意承担一项承诺,或者某个事实是否已经完成审批。
为什么要先生成,再比较
第一轮和第二轮承担不同工作,能把「产生表达」与「判断表达」分开。Google 的指南明确建议把复杂任务拆成更小的提示,并串联多个步骤;它还建议在生成后按用户任务检查输出。1
Anthropic 的评估指南把成功标准、测试案例和评分方式放在同一个循环里,并建议评估尽量贴近真实任务、覆盖边界情况。2 这解释了为什么 Prompt 里的验收标准要在候选稿出现前固定下来:标准是比较工具,不是看完结果后的感想。
OpenAI 的 GPT-5.2 提示指南把提示调整放在基线评估之后,并建议每次小改动后重新评估。3 对日常写作来说,完整评估套件可能过重;你可以先用一则真实短通知做小规模验证,保留任务卡、两版候选和比较表。下次遇到同类任务时,先看同一条标准是否仍然有用,再调整 Prompt。
这些指南支持的是「拆分任务、写清标准、用评估复测」的通用做法。它们不能保证两版文字一定比一版更好,也不能替你判断哪项事实可以发布。
发布前 30 秒检查
- 两版真的不同吗? 两版应有不同的优先级或组织顺序,而不是只换了几个同义词。
- 标准提前写好了吗? 评审表使用的是生成前已经确定的标准。
- 硬性事实完整吗? 日期、数字、对象、范围、状态和限制条件逐项对照原始材料。
- 读者动作明确吗? 读者能知道要做什么、何时做,或者材料明确没有提供哪项入口。
- 推荐能追溯吗? 推荐理由对应表格中的具体标准和候选句子。
- 改写范围收住了吗? 最终修改只处理评审表指出的句子;修改后再核对事实和边界。
今天可以拿一则 200~400 字的通知试一次。先让 AI 写「快速行动版」和「降低顾虑版」,再让它只输出比较表。你要看的重点不是哪一版更漂亮,而是哪一版更清楚地完成了你提前写下的任务。
References
- 1
- 2Define success criteria and build evaluations - Claude Platform Docs
docs.anthropic.com
- 3GPT-5.2 Prompting Guide
developers.openai.com
This story was produced automatically by a channel. One sentence is all it takes for Neodrop to keep producing for you.
