把 AI 用明白|经验分享 05:上次管用,不代表这次还管用

把 AI 用明白|经验分享 05:上次管用,不代表这次还管用

上个月你调好了一段提示词,每次都能把一份乱七八糟的材料整成你要的样子。

0:00 / 5:02
上个月调好的一段提示词,这周再用忽然不顺手了:格式变了,多出两段解释,还漏了一个字段。这一期讲的是怎么判断“上次管用的做法”这次还成不成立,以及怎样留一份能重跑的对照样例。

这期会听到什么

  • 两层原因:一层是你用的服务在版本号没变的情况下被改过;另一层是同一份输入本来就不总是同一份输出。
  • 留三样东西:一条真实输入、当时确认过没问题的结果、一句“什么算过”,放在同一个文件里。
  • 三个重跑时机:换模型或模型更新、自己改了提示词或步骤、隔了一段时间没用。
  • 三条边界:小样例只对大变化灵敏,样例会过期,判断类的东西没法自动打分。

为什么“上次管用”会过期

托管服务可能在版本号没有变化的情况下被持续更新,工程界把这种情况称为静默更新。一篇二〇二六年的研究指出,现有的回归测试和版本管理都没有为部署方提供应对这种不透明变化的机制。1
厂商自己也会留下记录。官方变更记录里有一次更新,本意是让回答别那么长,结果自动监控发现内容标记上升,不到一周就被撤回。2
二〇二六年二月发表的一项同行评审研究,用一套固定的题目每周评一轮、连评十周,同时观察三个模型:一个十周里都稳定,一个逐步变好,一个在第六周前后明显退化。作者明确写明这是观察性研究,能测到行为变了和什么时候变的,测不出原因。3
就算两边都没被改,同一份输入也不总是同一份输出。一个工程团队在自己搭建的服务上把温度设为零,同一句话跑一千次,得到八十种不同的答案,而且分叉发生在很靠后的位置:前面一百多个词完全一样。4
所以用单次输出判断一个做法好坏并不可靠。官方的一份评估指南给了一个很直接的算术:单次成功率百分之七十五,连跑三次全过的概率只有百分之四十二,因此一条样例建议跑三遍看几次通过。这份指南还建议,二十到五十条来自真实失败的例子就是很好的起点。5

什么时候重跑

换模型或模型更新是第一时机。官方文档写明,短周期模型在替代品发布之后只保留四十五天的过渡期。6 服务端的数值配置一年里也可能更新几次,所以隔一段时间没用过的做法同样值得重跑。7
重跑时看的是和上次的差异,不是分数:格式、长度、漏掉的字段、语气,差异里藏着这次到底变了什么。

三条边界

小样例只对大变化灵敏。二三十条样例看得出明显变坏,掉几个百分点的小退化看不出来,要稳定发现那种变化,题量得往上走很多。
样例本身会过期。一份对十五个开源项目的研究发现,百分之四十一被禁用的测试之后再也没有被放回来,所以重跑时值得顺手问一句:这条判据今天还成立吗。8
判断类的东西没法自动打分。把打分交给模型时,它的判断会随位置改变,连表现最好的模型裁判换个位置也有四成的情况下会改判,所以模型适合用来初筛,最后的结论仍要自己看。9
另外值得记住的是:调好的那一版可能只是碰对了当时的措辞。有研究测过,同一个任务只把示例的排版换一下,在其中一个开源模型上准确率最多差了七十六个百分点。10

今天就试一次

  1. 挑一个你每周都要做、而且本来就会顺手看一眼结果的 AI 任务。
  2. 从这周的结果里留一条:把它用的输入、你确认过没问题的输出、还有那句“什么算过”,存在同一个文件里。
  3. “什么算过”写成能判断的句子,例如字段齐不齐、明细之和是不是等于总额。
  4. 下次换模型或者改提示词时,拿这条样例跑三遍,看三次里过了几次,以及和上次差在哪里。
  5. 顺手检查这条判据今天还成立吗。
它只保证一件事:如果这一条明显变差,你手上就有证据;如果它没有变,也不代表整套流程没变。

This story was produced automatically by a channel. One sentence is all it takes for Neodrop to keep producing for you.

Related content