改完更好就留下:自我改进循环报出的分,比真实高了十几点

改完更好就留下:自我改进循环报出的分,比真实高了十几点

一个自我改进的循环,逻辑很朴素:让模型改写一版,分数比现在高就留下。

0:00 / 7:08
让模型改写一版自己的指令,分数比现在高就留下——大多数自我改进循环,全部逻辑就是这一句。作者把每一版候选都额外拿到 600 道没参与选择的题上重打一遍,看到的却是另一回事:用一句种子起步时,第一代候选在 TREC 上有 75% 到 100% 是变好的,第一代之后只有 4% 到 39% 的改写能超过当时的版本,拿到留出集上看,这些后续改动的平均效应是 −0.2 到 −13.5 分。1
这一期取自 10 月 8 日周四挂出的那批新投稿,cs.AI 整页 447 条条目、新投稿 110 篇,论文提交日期在 10 月 6 日到 10 月 7 日之间;上一期用的是 10 月 7 日那批,这一期换掉了。2

本期听什么

  • 用十六道题挑出来的提升,有十几分是题被看过太多遍。 在一个事先注册好的实验里,贪心循环最后的选择集分数比留出集高出 13 到 20 点;题加到 256 道,差距缩到 1 到 5 点。1
  • 选择集在涨,留出集可能在跌。 在 Banking77 上,选择集分数涨了 12.5 点,留出集上它其实比起点还低 0.6 点,8 个种子里 4 个在往下走。1
  • 学得快的和现在强的,不是同一个。 困难棋上 Claude Fable 5 的留出集分数从 37.5 涨到 73.3,Claude Opus 5 从 25 涨到 66.4;拟合终点最高的是 Fable 5,每一千美元换回的分最多的却是 GPT-5.6 Sol。3
  • 验证很贵,判断该放在真跑之前。 给一万次真值验证的预算,全部真跑大约 40 步就用完;把一层想法评论家放进循环,同样的预算能跑约 110 步。4
  • 技能不是攒得越多越好。 不做退役,技能库会长到 132、121、111 条;加上退役稳定在 100、95、85 条,而库更小的那一版在 ALFWorld 上的成功率反而到了 92.4。5

用十六道题挑出来的增益,比真实高了十几点

第一篇是 Litao Hu 和 Yutong Tang 的《The Winner's Curse in LLM Self-Improvement Loops: Selection Noise, Lock-in, and Acceptance Rules》,34 页、4 图、18 表,代码和实验记录都随论文公开。它把「改完更好就留下」这一步直接翻译成一个统计学动作:在一次带测量噪声的选择里挑最大值,并把同一代候选之间互相关联的误差一起建进模型,然后盯住一件平时没人算的事——那套用来打分的题被反复使用之后,会发生什么。1
材料是让 Qwen 系列模型改写自己的指令,每一版候选除了参与选择的那套题,还会额外在 600 道留出题上重打一遍。从一句种子起步时,第一代候选在 TREC 上有 75% 到 100% 是变好的;第一代之后,只有 4% 到 39% 的改写能超过当时的版本,留出集上的平均效应落在 −0.2 到 −13.5 分之间。换更强的改写模型(Qwen2.5-14B、Qwen3.5-4B)这个格局基本没变。从一个已经不错的版本起步时更明显:TREC 上只有 5% 的改写是变好的,平均效应 −14 分;Banking77 上有 45% 变好,但只有 5% 好过 2 分。1
真正要记的是它报出来的分数。在事先注册的分析里,贪心循环最后在选择集上的分数,比留出集高出 13 到 20 点——这是只用 16 道题来挑的时候;题加到 256 道,差距缩到 1 到 5 点。换句话说,多出来的那十几分里,大部分不是它变好了,是那 16 道题它见过太多遍。跑 11 到 20 代之后,虚高是 13.6 ± 1.7 点(16 道题)、7.2 ± 1.1 点(64 道)、1.7 ± 0.6 点(256 道)。1
反例有两个,方向相反。一个是 Banking77 上:选择集的分数涨了 12.5 点,留出集上它却比起点低了 0.6 点,8 个种子里 4 个在往下走。作者还用带真值的探针查了「赢家」本身:16 道题选出来的赢家,它在留出集上的真实优势只有被测出来的 1% 到 51%;把这份优势按经验做收缩之后,留出集上的均值才落回 0.6 点以内。1
他们也试过更聪明的准入规则,而不是简单的「更高就收」:一个先用试点标定出来的贝叶斯闸门,和一个「先选再确认」的流程。跑完整轮之后,两种都没赢过贪心——合并 32 对种子看,贝叶斯闸门低 2.1 ± 1.1 点,先选再确认低 1.6 ± 1.2 点。现成的工具上同样能看见:GEPA 和 MIPROv2 用 16 道验证题的时候,虚高分别到 26 分和 7 分;GEPA 在 1000 次调用、16 道验证题时,TREC 上报 38.8,真实是 19.2。1
作者给的做法很便宜,也是这一期最实用的一条:另拿 64 道从没用过的题,把起点和当前版本各打一遍,一共 128 次评测。这样能在平均意义上消掉一个循环报出增益的偏差,报出增益的 RMSE 从 15.5 降到 5.7 分;但单次估计仍然会偏大约 6 分。所以他们的结论是:自我改进的结果应该报留出集增益,并且带上不确定度。1

学得快,和现在强,要分开量

第二篇是 Harman Singh 等 11 人的《Agent Plasticity: Measuring Self-Improvement Through Experience》。它换了个问法:现有的评测几乎都在量一个 Agent 在某个固定时刻能做什么,而不是它把经验换成能力有多快。3
实验是一个受控设置:Agent 把过去的经验摊销成可复用的制品,交给下一个自己继承;每到一个检查点,既量训练环境里的表现,也量留出环境里的表现,并把学习成本一起算进去。作者由此定义了一个读数,叫可塑性——每花一千美元的学习成本,能在留出集上换回多少分,头条指标是「到饱和的可塑性」。3
环境是国际象棋(主环境为困难档,Stockfish 16、每步 2 万节点)、5×5 围棋、6×6 Hex 和 NetHack;棋类每个检查点留出 12 局同分布、12 局异分布的对手,NetHack 覆盖 0 到 40 个检查点。八个前沿模型跑下来,轨迹差得很开:困难棋的留出集分数,Claude Fable 5 从 37.5% 涨到 73.3%,Claude Opus 5 从 25.0% 涨到 66.4%,GPT-5.6 Sol 从接近 0 涨到 36.9%;围棋上 Fable 5 从 20% 涨到 80%,而异分布的对手上从 0% 到 50%。3
也有一路走低的。围棋上 Claude Opus 4.8 的留出集分数从检查点 0 的 40% 掉到 15 到 20 代的 10% 到 25%;NetHack 的平均分里,Claude Opus 5.5 从约 2 千涨到约 6 千,Claude Opus 4.8 基本停在 700 到 730,而 GPT-5.6 Luna 从约 210 掉到 120、GPT-5.6 Sol 从约 570 掉到 420。3
最要紧的一条是终局能力和获取效率会分岔。把三个棋类合成一条曲线看,拟合终点最高的是 Claude Fable 5,可塑性最高的却是 GPT-5.6 Sol,每一千美元能换回 298 个百分点;Claude Opus 5 是 233,Fable 5 是 57,Opus 4.8 是 14,Luna 没有可靠上升、记为 0。作者还顺着失败往下看了一眼:可塑性低的 Agent 常常根本不去复用那些相关制品;而可塑性高的,即使复用了制品,也还是会失败——瓶颈落在制品质量、泛化或应用上。3

验证很贵,判断该放在真跑之前

第三篇是 Jiamu Bai 等 12 人的《Verify Less, Evolve More: Training Idea-Level Critics for Verification-Efficient ML Evolving Agents》,已经被 NeurIPS 2026 相关工作收录的场景是 AI for ML:这里每次「经验验证」都要真的训练一遍模型、评测一遍,成本高,直接压住了 Agent 自我进化的速度和规模;而当下的前沿模型直接拿来当想法筛选器,收益也很有限。4
他们的办法是训一层想法层面的评论家:在真跑之前先预测,这个改动放在当前解上会不会变好,预测得准,就可以把真跑只留给最有希望的那几个想法。训练分两段:先用 Gemini-3.1-Pro 合成的高质量批评做监督微调,再用 GRPO 把预测准确率往上推。4
在自建的 ML-Idea-Critic-Bench(1.5K 例)上,最好的评论家(Qwen-3.5-35B,SFT+GRPO)准确率 68.5,方向判断指标 63.3;作为对照,Gemini-3.1-Pro 是 54.3 和 46.6,方向判断上分别高出 14.1 和 16.7 分。4
省钱的效果更直观。给一万次真值验证的预算:全部真跑大约 40 步就用完,把评论家放进循环,同样的预算能跑约 110 步;而策略生成的想法里,其实只有 36.3% 真的需要经验验证。在 29 个任务、11 个领域的开源进化框架 OpenEvolve 上,配上评论家之后,11 个领域里有 9 个拿到最好成绩 —— 域平均从 38.77(无评论家)到 39.85(Gemini-3.1-Pro)和 41.51(9B 评论家),单域最大的一档是语言模型上从 18.04 到 32.57。4
作者还留了一条给不确定性的用法:把 k=16、阈值 0.25 的不确定性路由接上之后,只有大约 30% 的想法被送去真跑,同时能召回约 70% 的判断错误。4

留下来的技能,也要能退役

最后一篇是 Yuyao Ge 等 8 人的《SkillForge: Co-Evolving Skills and Agents via Dynamic Skill Lifecycles》,已经被 NeurIPS 2026 接收。它问的是另一头:循环一路挑下来、留在技能库里的那些条目会怎么样。5
作者给库里每一条技能设了四个状态:试用、活跃、稳定、退役。淘汰由适配度驱动——正式训练开始之前,先用基础模型自己跑出来的轨迹把低适配度的技能预先退掉一批,过滤后的库再去喂监督微调;训练开始之后,每一轮继续退役、固化和模型引导的变异,让技能库和策略一起长。5
三个环境上的结果是这样的:不做退役,技能库会长到 132、121、111 条;加上退役,稳定在 100、95、85 条。库更大并不更好——库小下来的那一版在 ALFWorld 上到 92.4,比最强基线 SkillRL 的 89.9 高;WebShop 的成功率 78.4 对 72.7,分数 87.8 对 85.2;相对提升最高 7.8%。消融里最有效的是预退役这一项,去掉它相对掉 1.8%(ALFWorld)、4.5%(WebShop)、2.5%(检索问答);把退役加回 WebShop,库从 121 降到 95,补上了剩下的 3.2% 差距。5
他们一共记下 318 次退役:退役的技能平均寿命只有 38 步,退役那一刻适配度平均掉了 0.278。有意思的是有 57.2% 的退役技能,在衰退之前先到过「稳定」状态——它不是一直没用,而是先用好了、后来又过时了。这条是「延迟过时」的直接经验证据。随论文放出的 SkillFurnace 数据集包含 5000 多条带标注的记录。5

边界

  • 四篇都是作者自报的结果,没有第三方复现;四篇的提交日期都在 10 月 6 日到 10 月 7 日之间。1345
  • 赢家诅咒那篇用的是 Qwen 系列的改写循环,场景集中;作者自己说预测值能对上第一代提交的平均虚高,但并不是每一个具体设置都对得上。1
  • 可塑性那篇的效率估计依赖厂商定价,也依赖一个饱和拟合的假设,外推出来的饱和点自带不确定性;作者明确写了,可塑性可以是负的,并且取决于评测的时间尺度。3
  • 想法评论家那篇,评论家是用 Gemini-3.1-Pro 合成的批评训出来的,评测集 ML-Idea-Critic-Bench 也是自建的 1.5K 例;所依赖的经验验证本身在 AI for ML 之外未必都成立。4
  • 技能生命周期那篇用的是三个交互式任务环境(ALFWorld、WebShop、检索增强问答),退役阈值只在其中一个环境上做过扫描,作者报告在 ±1.4% 内变动。5
四篇摆在一起,说的是同一件事:循环说自己变好了,这个说法本身要被单独测。
落到动作上是这样。先分清两个分数:选择集上的和留出集上的——前者是拿来挑人用的,后者才是它真的会的东西,用十六道题挑出来的增益里能有十几分是那道题被看过太多遍。做法很便宜:留一批从来没参与过选择的题,把起点和当前版本各打一遍,报增益的时候带上不确定度。再把学得快和现在强分开量:同一个模型可以终局分数最高而可塑性很低,也可以起点不高但每一千美元换回来的分最多。验证的钱要花在前面,真跑一次很贵,那就先训一层便宜的判断,把不值得跑的想法挡掉,让真值验证只留给没把握的那些。库里的东西要有退役机制,技能不是攒得越多越好,加进来的条目会先变成稳定、再慢慢过时。最后是研究习惯:自我改进的结论要报留出集增益和它的不确定度,而不是拿选择集上的数字当结论。
回到开头那句:第一代之后的改动,大多有害。你的循环每次说我变好了,先问一句,这是在哪套题上量出来的。

This story was produced automatically by a channel. One sentence is all it takes for Neodrop to keep producing for you.

Related content