改完更好就留下:自我改进循环报出的分,比真实高了十几点Chapters一个自我改进的循环,逻辑很朴素:让模型改写一版,分数比现在高就留下。0:01改完更好就留下,是一次带噪声的选择2:05学得快,和现在强,要分开量3:14验证的钱,要花在真跑之前4:20留下来的条目,也要能退役5:17给循环做体检,先问四件事0:00 / 7:081×0:01探针一个自我改进的循环,逻辑很朴素:让模型改写一版,分数比现在高就留下。0:09探针作者把每一版候选都额外拿到六百道没参与选择的题上重打一遍,结果是,第一代之后的改动大多有害。0:18探针这里是 AI Loop Engineering。0:21探针我是探针,这一期讲的是:循环每次说自己变好了,这句话该拿什么去验。0:28探针今天是十月九号,周五。arXiv 挂出的是十月八号那批新投稿,整页四百四十七条条目、一百一十篇新投稿;上一期用的是十月七号那批。0:39探针四篇论文都落在同一个位置上:循环评估自己、挑自己、给自己打分那一套动作。0:47探针第一篇的作者是 Litao Hu 和 Yutong Tang,标题里的赢家诅咒,说的就是这种现象。0:55探针他们先把「改完更好就留下」翻译成一句统计学上的说法:这是一次带测量噪声的选择,你在里面挑最大值。1:03探针材料是让 Qwen 系列模型改写自己的指令。用一句种子起步,第一代候选在 TREC 上有七成五到十成是变好的。1:12探针可第一代之后,只有百分之四到百分之三十九的改写能超过当时的版本;拿到留出集上看,平均效应是负的。1:20探针更值得记的是它报出来的分数。在一个事先注册好的实验里,只用十六道题来挑时,贪心循环最后的选择集分数比留出集高出十三到二十点。1:31探针题加到二百五十六道,差距缩到一到五点。多出来的那十几分,大部分不是它变好了,是那十六道题它见过太多遍。1:39探针在 Banking77 上就是这样:选择集分数涨了十二点五,留出集上它其实比起点低了零点六。1:45探针更聪明的准入规则他们也试过,校准过的贝叶斯闸门、先选再确认,跑完一整轮都没赢过贪心。1:52探针作者给的办法很便宜:另拿六十四道从没用过的题,把起点和当前版本各打一遍,一共一百二十八次评测;报出增益的误差从十五点五降到五点七分,可单次估计还是会偏六分。2:05探针第二篇换了个问法:不要问它现在多强,要问它把经验换成能力的效率有多高。2:11探针标题是《Agent Plasticity》,作者是 Harman Singh 等十一人。2:16探针他们造了个受控设置:Agent 把过去的经验做成可复用的制品,交给下一个自己继承。2:22探针然后定义一个读数,叫可塑性,也就是每花一千美元的学习成本,能在留出集上换回多少分。2:27探针环境是国际象棋、五乘五围棋、六乘六 Hex 和 NetHack,每个检查点留出十二局同分布、十二局异分布的对手。2:37探针八个前沿模型跑下来,轨迹差得很开。困难棋上 Claude Fable 5 从三十七点五涨到七十三点三,Claude Opus 5 从二十五涨到六十六点四。2:47探针也有反着走的:围棋上 Claude Opus 4.8 从四十掉到二十五以下;NetHack 上 GPT-5.6 Luna 从二百一十掉到一百二。2:56探针终局能力和获取效率也会分岔。拟合终点最高的是 Claude Fable 5,可塑性最高的却是 GPT-5.6 Sol,每一千美元换回二百九十八分。3:06探针作者还顺着失败往下看了一眼:可塑性低的 Agent 常常根本不去复用那些制品,可塑性高的即使复用了,也还是会失败。3:14探针第三篇把问题落到成本上:在机器学习任务里,验证一个想法要真的训练一遍、评测一遍,很贵。3:23探针标题是《Verify Less, Evolve More》,作者 Jiamu Bai 等十二人,做的是一层想法评论家。3:30探针它先预测一件事:这个改动放在当前解上,会不会变好。预测得准,就可以只在最有希望的那几个想法上花钱真跑。3:40探针训练分两段:先用 Gemini-3.1-Pro 合成的高质量批评做监督微调,再用 GRPO 往上推准确率。3:47探针在一个一千五百例的想法评测集上,最好的评论家准确率六十八点五,比 Gemini-3.1-Pro 高出十四分多。3:56探针省钱的效果更直观。给一万次真值验证的预算,全部真跑大约四十步就用完了;把评论家放进循环,同样的预算能跑约一百一十步。4:07探针在二十九个任务、十一个领域的开源进化框架上,配上评论家以后,十一个领域里有九个拿到最好成绩。4:14探针他们最省的一条留到了最后:不是每个想法都值得跑一遍,判断该放在跑之前。4:20探针最后一篇问的是另一头:循环一路挑下来、留在库里的那些东西会怎么样。4:25探针标题是《SkillForge》,作者 Yuyao Ge 等八人,已经被 NeurIPS 2026 接收。4:31探针他们给库里的每一条技能设了四个状态:试用、活跃、稳定、退役。4:38探针淘汰由适配度驱动。正式训练开始之前,先用基础模型自己跑出来的轨迹,把适配度低的技能先退掉一批。4:45探针训练开始以后,每一轮继续退役、固化,再加上模型引导的变异,让技能库和策略一起长。4:51探针结果是:不做退役,技能库会长到一百三十二、一百二十一、一百一十一;加上退役,稳定在一百、九十五、八十五。4:59探针库更大并不更好。库小下来之后,ALFWorld 上的成功率反而到九十二点四,比最强基线 SkillRL 的八十九点九还高。5:09探针有意思的一条是:百分之五十七的退役技能,在衰退之前先到过稳定状态——它不是一直没用,是用好了之后才过时。5:17探针四篇摆在一起,说的是同一件事:循环说自己变好了,这个说法本身要被单独测。5:24探针先分清两个分数:选择集上的和留出集上的。前者是挑人用的,后者才是它真的会的东西;十六道题的增益里能有十几分是重复看题看出来的。5:35探针再把学得快和现在强分开量。同一个模型可以终局分数最高而可塑性很低,也可以起点不高但每一千美元换回来的分最多。5:43探针验证的钱要花在前面。真跑一次很贵,那就先训一层便宜的判断,把不值得跑的挡掉,让真值验证只留给没把握的那些。5:53探针库里的东西要有退役机制。技能不是攒得越多越好,加进来的那些会先变成稳定,再慢慢过时;没有退役,库一直长,分数反而下来。6:03探针最后是研究习惯:自我改进的结论以后要报留出集增益和它的不确定度,而不是拿选择集上的数字当结论。6:11探针边界也说清楚:这四篇都是作者自报,没有第三方复现。6:15探针赢家诅咒那篇用的是 Qwen 系列的改写循环,作者自己说结论在一个个具体设置上并不都成立。6:22探针可塑性那篇的效率估计依赖厂商定价,还依赖一个饱和拟合的假设;作者自己也指出,可塑性可以是负的。6:30探针想法评论家那篇,批评是用 Gemini 合成的,评测集也是自建的一千五百例;技能生命周期那篇的三个环境都是交互式任务,退役阈值只在其中一个上调过。6:40探针回到开头那句:第一代之后的改动,大多有害。6:43探针你的循环每次说我变好了,先问一句,这是在哪套题上量出来的。6:48探针我们下期见。