
AI agent 写完实证论文后,研究者要守住哪两道门?
Scott Cunningham 将 AI agent 的研究能力拆成生产、验证与理解三道门,解释为什么论文可以自动生成,研究者仍需亲自掌握现实处理机制与识别设计。
原文定位
经济学家 Scott Cunningham 在 2026 年 8 月 14 日发表的 《Which stages of research production should we let AI Agents loose》,从一个容易被演示视频掩盖的差别出发:AI agent 可以在约 30 分钟内生成一篇带数据、代码、表格、图形和参考文献的实证论文,论文外观完整,研究过程却未必可信。Cunningham 追问的重点是,哪些环节可以交给 agent,哪些环节必须由研究者自己掌握。1
一篇完整论文不等于一项可信研究
Cunningham 把研究拆成三个独立部分:
production 是产出论文、代码、表格和图形;verification 是确认实际做过的步骤符合预先设定的研究目标,也确认没有做不该做的事情;understanding 是研究者知道任务由谁完成、过程做了什么、结果意味着什么。三者不是一条自动传递的流水线:生产环节已经能被 agent 大幅接管,验证与理解却不能从一份完整成品中自动推出。1原文提到 Social Catalyst Lab 的自主项目评估实验:人负责提示,agent 自主选择并完成研究,生成了约 1,000 篇使用双重差分、工具变量等方法的实证论文。这个结果足以说明,agent 自主生产实证研究已经是可观察的能力。它只证明了生产门可以打开,不能证明这些论文的研究目标、处理机制和识别设计都经过可靠审查。1

production、verification 和 understanding 分开;论文成品位于三者交汇处,不能替代其中任何一道检查。1验证不是把代码重跑一遍
用另一种语言复现代码、确认图表由本地代码生成,属于验证的必要条件,却不足以证明结论可靠。验证必须先有一个事先设定的目标估计量,再检查研究者实际做了什么,以及哪些事情本来不应该发生。前一类行为有代码和文件可以追踪;后一类是「没有做某件事」,缺少一个可供 agent 直接检查的对象。Cunningham 的实验观察到,agent 会因为研究上下文中的真实陈述而自行选择模型设定。研究者若只复跑程序,可能确认了「程序确实按现在的写法运行」,却没有确认「现在的写法就是问题要求的写法」。1
理解是第三道门。Cunningham 用企业 CEO 作比喻:CEO 不需要亲自写代码,却必须大致知道每项任务由谁完成、完成了什么、发现了什么。研究者把论文交给 agent 生成,也必须对研究问题、关键判断和结果含义保有这种整体把握。论文足够完整,不能自动证明作者理解了论文如何成立。1
harness 把判断变成一张清单
Cunningham 从 4 月起制作一套双重差分的
harness。它起初是一张清单,计划逐步做成范围很窄的软件工具。设计思路来自 Atul Gawande 的《清单革命》:高风险工作中,专家因为快速思考,反而容易跳过关键步骤;清单的作用是强制研究依次经过生产、验证和理解,而不是把所有判断压缩成一次模型调用。作者把工具限定在双重差分,目的是让每个检查点都容易评估和改进;他认为这套做法可能延伸到合成控制等因果推断项目,但没有把这种延伸写成已经证实的通用方案。1作者把
harness 做成视觉工具,部分原因是自己的心盲经验:他更依赖图形、流程和反复走过的路径来建立理解。这个细节解释了工具的形状,却没有被作者当成关于学习方式的普遍证据。1最难自动化的是 bite
在双重差分清单中,Cunningham 最不愿意完全自动化的环节叫
bite。它要求研究者先把干预在现实中碰到了谁、在哪里、什么时候,以及受影响者如何反应,尽可能描述清楚。这一步帮助研究者理解处理机制,也帮助研究者选择可信的处理组和比较组,决定识别设计能否成立。agent 可以画地图、下载数据、写代码、生成时间序列图和整理文稿,却不能用这些产出替代对现实处理机制的追踪。Cunningham 用两个反例说明这一点:如果没有人购买枪支,枪支法如何导致死亡变化;如果最低工资在任何地方都没有约束力,提高最低工资如何减少就业。研究者必须先确认干预确实发生、发生在谁身上,以及变化通过什么路径出现。表格做得准确,不能补上这段现实调查。1
自动化的边界落在知识责任上
Cunningham 的实际主张很窄:把数据下载、代码、图表、表格、文稿和演示文稿的生产做成可复用的工具,也把围绕这些产出的准确性检查接入流程;研究者则保留研究问题、现实中的
bite、处理机制、比较对象、识别设计,以及对结论的理解。文章没有声称 agent 永远不能承担更多验证工作,作者只说,在当前实验中,研究者不应独家依赖 agent 来验证自己的研究。因此,自动化边界不由「模型能不能写出论文」决定,而由「哪些错误可以从留下的产物中被检查出来」决定。能被文件、代码和图表明确记录的重复劳动适合交给 agent;没有被记录的遗漏、现实中的处理机制和研究者对结果的理解,仍需要人承担。Cunningham 计划继续公开
harness 的具体 hooks,并把一部新的因果推断教材逐步上线;这些是后续工作,不是本篇已经完成的软件。1References
- 1Which stages of research production should we let AI Agents loose
causalinf.substack.com
This story was produced automatically by a channel. One sentence is all it takes for Neodrop to keep producing for you.
Related content
More from this channel›
- Brian Potter:固态电池想省掉的,是锂电池的材料骨架
- Abraham Thomas:金融行业的 AI 失灵,常常从数据质量开始
- Henry Farrell:自愿使用 Amazon,仍不足以解释科技市场的权力
- 开放权重改变的不是 AI 投资总量,而是价值的流向
- AI 会像工业化一样扩散吗?Arpit Gupta 解释组织摩擦、任务链与生产率落差
- Zuckerberg 说「把超级智能交给所有人」更安全,Casey Newton 认为问题在控制
- 技术炒作为何反复奏效:Max Haiven 如何解释「共同造世界」被资本利用
- AI 浪潮为何先伤到重资产公司:James Investment 如何拆解 2026 年 7 月的市场轮动
