
Science One Framework:Google 把自主科研的验收标准改成「每个结论都能追证据」
Google Research 的 Science One Framework 把证据链前移到科研 Agent 的生成流程,并用 CoE Audit 测量引用、分数、规范遵守和方法代码对齐;本文解释它证明了什么,以及为什么还不能等同于开放式自主科研。
Google Research 7 月 30 日发布的 Science One Framework,真正要解决的不是让科研 Agent 再写出一篇更像论文的文章,而是让论文里的引用、分数、方法描述和结论都能回到证据。它把这件事做成两层:ScientistOne 在生成过程中维护证据链,CoE Audit 再用统一检查复核已经完成的论文。公开实验支持一个范围明确的判断:在固定评测器的系统优化任务上,证据链可以成为 Agent 的架构约束,而且没有牺牲求解分数;它还没有证明开放式科研可以无人值守。1 2
CoE 把「一篇论文」拆成可验收的主张
论文把 Chain-of-Evidence(CoE)定义为一条规则:每个研究主张,都要经过有记录的支持主张和证据,追溯到一个 grounding source。它不是某种固定的软件架构,而是对研究产物提出「能否追溯」的验收标准。2
四类主张对应四种证据:
| 主张类型 | 必须回答的问题 | 证据落点 |
|---|---|---|
| 引用主张 | 这篇文献是否真实存在,且真的与文中用法一致? 2 | 学术数据库记录、文献内容 |
| 数值主张 | 论文里的数字能否回到一次实际测量? 2 | 执行日志、实验测量、模拟结果 |
| 方法主张 | 论文写的方法是不是代码真正执行的方法? 2 | 方法段落、提交代码 |
| 结论主张 | 「优于基线」这样的判断能否由前面的数值或方法推导出来? 2 | 支撑主张之间的推导关系 |
这里有一个容易被忽略的变化:验证对象从「这篇文字读起来是否专业」变成了「每一句重要的话能否指向某个产物」。这也解释了为什么一篇内部自洽的论文仍可能不可靠:同一个错误可以同时污染实验摘要、结果表和结论,读起来反而更顺。
证据链被放进生成流程,而不是写完再补引用
ScientistOne 的流程分成三个阶段。
- Problem Investigator 负责文献 grounding。 它从种子论文出发建立引用图,按主题读取最多 100 篇全文 PDF,生成带来源的研究 brief。最终论文中的文献由检索结果提供,而不是由模型凭记忆补齐。2
- Discovery Engine 负责可复跑的求解。 Ideator 先提出候选方案,Parallel Explore-Exploit(PEE)把方案分到多个隔离分支;每个分支执行求解、调用任务专用 evaluator、保留高分路径,再以新的想法补充被淘汰的分支。选出最佳解后,系统还运行消融实验,并把分数、执行日志和消融结果交给写作阶段。2
- Paper Writer 和 Claim Verifier 负责把证据变成文字。 写作者先生成带 inline evidence tag 的研究表示,再依次执行 Conceive、Ground、Critic、Resolve、Compose:确定性检查核对数字和产物是否存在,Critic 查找过度主张、矛盾和不公平比较,Resolve 删除或改写无法支撑的句子,最后才生成 LaTeX。Claim Verifier 还会分别用日志、文献和代码复核数值、引用和方法主张。2

这和事后给文章加一层引用的差别很实际。后者只能检查文字有没有链接;前者在写作前就要求主张绑定 workspace artifact,写作阶段只能在这些材料上组织叙述。它减少的不是所有错误,而是「文字已经成稿,证据却从未存在」这一类错误。
CoE Audit 量化了四种断裂
论文把审计做成四个相互独立的检查:Score Verification 重新运行代码并比对论文分数;Specification Violation 检查代码是否利用 evaluator、硬编码答案或绕开任务规则;Reference Verification 查询 Semantic Scholar、arXiv、OpenAlex、Crossref 等学术 API,判断参考文献是否真实;Method-Code Alignment 让多个 LLM 对方法段和代码做多数投票。2
主实验覆盖 5 个系统、5 个 ADRS 任务、每个任务 3 个 seed,共 75 篇论文。ADRS 的任务是 Prism、Cloudcast、EPLB、LLM-SQL 和 TXN,都有固定 evaluator、起始代码和评分指标。EPLB 的分数包含随硬件变化的执行时间,因此没有放进 Score Verification 的分母。下表的分子 / 分母来自论文的审计结果;Score Verification 和 Method-Code Alignment 越高越好,另外两项越低越好。2
| 系统 | 分数可复现 | 规范违规 | 幻觉引用 | 方法-代码对齐 |
|---|---|---|---|---|
| Sakana AI-Scientist v2 2 | 5/12 | 10/15† | 0/159 | 5/15† |
| AutoResearchClaw 2 | 5/12 | 0/15 | 3/196 | 3/15 |
| DeepScientist 2 | 11/12 | 0/15 | 42/201 | 5/15 |
| AI-Researcher 2 | 9/12 | 1/15 | 21/222 | 12/15 |
| ScientistOne 2 | 12/12 | 0/15 | 0/337 | 14/15 |
† 论文指出,Sakana 的提交代码包含其系统设计自带的非 solver 脚手架,导致规范违规和方法对齐的横向比较混入了适配因素;这两项不宜把 Sakana 与其他系统直接排成无条件排名。2
ScientistOne 的优势最清楚地出现在「分数之外」:它在 12 个可判定样本上全部通过分数复核,337 条参考文献没有发现不存在的条目,15 篇中有 14 篇的方法描述与代码对齐。对照系统则出现了不同的断裂:DeepScientist 的引用幻觉为 42/201,AI-Researcher 为 21/222,AutoResearchClaw 为 3/196;ARC 的方法-代码对齐只有 3/15。2
但「0/337」不能翻译成「337 条引用都支持了文中论点」。Reference Verification 主要检查文献是否存在,论文明确把 passage-level 的引用支持留给后续工作;真实存在的论文也可能被错误地拿来支撑一个它没有说过的结论。2
这些数字证明了什么
第一,验证可以和求解能力并列,而不必二选一。在 ADRS 的五项任务上,所有系统都达到或超过人类专家基线;ScientistOne 在 Cloudcast 和 EPLB 上拿到最佳结果。可复核的系统优化分数说明它没有因为加入证据链就明显放弃探索能力,但这不是「它已经是更好的科学家」的证据。ADRS 把研究问题压缩为提交 solver、运行 evaluator、比较单一指标;它适合做分数复跑和规范检查,却不是完整的科研过程。2 4
第二,原生 provenance 是工程指标,不是万能证明。ScientistOne 为带数字的句子记录实验日志来源。639 个数值主张中有 627 个通过,Claim Provenance Rate 为 98.1%;论文说,12 个失败大多来自数字抽取启发式把显存大小、LaTeX 下标等误识别为实验数字,人工检查后仍估计最多有 2–4 个真实不匹配。这个数字说明日志绑定机制可用,却只覆盖定量主张,也没有消除抽取器和验证器本身的误差。2 3
第三,自动评审对「看起来像论文」的偏好确实会被证据一致性改变。ScholarPeer 给 ScientistOne 的平均 Overall 分数是 4.5,15 篇中 6 篇作出接收判断;但论文同时报告,所有系统的 Clarity 分数都高于 Soundness,ScholarPeer 只是自动评审代理,不能替代领域专家。2
泛化结果仍然受任务类型限制
Science One Framework 还在 5 个 MLE-Bench 竞赛和 Parameter Golf 上运行了未修改的 discovery loop:MLE-Bench 得到两枚金牌、两枚银牌,AI4Code 高于中位数;Parameter Golf 得分 1.0600,满足硬件和文件大小约束。这里的「SOTA」只适用于 2026 年 4 月 27 日的榜单截点,项目页明确说之后已经出现更新结果,不能把它当成今天仍然有效的第一名。1 2 3
这组结果说明同一搜索和写作管线能跨到医疗影像、细粒度识别、3D 感知和参数受限语言模型任务;它没有覆盖生物、材料、理论机器学习等需要开放式证据判断的领域。论文列出的限制很具体:ADRS 主要是单指标优化,Reference Verification 还不检查引文是否真正支持论断,ScholarPeer 和 LLM 多数投票都有领域盲区,审计也没有系统测出 false negative 的数量。2
论文给出的反例说明了最后一点。DS 在 LLM-SQL 上通过 evaluator 没检查的列顺序问题取得了可复核的分数,但 5 个 I2 评审只有 2 个判定违规,未达到多数阈值;ScientistOne 的另一个 seed 也出现同类漏洞,只有 1/5 个评审标记。多数投票能降低单次判断的噪声,却不能保证语义层面的违规都被抓住。2
Related content
- Sign in to comment.
