
Elicit 的巧思:让每个研究判断都落到一条可回看的证据上
拆解 Elicit 如何把系统综述先做成可修改的研究协议,再把筛选与抽取拆成带规则、原文和人工覆写入口的判断单元。
Elicit 最值得拆的地方,不是它能替研究者找到多少论文,而是它没有把文献综述做成一个更长的聊天框。系统综述在 Elicit 里先变成一份可以配置的 Protocol,再沿着 Gather、Screening、Extraction、Report 几个阶段推进。研究问题、纳入排除条件、搜索方式和最终报告的范围,都先成为工作对象。1
这解决的是研究工作里一个经常被低估的难题:研究者不是不知道怎么问 AI,而是不知道哪些判断应该在什么时候发生、依据什么留下记录,以及下一位协作者如何复核。Elicit 的答案是把「研究问题」拆成两层界面:先配置流程,再逐项审查证据。

巧思一:先配置研究协议,再让 AI 开始跑
普通聊天的默认顺序是:输入问题,得到答案,发现不满意,再补充条件。这个顺序适合一次性的解释,不适合系统综述。系统综述的关键判断往往不是「哪篇论文最像」,而是「什么样的论文算相关」「哪些条件必须同时满足」「摘要不够时是否要读全文」。如果这些条件藏在对话历史里,研究流程就很难复现。
Elicit 把这些约束集中到 Protocol Page。研究者先填写研究问题和 Additional Context,可以写入人群、干预、对照、结果、纳入排除标准或研究设计要求。随后,Gather、Extraction 和 Report 是固定阶段;Abstract screening 与 Full-text screening 可以按需要打开或关闭,全文筛选只有在摘要筛选开启时才可用。搜索也被拆成两种选择:Semantic search 适合探索概念关系,Keyword search 适合 Boolean 条件和可复现检索。1
这个设计的关键,不是多了一个设置页,而是把「方法」从提示词里拿出来,变成可继续编辑的状态。用户可以在 Gather 阶段同时开多个搜索标签,把宽泛的语义问题和精确的 Boolean 查询放在一起;Elicit 会合并重复论文。用户也可以删除自动添加的搜索标签,只保留上传的论文或指定来源。1
更反常识的是,Protocol 并不要求一开始就冻结。Elicit 允许用户在中途重新打开 Protocol;尚未完成的阶段采用新设置,已经运行过的阶段在关闭后会移除对下游的影响,但结果会保存,重新启用后可以恢复。研究者得到的不是一条不可修改的自动化管线,而是一份可以随着材料变化而调整的研究方法。1
代价也被摆在了界面上。协议越严格,筛选和抽取越耗用;打开严格条件和图表抽取会提高使用量。配置本身也提高了启动门槛:只想问一个小问题的人,不一定愿意先搭一套研究流程。Elicit 的选择更适合「要把结果交给别人检查」的任务,不适合所有即时问答。
巧思二:把「AI 判断」拆成带证据的表格单元
配置协议只能让过程有形,不能自动让判断可信。Elicit 在 Screening 和 Extraction 阶段做的第二个选择,是不把 AI 的结论藏在一个总分或一段摘要里,而是让每一个判断拥有自己的列、分数、理由和原文。
筛选条件由 Elicit 根据研究问题生成建议,用户可以修改、停用或手动新增。运行后,用户能看到每篇论文对每条标准的判断、排除原因和支撑判断的摘要原句;阅读模式还会把引用句直接叠加到摘要上。用户可以调整阈值,也可以逐篇覆写 Include 或 Exclude,并保存排除理由。1
这里最值得注意的是「Maybe」的处理。Elicit 的官方评测说明,模型对每条筛选标准会给出 Yes、No 或 Maybe;只要所有标准都是 Yes 或 Maybe,论文就先进入筛选结果。理由不是模型不够果断,而是早期筛选阶段漏掉一篇本该纳入的论文,通常比多留一篇稍后再排除的论文更昂贵。官方在 2026 年 5 月发布的评测中,把这套偏向召回率的策略写成明确的产品判断,而不是让用户从一个模糊的相关性分数里猜。2
严格条件则提供了另一条路径:用户可以把某一列标记为 Strict criterion,任何不满足该条件的论文自动排除;如果结果不清楚,Maybe 仍默认保留,并且用户可以手动覆写。软推荐和硬排除被放进同一个表格,而不是被迫选择「全自动」或「全手动」。31
Extraction 延续了同一套对象模型。研究者先在一小部分论文上确认字段,再运行整张表;每个单元格都可以打开原文中的 supporting quote,检查 AI 填入的答案。字段不是固定的「摘要」「结论」两栏,Elicit 会根据研究问题建议列,用户可以编辑、删除或增加自定义列。这样一来,研究问题不再只决定最终报告的标题,也决定了每篇论文要被比较的维度。1
表格化带来的收益是可审查,代价是不会替你完成最后的判断。候选论文可以很多,但最终报告默认只使用筛选分数最高的 80 篇;更高套餐可以扩大到 135 或 200 篇。即使一张表看起来很完整,研究者仍要检查关键单元格、处理冲突,并确认报告没有把「被找到」误写成「已被证明」。1
独立研究工具评测 IntuitionLabs 也把 Elicit 的边界放在这里:它适合语义检索、筛选、结构化抽取和报告汇总,但仍需要人工监督,尤其是在原文无法完整获取、研究问题跨领域或抽取字段依赖具体方法细节时。4
结尾
Elicit 的巧思不是让 AI 替研究者写出一篇看似完整的综述,而是把综述里容易被聊天掩盖的判断拆出来:研究协议是一种可修改的状态,筛选标准是一组可以逐条回看的列,抽取结果则必须能点回原文。
这套设计适合迁移到任何需要「大量材料 + 明确标准 + 可复核结论」的知识产品。真正值得借鉴的不是把所有工作都做成表格,而是让每个自动判断都留下三个入口:它依据了哪条规则,引用了哪段材料,用户怎样改回去。没有这三个入口,AI 只是在替用户把不确定性藏起来;有了它们,自动化才开始接近一项可以交接的研究工作。
Related content
- Sign in to comment.
