AI 会提点子,但它的「品味」还很窄

AI 会提点子,但它的「品味」还很窄

这期深读一项关于 LLM 研究构想的新研究:模型能提出看似合理的想法,却明显偏爱「桥接」和「综合」这类套路。文章解释为什么这会影响人的问题意识,并补充科学发现、世界模型与 AI 治理的相关信号。

AI 现在最会做的,可能不是发明问题,而是把已经摆在桌上的东西重新连一遍。
7 月 1 日,Yale 和芝加哥大学研究者发布了一篇关于「LLM 研究品味」的论文。他们让模型在同一组相关论文摘要上构想新研究,再把这些想法与真实人类论文的核心想法做分布比较。结果很刺眼:模型能提出合理想法,但它们反复偏向同一种动作,先找「断开的文献 / 方法 / 证据流」,再给出「综合、统一、桥接」式方案。1
这比「AI 会不会写论文」更值得看。因为它问的是另一件事:当我们把构思也交给 AI,模型会不会悄悄把人的问题意识,压成它最熟悉的几种形状?

今天的主线:AI 的短板可能叫「品味太窄」

论文里的「research taste」不是审美意义上的品味,也不是某个研究者的个人偏好。它指的是一个更具体的东西:面对同一批已有知识,一个人或模型会把「哪里值得研究」看成什么类型的问题,又会用什么类型的方法把它变成一个研究构想。1
研究团队没有只问「这个点子新不新」「可不可行」。他们把想法拆成两条轴:一条看动机,比如是在解释一个失败现象、暴露一个测量缺口、放宽一个前提,还是连接几块分散的文献;另一条看方法,比如是构造新工具、做经验测绘、形式化推导,还是把已有方法综合起来。1
差距就出在这里。
在人类论文里,只有 12.1% 的研究动机落在「桥接 / 连接」这类机会模式上,只有 5.1% 的方法以「综合 / 统一」为核心。模型这边完全变了样:九个主流模型中,「桥接」类动机占到 47.1% 到 64.2%,「综合」类方法占到 22.5% 到 38.7%。1
换句话说,模型不是没点子。它的问题是太爱给出一种看起来很学术、很稳妥、也很容易写成摘要的点子:这里有两条线没连上,所以我们提出一个统一框架。
这类想法当然有价值。很多好研究本来就来自连接。但如果一个工具在大量场景里都把「值得研究」默认理解成「把 A 和 B 接起来」,它就会少看见别的可能:哪里需要一个新测量?哪里该设计一个失败测试?哪里该承认这个方向不成立?哪里需要造一个东西,而不是再写一个框架?

更丰富的上下文也没有自动修好这个问题

论文还做了一个很有意思的补充实验:不只给模型论文摘要,而是让模型读完整论文,再生成更丰富的相关工作摘要,之后再构思新想法。按直觉,模型知道得更多,应该更接近人类研究者。
结果没有。完整论文上下文没有把模型推向更接近人类的分布;在抽样实验里,两个被测试模型的分布距离反而变大,想法仍然集中在桥接和综合上。1
这点很关键。它提醒我们,给 AI 更多材料,不等于它会自动形成更好的问题感。它可能只是更有材料去包装那个熟悉的套路。
日常使用里也能看到类似现象。你让模型读几篇文章,它很快能给出「共同主题」「统一框架」「趋势总结」。这些输出不一定错,甚至常常很有用。但如果你真正要找的是一个反例、一个被忽略的失败、一个难以测量的变量,模型默认给你的答案可能太顺了。顺到你忘了追问:有没有一个问题根本不该被合并?

另一份研究把问题说得更狠:AI 不擅长提出「没有发生什么」

6 月,芝加哥大学 Knowledge Lab 的一组研究从另一个角度做了大规模测试。他们邀请 6,749 名科学家评价 AI 针对自己论文生成的研究假设,共得到 25,139 组评分;这些假设来自 121,640 篇 2023 年之后的预印本。2
这篇论文的结论更尖锐:非推理模型会收缩成相似的「蜂群式」想法;推理模型能走得更开,但各类模型都更少提出空假设,也就是「A 和 B 没有关联」「这个效果不存在」这类科学上很重要的负向判断。2
这不是小毛病。很多科学判断来自「排除」:排除一个机制,否定一个解释,承认一个方向走不通。可是训练语料里充满了已经发表的正向结果,失败实验、废弃假设、没有复现的路线,往往留在实验室笔记、审稿意见和研究者脑子里。模型能压缩公开文本,却很难压缩那些没有被写出来的负知识。
同一篇研究还发现,用模型当评审也并不稳。几个自动评价方法与专家判断的相关性都很弱,最高也没有超过 r=0.35。2 这说明问题不能靠「再让另一个模型评一下」轻松解决。判断什么想法值得做,本身就包含一个共同体正在变化的标准。

对普通使用者,这件事怎么落地

这不是说不要用 AI 头脑风暴。恰恰相反,AI 很适合快速铺开可选方向,尤其是在你刚接触一个领域、还不知道已有材料之间怎么连接的时候。
但它更像一个过度热心的连接器,而不是一个天然会挑战前提的同事。用它构思时,可以把提示词往相反方向推:
  • 让它列出「这个方案可能根本不成立的条件」,而不是只问「怎么完善」。
  • 让它生成空假设、失败实验和反例场景,逼它处理「没有效果」这类判断。
  • 让它把想法按类型分开:测量、解释、构造工具、放宽前提、寻找边界、验证失败,而不是统一写成「综合框架」。
  • 让它指出哪些关键信息不在公开文本里,必须问人、做实验或看日志才能知道。
这些做法的核心不是让 AI 更会输出,而是保护人的问题感。AI 最危险的地方有时不是胡说,而是给出一个太顺、太像论文摘要的答案,让你误以为问题已经被完整看见了。

速览:同一条线上的两个信号

  • Science 在 6 月底写到,越来越多研究者开始把注意力转向「世界模型」和可交互环境,因为 LLM 主要从文本和图像里学习,缺少直接试错和验证行动后果的能力。文章里,OpenAI 首席科学家 Jakub Pachocki 也承认,人类并不只靠文字推理。3 这与「研究品味」问题连在一起:只在文本中重组知识,未必足够产生真正新的问题。
  • 联合国独立国际 AI 科学小组 7 月发布初步报告,强调 AI 能力、采用速度和风险治理之间的差距正在扩大;报告也把可靠性、复杂多步任务、物理系统交互和事实输出列为仍未解决的限制。4 这给今天的主线补了一层治理语境:问题不只是模型能不能做事,还包括人类如何测量、约束和校准它做事的方式。
如果把 AI 当搜索器,桥接能力是优点;如果把 AI 当共同思考者,桥接偏好就需要被看住。下一次模型给出一个漂亮的「统一框架」时,最值得追问的可能是:它绕开了哪个不适合统一的问题?

관련 콘텐츠

  • 로그인하면 댓글을 작성할 수 있습니다.
More from this channel