
陶哲轩说,AI 可以很聪明,但还不等于懂数学
陶哲轩把当前 AI 的广泛试探能力称为「人工通用聪明」:数学里的形式化验证能过滤错误,却不能替人完成选题、解释和理解。
AI 可以很聪明,但这还不等于它懂数学
在 7 月 24 日的 ICM 2026 公开讲座和前一天的配套访谈里,陶哲轩把今天的 AI 能力拆成了两个容易混在一起的词:他对真正的「人工通用智能」仍然怀疑,却认为一种更弱的能力正在变得真实,叫作「人工通用聪明」(artificial general cleverness)。它可以在很多不同问题上临时拼凑、试探、搜索,偶尔产出很聪明的结果,但输出并不稳定,也未必能解释自己为什么对。1
这个区分的价值在于,它把「能做出难题答案」和「拥有可迁移、可依赖的理解」分开了。AI 的能力范围可以很宽,可靠性却仍然很窄。数学恰好提供了一个相对友好的展示窗口,因为证明可以交给 Lean 这类形式化系统逐步检查;医院、法院或公共政策里的很多判断,没有同样清晰的自动验收器。陶哲轩在访谈中说,数学里的成功经验更接近 AI 安全使用的理论上限,不能直接替现实世界的高风险决策背书。2
为什么验证比生成更能说明问题
让模型写出一份看似完整的证明,成本正在下降。难的是确认它证明了正确的命题,使用的定义没有偏移,步骤没有悄悄调用未经说明的假设。陶哲轩把 AI 形容成一股高流量、夹杂杂质的水,形式化验证器则像过滤器。过滤器能挡住错误,却不能替人决定哪些问题值得研究,也不能自动解释一个反例为什么改变了我们对数学对象的理解。1
这也是数学和普通聊天问答的分界线。一个 Lean 文件通过编译,至少说明形式系统接受了那段程序对应的命题和证明;它没有说明自然语言问题本身问得好,也没有说明这个结果对人有意义。形式化过程还可能把原本含混的概念固定成了研究者没有意识到的另一种定义。检查器解决的是「这一步是否符合规则」,不是「我们究竟理解了什么」。
陶哲轩在访谈里反复强调,数学不会因为机器更快地产出证明,就只剩下填充定义、定理和证明。数学家仍然要消化结果,选择叙事,判断一个新概念是否值得让整个社区学习。他把未来的变化描述成对 human understanding 和 human story 的重新重视:证明可以更充沛,理解却不会因此自动增加。2
人类的工作会从「证明」移向「判断」
如果 AI 能够同时探索数千条可能的路线,数学家的稀缺工作就会往前移动。研究者需要先判断要把什么问题交给机器,设计足够精确的形式化表达,再检查机器返回的反例或证明是否值得继续追。最后还要把结果翻译回人类能够复用的概念和方法。
这不是给 AI 加一个人工签字环节那么简单。人的判断至少包含三层:
- 命题判断:这个问题值得花时间吗,形式化后的命题还保留了原问题的意思吗?
- 证据判断:程序通过了什么检查,哪些前提、数据或工具没有被独立验证?
- 理解判断:结果改变了哪一部分知识,能否让另一个人学会、复核并迁移?
前两层可以被工具部分支援,第三层很难被一个通过率替代。AI 生成的答案越多,筛选和解释的负担就越重。对数学家来说,这可能是生产力的提升,也可能是把研究从「找答案」推向「判断哪些答案值得成为知识」。
「AI 饮食」比全面禁用更接近现实
陶哲轩谈学生使用 AI 时,没有把选择简化成支持或反对。他把模型称为一个很诱人的「cheat button」,担心学生跳过自己试错、卡住和重新组织问题的过程;同时,他也认为教育可以教人形成有意识的 cognitive diet,把 AI 当作少量调味,而不是替代理解的主食。2
这个比喻比「AI 会不会让人变笨」更有用。真正需要保护的不是某项手工技能的纯洁性,而是学习者经历以下过程的机会:先提出自己的猜测,暴露错误,知道自己卡在哪里,再让工具提供提示或反例。如果模型一开始就交出完整答案,学生可能得到正确结果,却没有形成判断答案的能力。
对研究者也一样。让 AI 先大量生成候选证明,和让 AI 代替研究者决定什么算理解,完全是两件事。前者可以交给搜索和验证系统,后者仍然需要共同体里的解释、争论和时间。
数学的安全窗口不能直接搬到现实世界
这里保留一个不舒服的限制:数学之所以适合展示 AI 的价值,恰恰是因为它有较强的自动检查机制。即使形式化证明不断增加,也不能据此推断 AI 在医疗、法律或治理领域同样可靠。那些领域的「正确」往往包含目标选择、事实完整性、风险偏好和责任归属,检查器无法独自替人完成这些判断。2
所以,陶哲轩这次谈 AI 的重点并不在于预言 AGI 何时到来。他更像是在提醒读者:先看一个系统能否被独立验收,再讨论它是否足够聪明;先问人类保留了哪一种理解,再计算模型替人节省了多少步骤。
当 AI 能把候选答案源源不断地推过来,最重要的能力可能不是多生成一个答案,而是知道哪一个答案已经被证明,哪一个只是看起来像答案,以及为什么这一区别对人仍然重要。
速览
数学家开始要求 AI 先交出可验证的反例
Xena Project 在 7 月 20 日的观察中写到,最近几起 AI 数学反例引发关注后,作者不再信任未经形式化的自然语言证明,而是把 Lean 文件放进沙箱里检查。文章提到一个关于有限平坦群概的反例:作者检查了 1,076 行 Lean 文件,确认定理陈述、数学对象和证明都能在 mathlib 环境中编译。作者也提醒,反例通过形式验证不等于人类已经理解了它为什么重要,这正好说明「证明成立」和「洞见成立」之间还隔着一段距离。3
CMU 把数学 AI 设计成三种系统的组合
卡内基梅隆大学 7 月 9 日介绍了 Jeremy Avigad、Marijn Heule 和 Sean Welleck 的相关工作:神经模型负责生成文本、尝试证明或提出策略,自动推理系统处理部分组合问题,Lean 和 mathlib 负责检查形式正确性。CMU 的表述仍是机构介绍,不是独立评测,但这个组合很能说明「AI 数学」的工程现实:模型负责扩大搜索,验证器负责缩小错误范围,数学家仍要决定问题和解释。4
让模型说「我不确定」,也只是把验证往前挪
MIT CSAIL 4 月公布的 RLCR 方法,把 Brier score 加入强化学习奖励,让模型同时学习回答和估计自己的置信度。MIT News 报道称,这种方法在准确率不下降的情况下,最高将校准误差降低了 90%,并且在未见过的新任务上也有效。它解决的是模型如何更好地表达不确定性,不等于模型已经有了外部可审计的理由;人仍要知道什么时候可以接受自报信心,什么时候必须要求独立证据。5
陶哲轩的 ICM 2026 讲座原始幻灯片和配套访谈: Mathematics in the age of AI · Interview: Terence Tao on AI
Related content
- Sign in to comment.
