
核心账号暂无合格原创:Astra 十项数学结果引发 Mollick 与 Marcus 的外推之争
本窗口核心追踪账号没有可入选的原创长推,文章转向 OpenAI 公布的 Astra 十项数学结果:Mollick 看到科学推理能力与成本的变化,Marcus 则提醒形式化成功不能自动外推到开放问题。
本窗口的核心追踪账号没有出现可作为主线的原创长推。高信号材料集中在 OpenAI 公开的 Astra 数学结果,以及 Ethan Mollick 和 Gary Marcus 对这批结果该如何理解的分歧:前者看到科学推理的成本和能力都在下降,后者提醒,形式化问题上的成功不能自动外推到开放问题,更不能直接改名为 AGI。
争论的重点因此不是「模型到底强不强」这一句口号,而是三层证据能否分开:结果本身是否成立,模型在其中承担了什么工作,以及这次成功能外推到哪些任务。
OpenAI 展示的是什么
8 月 1 日,OpenAI 发布文章称,内部版本的 Astra 为十个长期未解决的数学与理论计算机科学问题给出了新结果。这些问题涉及高维几何、编码理论、群论、算术电路复杂性、量子复杂性、格密码和极值组合学等领域,官方说其中多数问题在主要结果上已经至少十年没有进展。1
这里的「十项」不是一个统一分数,而是十个不同问题上的结果集合。OpenAI 的页面列出了球体堆积、非 sofic 群、Connes 刚性猜想、量子博弈并行重复、最近向量问题等例子,并把这些结果归因于内部版本的 Astra。1
方法和成本也被一并写出:模型寻找解法,之后由人类与同一模型准备成论文,再把每个论证形式化为 Lean 证书;OpenAI 估算,寻找这十个解法所需的 token 按 Sol API 价格计算约为 2,000 美元。1 这个数字是 API token 账单,不是完整的研究成本,也不是对十个结果正确性的独立复核。
OpenAI 研究员 Noam Brown 在原帖中把这件事概括为「内部版本的 Astra」解决了数学、量子复杂性和理论计算机科学中的十个开放问题,并称其可能成为科学推理的一大步。2
Loading content card…
Mollick:能力在上升,但人类越来越难凭直觉验收
Ethan Mollick 的判断并不等于替 OpenAI 背书。他列出四点观察:AI 在数学和科学上变得很强;两年前的 LLM 还不能稳定完成基础数学;Noam Brown 给出的这批证明成本低于 2,000 美元;OpenAI 这次更强调新模型能带来的好处,而不只是风险。3 其中成本是 Mollick 转述 Brown 的数字,官方页面给出了相同口径,读者不应把它当成 Mollick 自己做的 benchmark。
他随后补了一层更实际的观察:对地球上几乎所有人来说,这些结果不只是超出能力,也超出理解范围。普通读者只能依靠数学专家判断它是否令人印象深刻,而这种情况正在扩展到更多领域,于是能力增长反而变得更难「感觉」出来。4
这改变了产品验收的顺序。过去,演示者可以把「模型给出了答案」当成最醒目的事实;在不可由普通人复算的专业领域,第一步却应该是找到能检查答案的人,并把检查对象说清楚:是结论、证明、方法,还是可供后续研究使用的新工具。一个漂亮的答案和一项能被同行接着使用的结果,不是同一个交付物。
Mollick 对非形式化领域也没有完全悲观。他说,LLM 缺乏可验证答案在许多领域确实是问题,但问题有时被夸大;模型在形式化领域变强的同时,也在许多较难验证的领域变强。5 他的判断留下了一个条件:能力可以扩散,但不同领域的验收方式不会因此自动相同。
Marcus:可解、可形式化,不等于开放世界
Gary Marcus 把批评集中在「外推」上。他认为「所有认知都一样」是错误前提,某个领域出现漂亮进展,不代表所有认知能力都已近在眼前。针对 Astra,他明确写道:数学上的强表现不能说明系统会避免幻觉、能读好 PDF,或者能遵守硬规则;他还强调目前没有看到方法论,因此不接受从这些结果直接跳到 AGI 或 ASI。6
他用一句更短的话压缩了界线:「可解、可形式化的问题」,不等于「解决开放问题」。7 这不是说形式化结果没有价值,而是说它们回答的是一类边界清楚的问题。把这类成功直接换算成阅读、规划、长期协作或现实世界判断力,需要另外的证据。
Marcus 还指出,即使这些结果达到 Fields 水平,也不能说数学已经被解决;按他的理解,当前材料未显示 Astra 建立了新的理论或技术,也可能在数学的其他角落表现较弱。8 对于「科学黄金时代已经到来」一类判断,他同样认为那是从形式问题跳到难形式化问题的信念飞跃。9
Loading content card…
这次进展该怎样验收
把三人的材料放在一起,至少要分开四个问题:
- 结果层:十个问题分别得到了什么结果,哪些是新上界、下界、构造或猜想反例?不能用「解决了数学」替代逐项说明。
- 方法层:Astra 生成了哪些论证,人类做了哪些整理,Lean 证书证明的是哪一部分?「模型参与」和「模型独立完成」不是同一说法。
- 成本层:约 2,000 美元是寻找解法的 token 口径;它说明某类研究搜索的边际成本可能下降,不代表研究人员、计算基础设施和复核成本都消失。1
- 外推层:数学等形式化领域的成功,能否迁移到没有标准答案、规则不完整、错误代价高的任务?这正是 Mollick 留下的验收问题,也是 Marcus 不接受跨越的地方。
截至本窗口的材料,最稳妥的结论是:Astra 把 AI 科学推理推进到了一个值得专家逐项检查的新阶段,OpenAI 同时给出了结果清单、生成流程和成本口径;但「十项数学结果」仍不能替代对方法透明度、同行复核和跨领域可靠性的回答。真正决定下一步价值的,不是它能否再多解几道形式题,而是这些结果能否被数学家接着使用,以及系统在开放问题中会不会保持同样的诚实边界。
References
- 1OpenAI:Ten advances in mathematics and theoretical computer science
- 2Noam Brown 关于 Astra 十项结果的原帖
- 3Ethan Mollick 关于 Astra 数学能力与成本的原帖
- 4Ethan Mollick 关于专家验收与能力不可感知性的原帖
- 5Ethan Mollick 关于可验证答案与非形式化领域的原帖
- 6Gary Marcus 关于 Astra 与 AGI 外推谬误的原帖
- 7Gary Marcus 关于形式化问题与开放问题的原帖
- 8Gary Marcus 关于数学结果边界的原帖
- 9Gary Marcus 关于科学黄金时代外推的原帖
Related content
- Sign in to comment.
