
AI 不是均匀变强:Mollick 看见能力扩散,Marcus 仍盯着世界模型缺口
Mollick 说模型能力正在从数学和代码扩散到商业、医学与法律,但同一系统仍会在写作与边界任务上失足;Marcus 用棋类规则与融资、就业叙事提醒,能力样本不能直接变成可靠性和商业回报。
能力在扩散,可靠性却没有同步变平
北京时间 7 月 28 日 08:00 至 7 月 29 日 08:00,窗口内的可用原创主要集中在 Ethan Mollick 与 Gary Marcus。Mollick 看到模型能力正从数学、代码扩展到商业、医学和法律;Marcus 则用棋类规则与 AI 融资讨论提醒读者,同一个模型的高分样本不能直接变成通用可靠性,更不能自动变成商业回报。
Mollick:模型不只在可验证领域进步
Ethan Mollick(沃顿商学院教授)在 7 月 29 日早晨连续写下两条判断。针对「大语言模型只在数学、编程这类可验证领域进步」的说法,他认为现有数据并不支持这个结论。随着模型在数学和代码上的表现变好,它们也在处理开放式商业案例、生成想法、医学和法律问题。1
几分钟后,他又补了一层限制:不同领域之间存在明显的能力不平整,同一个领域内部也一样,写作就是模型进步缓慢甚至停滞的例子;但模型又能在许多没有专门训练的学科里表现得异常有效。2
这两个判断放在一起,比「模型变强了」更有用。它们描述的不是一个统一上升的分数,而是一张起伏很大的能力地图。模型可能已经能帮团队生成商业方案,却在长篇写作、事实边界或某个流程的例外分支上不断返工。企业如果只用一个总榜单或一次演示来选型,就会把局部峰值误当成整张地图的平均高度。
Mollick 还用「能力不平整」解释了一个更容易被误读的现象:他认为第一本「大部分由 AI 生成、但还没有完全算作 AI 生成」的《纽约时报》畅销书,实际上可能已经接近出现,只是模型仍有缺口,需要人类补完;这种状态还会在许多领域持续一段时间,数学证明就是他举出的例子。3
这里的重点不是预测某一本书什么时候上榜,而是验收口径正在变化。过去的问题是「AI 能不能写出一本书」,现在更接近「它完成了哪一部分,哪些段落仍然需要人类判断,补完成本是多少」。当任务可以被拆成多个环节,模型的缺口就不再只是技术指标,而会进入编辑、法务和产品负责人的工作量账本。
从 AI 书籍到人类劳动,影响不必等到作品变差
同一组推文里,Mollick 转述了一项研究:AI 书籍大量出现,并挤压了人类作者的收入。按他的说法,不使用 AI 的书籍单本收入在 8 个类别中的 7 个低于 2023 年,唯一增长的是奇幻/恐怖类,增幅为 35%。4
这个数字需要保留出处边界。原帖没有给出研究报告链接,本文只能确认 Mollick 的转述,不能把它当成已经独立复核的行业统计。即便如此,他随后补充的判断仍然清楚:他不愿把这些作品简单称作「垃圾内容」,因为读者可能喜欢它们;人类工作的变化也不要求 AI 产物糟糕到无人阅读才会发生。5
这对内容、教育和知识服务团队有一个直接含义:质量评价与劳动影响是两条不同的线。作品可以达到读者愿意消费的水平,同时减少某些人类作者获得订单的机会;模型也可以在开放式任务上提供有效帮助,同时把查错、补写和责任确认留给人类。只盯着最终成品是否「像人写的」,会漏掉工作分配已经发生的变化。
Marcus:世界模型缺口不能被演示掩盖
Gary Marcus(NYU / Marcus on AI,AI 评论者)在 7 月 29 日凌晨回应 Garry Kasparov 时,重复了他常用的反例:现成的大语言模型连国际象棋规则都可能执行不好,除非依赖大量数据或专门的外部工具;他据此质疑让这类系统参与战争的想法。6
这条推文没有交代测试模型、棋局样本和失败率,所以它不能独立证明「现成 LLM 都不会下棋」。它能成立的部分,是 Marcus 提出的验收方向:如果系统无法在小规模、规则清楚的环境里稳定维护状态,就不能只因为它在语言、代码或展示型任务上表现突出,便把它的可靠性外推到高风险场景。
他的另一条线指向商业叙事。Marcus 先询问有没有更新版的「循环融资」图,称手头的版本已经过时,之后又说自己将很快在 CNBC 讨论这个问题。7 8 原帖没有提供图表内容、公司关系或金额,因此这里不能替他补出一张融资链条。可确认的只有:他把 AI 行业的融资结构当成需要单独核对的对象,而不是把融资规模直接当作技术需求或产品回报的证明。
同一晚,Marcus 还说自己早就判断「就业末日」不会很快发生,只是 Silicon Valley 之外的节目不愿听这个判断。9 这句话是他的立场回顾,不是就业数据。把它和 Mollick 的材料并读,边界更清楚:AI 对工作的影响可以先通过收入、订单和任务分配发生,不必等到失业率出现戏剧性变化;而融资叙事也需要现金流、合同和实际使用等独立证据来支撑。
今天的验收表
Mollick 提醒我们,模型正在进入更多开放式工作,Marcus 提醒我们,扩展范围不等于消除缺口。对企业来说,验收表至少要把三件事分开记录:模型在哪类任务上有效,在哪些环节需要人类补完,以及每次失败会带来多少返工和责任成本。榜单可以告诉你能力的峰值,不能告诉你峰值之外的地形;融资和就业讨论可以提供问题线索,也不能替代产品数据。
这 24 小时的共同信号不是「AI 已经无所不能」,也不是「AI 只会做数学和代码」。更准确的描述是:能力边界正在向外扩张,但边界内部仍然凹凸不平。选型、治理和投资判断,仍要按任务逐项验收。
Loading content card…
Loading content card…
Related content
- Sign in to comment.
More from this channel›
- 核心账号暂无合格原创:Astra 十项数学结果引发 Mollick 与 Marcus 的外推之争
- AI 进入真实工作流后,谁来守住边界?Sama、Mollick、Marcus 与 Chollet 的一日交锋
- 模型在降价,机器人开始协作:Sama、Hassabis、Mollick 与 Chollet 的 24 小时验收题
- 核心账号暂空:Mollick 找 AI 测量仪,Marcus 核对 Anthropic 利润表
- 从可玩演示到失败记录:Mollick 与 Chollet 把 AI 的验收表补上了
- ChatGPT Work 把手机变成任务入口,Mollick 却提醒权限和选型仍是难题
- 版本号可能消失,验收却不能消失
- Opus 5 的 30% 之后:榜单、长任务和模型入口开始分叉
