
Agent 已经会动手,AGI 还缺哪张证据表?Mollick 与 Marcus 的最新观点
Mollick 从 Codex 电脑操控、开放权重价值和中文推理链观察 AI 的产品边界,Marcus 则用 AGI 能力清单和时间表提醒:完成窄任务,不等于通用智能已近。
从会做演示,到能被验收
过去 24 小时里,最值得关注的变化不是又出现了一个更高的模型分数,而是「AI 到底能不能被放进真实工作流」这个问题变得更具体了。Ethan Mollick 一边记录 Codex 通过电脑控制完成软件安装、3D 建模和动画制作,一边提醒开放权重模型如果最终占据主导,未必意味着 AI 行业崩塌,价值可能只是从模型实验室转移到算力供应商。临近窗口结束时,他又用一个中文提问观察 Kimi K3 的推理链语言分布。Gary Marcus 则把讨论拉回 AGI 的可交付能力:当前系统离 AGI 仍远,短期预测需要面对具体能力清单,而不是只看演示效果。
本期覆盖北京时间 2026 年 7 月 18 日 08:00 至 7 月 19 日 08:00 的窗口内原创内容。可独立核验、且有足够信息量的素材主要集中在 Mollick 与 Marcus 两位作者,其他追踪账号没有在窗口内提供同等密度的原创长推,因此不为凑覆盖面加入转推或窗口外内容。
Mollick:Agent 的第一道门槛是实际操作
Mollick 是宾夕法尼亚大学沃顿商学院教授,长期研究 AI、创新与创业。7 月 18 日 11:20 左右,他分享了一次 Codex 的 computer use 体验:用户只需要提出「我从没用过 Blender,请通过电脑控制下载、安装它,再做一个 3D 水獭并把它变成小动画」的任务,Codex 就能完成这一串动作;在 Windows 端,用户只点击了一次授权安装 Blender。1
这条推文的价值不在水獭这个演示对象,而在任务链的长度。传统代码生成通常把模型交付物定义为一段代码,用户还要自己安装环境、打开软件、确认状态、处理权限,再检查结果。computer use 把这些中间步骤也纳入了模型的责任范围:它得识别界面,调用程序,等待反馈,继续执行,并把动作推进到一个可见产物。
但「只点击一次」同样暴露了边界。Agent 并没有消灭权限系统,关键动作仍需要人确认。真正进入企业工作流后,难点也会从「会不会点按钮」转向权限给到哪一步、失败后能否回滚、软件状态是否可观察,以及最终产物由谁验收。对采购方而言,这比一次漂亮的演示更接近可用性指标:任务能否完整闭环,人工介入发生在哪里,出错成本是否可控。
开放权重改变的,可能是价值分配
在另一条原创推文中,Mollick 对「开放权重最终占据主导会导致 AI 崩塌」的说法表示困惑。他的判断是,即使实验室在竞争中失利,也不代表 AI 没有价值,因为算力仍是瓶颈,价值可能由算力提供商捕获,而不是由模型实验室捕获。2
这把争论从「开放还是闭源」换成了更实际的利润分配问题。模型权重越来越容易获得,并不等于训练、推理、部署和持续服务都变得免费。假如能力逐渐商品化,模型层的差异会被价格和可替换性压缩,算力、网络、数据中心和部署工具的议价能力反而会上升。对企业用户来说,开放权重带来的主要变化可能不是「从此没有供应商」,而是供应商锁定的位置发生变化:模型可以替换,算力和工程系统未必容易替换。
这也是为什么「模型更强」不能直接等价于「公司更有护城河」。模型产品需要证明的不只是能力上限,还包括推理成本、稳定性、许可条件和替换成本。开放权重真正冲击的,可能正是实验室把模型能力和商业价值绑定在同一层的方式。
中文回答流畅,推理链未必同语种
7 月 19 日 07:24,Mollick 又分享了一个更细的观察。他用中文要求 Kimi K3 挑选两首适用于 LLM、且不落入陈词滥调的诗,并指出:即使任务明确要求面向中文读者、讨论中文诗歌,推理链中仍有 95.5% 的字符和 88% 的词是英文。3
这不是一个足以替代正式评测的样本,也不能据此给模型的中文能力排名。但它提出了一个经常被产品界面遮住的问题:用户看到的是中文答案,模型在中间如何组织概念、检索关联和判断语义,却可能遵循另一套语言分布。对普通聊天来说,这未必构成问题;对教育、法律、研究和需要细腻文化语境的工作,输入语言、推理过程和最终表达之间是否一致,就可能影响可解释性和错误定位。
模型评测因此不能只问「它最后答得像不像」。还要问它在不同语言、不同任务和不同约束下,是否保持相近的判断结构。单个提示词不是答案,但它提醒产品团队:用户界面的语言一致,不等于系统内部的任务理解已经一致。
Marcus:把 AGI 口号换成能力清单
Gary Marcus 是长期质疑生成式 AI 可靠性与 AGI 时间表的 AI 研究者。7 月 18 日 09:08,他回应 Demis Hassabis 对当前系统距离 AGI 仍远的判断,写道:如果只需要再有一两个突破,他会感到意外;如果一个突破都不需要,他会感到震惊。4
半小时后,他又提到自己与 Miles Brundage 在 2024 年底做的一场赌注:双方列出 10 项通常会被期待由真正 AGI 完成的能力,目标时间设在 2027 年底。Marcus 说,赌注已经过半,按他的判断,AI 目前最多只完成其中 1 项,并认为「今年年底出现 AGI」的预测荒谬。5
这里最重要的不是 Marcus 的时间判断是否正确,而是他把讨论从路线口号换成了验收表。一个系统可以在狭窄任务里完成令人印象深刻的操作,同时在迁移、持续学习、长期规划或非预设环境中表现有限。前者足以推动产品发布,后者才决定它是否配得上「通用」这个词。两者混在一起,才会让一次成功演示被误读成能力边界已经消失。
今天的交叉读法
Mollick 的 Codex 案例和 Marcus 的 AGI 怀疑并不矛盾。前者说明 agent 正在从「生成回答」进入「操作软件并交付结果」,后者提醒这种跃迁发生在具体任务里,并不自动证明系统已经获得通用智能。一个更稳妥的判断框架是把两件事分开:先看它能否在真实环境中完成任务,再看这种能力能否跨任务、跨语言、跨环境稳定迁移。
过去一年的 AI 讨论常把演示、分数、模型权重和公司估值放在同一张图里。本期几条原创推文提供了另一种拆法:演示检验行动能力,语言样本检验任务理解,开放权重讨论价值归属,能力清单检验 AGI 时间表。AI 的下一道门槛,可能不是再做出一个更像人的回答,而是让外界知道它究竟在哪些条件下可靠、在哪些条件下仍然需要人接管。
関連コンテンツ
- ログインするとコメントできます。
More from this channel›
- 谁来决定模型怎么做?Mollick 与 Marcus 追问 AI 的控制权
- 模型开始进入真实系统,旧工作流却还没跟上
- 模型会突然掉回平均线,CISO 却等不起:Mollick 与 Marcus 的 24 小时
- 模型会变便宜,AI 的价值还剩在哪一层?Chollet、Marcus 与 Mollick 的分歧
- 模型分数之后,AI 还要回答什么?Sama、Mollick 与 Marcus 的同日交锋
- Sama 要用户赢,Mollick 盯展示偏差,Marcus 追问 AI 的价格账本
- Sama 把 Agent 做进工作台,Mollick 与 Marcus 追问代价
- Sama 把 AI 竞争压到价格与入口,Mollick 发现产品还没跟上
