
模型分数之后,AI 还要回答什么?Sama、Mollick 与 Marcus 的同日交锋
Sama 押注用户体验与未来增长,Mollick 追问模型评测和开放权重治理,Marcus 则质疑美国只靠更多算力能否赢回 AI 优势。
先看结论
本期覆盖北京时间 2026 年 7 月 17 日 08:00 至 7 月 18 日 08:00 的 X 原创内容。最强信号不是又一个模型分数,而是 AI 产业正在被迫回答四个更具体的问题:产品增长能否兑现为用户收益,开放权重模型怎样被比较和约束,美国算力投入是否真的构成战略,以及「流体智能」这类新路线能否从口号进入组织。
这也是一组并不完全一致的判断。Sam Altman 对 OpenAI 接下来 12 个月明显乐观;Ethan Mollick 则不断给模型表现加注脚,提醒读者别把 Arena 分数、模型名次或演示效果当成完整能力;Gary Marcus 进一步质疑美国把更多钱投向数据中心的策略。François Chollet 的新实验室消息,则把争论从单条产品推文拉回研究组织层面。
Sama:乐观叙事的核心,仍然是用户能否赢
Sam Altman 在北京时间 7 月 17 日 02:06 写道,OpenAI 过去 12 个月「并不是最好的 12 个月」,主要责任在自己,但团队即将迎来「迄今最好的 12 个月」。这是一种明确的产品信心表达,不过它是管理者的前瞻判断,不是已经公布的产品路线或性能承诺。更值得注意的是,他紧接着把理由落在用户身上:AI 应该让更多人获得自由、能动性和财富,公司希望做正确的事,但不想靠吓唬用户来迫使他们接受自己的方案。1
几个小时后,他又说自己现在与 ChatGPT 对话的时间已经超过打字时间,并判断「新语音模型真正跨过了一个门槛」。这条推文没有给出模型名称、测试方法或具体指标,所以它能证明的是产品体验判断,而不是可复核的技术突破。两条推文放在一起看,Sama 试图把竞争叙事从「下一个模型有多强」改写成「用户是否愿意持续把任务交给它」:语音是入口,用户能动性是价值标准。2
Mollick:模型变好,不等于证据已经够用
Ethan Mollick 的材料正好给这份乐观加上验证条件。他先承认 Kimi K3 是「非常好的模型」,但提醒人们又一次过度依赖 Arena 分数,Llama 4 已经说明这种判断可能失真。在他的解释里,Arena 的 ELO 由用户评判,前端又主要是主观的文字聊天,模型可以通过训练或系统提示优化到更讨用户喜欢的状态,却不一定代表更广泛的任务能力。3
他随后把问题从单模型排名推向产业竞争:中文开放权重模型已经很强,他在推文中给出「K3 优于 GLM-5.2,后者又击败 DeepSeek v4」的判断,并追问这些模型能否同时成长为巨大而有价值的企业。这里的排序是 Mollick 的现场观察,不应替代独立评测;但它提出了一个比「谁第一」更实际的问题:当能力差距缩小时,开放权重公司的收入、算力和生态能否支撑长期竞争。4
更棘手的是安全准入。他问开放权重模型的「pre-clearance」应该怎样运作:Kimi K3 当时还没有模型卡,权重预计数周后发布,而开放模型又更容易被越狱。即使权重一旦发布无法被召回,政府仍可要求服务本国用户的公司不要使用未经审查的模型;他最后把问题推向国际协调,而不是简单的封禁或放任。Mollick 还指出,英国政府 AI 安全机构计划在权重发布后测试 Kimi K3,用来观察它是否追上公开前沿并引发网络安全讨论。两条推文都只是观察和提问,不能当作已经存在的监管规则或测试结果。56
他的另一个小例子也很有代表性:Kimi K3 仍然写不好谋杀谜案,和其他模型一样,常常把线索写得过于明显或过于隐晦,难以做好伏笔。这个判断没有给出系统 benchmark,却指出了语言流畅之外的「锯齿状前沿」:真正困难的不是生成一段像样的文字,而是维持叙事结构、信息释放节奏和读者预期。7
Marcus:美国缺的可能不是更多机器
Gary Marcus 把讨论转到国家战略。他先直接问「美国生成式 AI 产业还能被救吗,怎么救」,随后针对 David Sacks 所说的「更多数据中心、更少监管」提出反问:美国并不缺乏实质性监管,也已经拥有更多算力,但领先优势仍在缩小。8
在更早的两条原创推文里,他说给没有护城河、没有清晰计划的公司和数据中心继续砸钱不是答案,需要的是新战略;又把美国 AI 优势受损归因于「傲慢」。他还押注 2026 年不会到达 AGI。这些短推没有给出完整替代方案,尤其不能据此断言美国竞争力已经崩溃;但它们共同否定了一条简单等式:更多资本投入、更多计算资源,就会自动换来更强的产业位置。91011
Chollet:路线之争开始寻找新组织
François Chollet 在北京时间 7 月 18 日 07:14 宣布 AfterLab 走出隐身模式。这是一个研究高效「流体智能」的全新实验室,他只说明团队在探索不同路径,并祝贺 Clem 和 Matt 获得融资,没有披露技术细节、模型或时间表。因此,本期只能把它视为一条组织与研究路线信号,不能扩写成已验证的新架构。12
今天的共同边界
Sama 讲的是用户愿不愿意把更多任务交给 AI,Mollick 追问怎样比较、怎样审查、怎样证明能力,Marcus 则问算力投入之外还缺什么,Chollet 把答案指向新的研究组织。四条线索合在一起,结论并不是「模型又进步了」,而是评价标准正在变厚:产品要有持续使用,模型要有超越主观榜单的证据,开放权重要面对部署责任,国家战略也不能把数据中心数量当成产业能力的替代指标。
Fuentes de referencia
- 1Sam Altman:关于未来12个月与用户获益的推文
- 2Sam Altman:新语音模型跨过门槛
- 3Ethan Mollick:Kimi K3 与 Arena 评分局限
- 4Ethan Mollick:中文开放权重模型的竞争
- 5Ethan Mollick:开放权重模型的预审问题
- 6Ethan Mollick:英国政府 AI 安全基准
- 7Ethan Mollick:Kimi K3 的谋杀谜案能力边界
- 8Gary Marcus:美国生成式 AI 产业如何自救
- 9Gary Marcus:数据中心与新战略
- 10Gary Marcus:美国 AI 优势与傲慢
- 11Gary Marcus:2026 年无法到达 AGI 的赌约
- 12François Chollet:AfterLab 走出隐身模式
Contenido relacionado
- Inicia sesión para comentar.
More from this channel›
- 模型开始进入真实系统,旧工作流却还没跟上
- 模型会突然掉回平均线,CISO 却等不起:Mollick 与 Marcus 的 24 小时
- 模型会变便宜,AI 的价值还剩在哪一层?Chollet、Marcus 与 Mollick 的分歧
- Agent 已经会动手,AGI 还缺哪张证据表?Mollick 与 Marcus 的最新观点
- Sama 要用户赢,Mollick 盯展示偏差,Marcus 追问 AI 的价格账本
- Sama 把 Agent 做进工作台,Mollick 与 Marcus 追问代价
- Sama 把 AI 竞争压到价格与入口,Mollick 发现产品还没跟上
- Sama 说别轻视用户,Mollick 说用量指标失真
