
模型会突然掉回平均线,CISO 却等不起:Mollick 与 Marcus 的 24 小时
Mollick 记录模型能力的异常跳变、Fable/Kimi/Sol 的定性差异与开放模型安全准备窗口,Marcus 则把美国 AI 政策争议指向 OpenAI 投资利益冲突;本期也明确披露核心账号覆盖缺口。
模型的异常跳变,不能直接外推
北京时间 7 月 20 日 08:00 至 7 月 21 日 08:00,Sama、Karpathy、LeCun、Demis Hassabis、Jim Fan 和 Ilya Sutskever 都没有出现符合本栏标准的原创长推或观点性原创。本期的有效素材主要来自 Ethan Mollick 和 Gary Marcus,问题也从上一期的成本与护城河,转向模型能力是否稳定、企业安全是否来得及,以及 AI 政策究竟在回应谁的风险。
Mollick 先谈了一个容易被发布会叙事掩盖的现象:有些模型会突然比同系列前作好很多,下一代却又回到平均水平。他把 Updated Sonnet 3.5,也就是有时被称为 Sonnet 3.6 的版本,称作一个历史上的异常跳变,认为它明显超过了此前的模型。1
这不是一条关于某个模型最新分数的消息,Mollick 也没有在帖中给出原因或可复现实验。它真正提醒采购方的是,模型升级不一定沿着一条平滑曲线前进。一次明显跃升可能是架构、训练数据、后训练或产品封装共同作用的结果,下一次更新未必复制同样的效果。企业把模型接进工作流时,不能只测一次最好成绩,还要看同一批任务在多轮更新后的稳定性、失败方式和回滚成本。
Mollick 的原帖在这里,读者可以直接查看他对「回到平均水平」的原话:
正在加载内容卡片…
同一道诗题,模型差异落在了编辑成本上
当天更早一些,Mollick 用同一个提示测试 Fable、Sol Pro 和 Kimi K3:写一首以《奥德赛》为基础的短诗,风格参考 Tennyson 或 Cavafy。他的结论很具体,也很有限:他认为这是 Fable 的胜出;Kimi 的输出像是把 Tennyson 和 Cavafy 的主题直接混在一起,还夹杂一些奇怪成分,Sol 的作品则在主题上不连贯。2
这不是一个足以证明模型总体能力的 benchmark。它只说明,在需要遵守风格约束、维持主题一致、少给人添返工的任务里,体验差异可能比排行榜上的一个总分更直接。对企业来说,真正该记录的字段包括:初稿是否抓住任务要求,编辑要改多少处,模型能否在反馈后保持方向,以及换模型时已有工作能否迁移。否则,所谓模型选型只是把审美和返工成本藏在测试表之外。
这是 Mollick 原帖里的任务描述和判断:
正在加载内容卡片…
三个半月之后,安全负责人还剩多少准备时间
Mollick 同日在另一条原创中写道,假设中国政府仍会允许发布开放的 Mythos-class 模型,同时假设美国和英国所说的这类模型风险判断成立,那么企业 CISO,也就是负责信息安全的高管,已经没有太多时间准备。他说自己的时间线判断在三个月半之后看起来仍然成立。3
这段话必须按条件句来读。原帖没有说明 Mythos-class 对应哪一个公开型号,也没有给出美国或英国风险判断的文件,更没有断言某个模型一定会发布。它的增量在于把安全问题从模型能力争论移到了组织准备:如果能力释放速度快于企业的权限管理、代码审查、数据隔离和应急回滚,安全部门等到产品真的进入组织后再补课,就会被动。
所以,今天能做的并不是据此预测下一款模型,而是把条件拆成预案。哪些权限必须默认关闭,哪些任务必须保留人工确认,哪些日志要能追溯到具体模型版本,哪些高风险流程需要在模型切换时重新验收,这些工作都不依赖 Mythos-class 是否最终出现。Mollick 的判断有争议,准备工作却可以先按最坏的可验证条件排演。
原帖如下,读者可以区分其中的假设和结论:
正在加载内容卡片…
Marcus 把政策争议指向利益冲突
Gary Marcus 当天把话题从模型路线拉到华盛顿。他先列出 AI 相关的多重风险,包括地缘竞争、失业、网络犯罪、虚假信息、开放源代码的复杂性和失控 AI,随后给出自己的判断:在特朗普政府看来,最高优先级是保护 Josh Kushner 对 OpenAI 的数十亿美元投资,而且不惜代价。4
这是 Marcus 的政治指控,不是已被独立材料证明的行政政策事实。它的价值在于把通常混在一起的两件事拆开:政府是否在处理公共风险,和具体监管安排是否会让某些投资者受益。前者需要看正式政策、机构行动和公开理由,后者则涉及利益关系与决策过程,不能因为一条高互动推文就直接下结论。
Marcus 还发文说自己花了整个周末思考美国应如何应对中国,并指向一份图文方案;但该帖文字没有展开方案内容,因此只能确认他提出了这项讨论,不能替他补出政策主张。5
今天该盯的不是单一排名
Mollick 看到的是能力曲线里的不稳定:模型可能突然跳高,也可能回到平均水平;他看到的还是准备窗口,企业不能把安全工作押在未来某次发布之后。Marcus 则追问政策账本,谁在承担失业、网络犯罪和失控风险,谁又可能从具体安排中获益。
三条判断不能拼成一个确定的行业结论。它们更适合变成三项检查:模型测试看重复性和返工,不只看一次胜出;安全计划按条件假设提前演练,不等待型号坐实;政策讨论把正式行动、利益关系和个人指控分开。AI 的当前指标会变化,真正需要跟踪的是变化能否持续,以及组织和制度有没有跟上。
相似内容
- 登录后可发表评论。
More from this channel›
- Opus 5 的 30% 之后:榜单、长任务和模型入口开始分叉
- Agent 已经能替人做事,市场却还在卖想象:Mollick 与 Marcus 的 24 小时
- 谁来决定模型怎么做?Mollick 与 Marcus 追问 AI 的控制权
- 模型开始进入真实系统,旧工作流却还没跟上
- 模型会变便宜,AI 的价值还剩在哪一层?Chollet、Marcus 与 Mollick 的分歧
- Agent 已经会动手,AGI 还缺哪张证据表?Mollick 与 Marcus 的最新观点
- 模型分数之后,AI 还要回答什么?Sama、Mollick 与 Marcus 的同日交锋
- Sama 要用户赢,Mollick 盯展示偏差,Marcus 追问 AI 的价格账本
