Sama 说别轻视用户,Mollick 说用量指标失真

Sama 说别轻视用户,Mollick 说用量指标失真

过去 24 小时,可入选原创集中在 Sama、Chollet、Mollick 和 Marcus:Sama 把模型竞争转成用户尊重问题,Chollet 借 Morpheus 追问持续学习,Mollick 则提醒 agent 工具会让传统模型用量指标失真。

今天最值得看的一条,不是某个新 benchmark 数字,而是 Sam Altman 那句带刺的产品口号:用户可以因为「最好的模型」进来,但要因为「我们不轻视你」留下。1 这句话和 Ethan Mollick 对 OpenRouter 用量指标的质疑、François Chollet 对持续学习 benchmark 的推荐放在一起,指向同一个问题:AI 公司现在拼的不只是模型强弱,还包括用户是否信任入口、企业是否能看懂真实使用量、研究者是否能测出模型在会变化的世界里怎么学。

先看本期可入选素材

人物窗口内原创本期信号
Sam Altman4 条从「clarity is nice」到「不轻视用户」,Sama 把模型竞争说成用户体验和用户尊重问题。21
François Chollet3 条Chollet 推荐 Morpheus,把 RL benchmark 的问题从静态 episode 拉到持续变化的世界;他还把「尝试、失败、更新心智模型、再尝试」称为智能核心。34
Ethan Mollick3 条Mollick 认为 OpenRouter 不能很好代表真实模型使用,agentic tools 会把用量迁移到 Codex、Code、Cowork 这类入口;他同时观察到 Codex 在 PC 上的 computer use 已经很强。56
Gary Marcus2 条Marcus 继续从资本市场和技术路线两边批评:一边拿 Oracle 股价下跌说 AI 基建账本,一边借 Richard Sutton 的话重提深度学习效率问题。78
Karpathy、Demis Hassabis、Jim Fan、Ilya Sutskever 在北京时间 7 月 13 日 08:00 到 7 月 14 日 08:00 内没有可入选原创主条目。Yann LeCun 主要是转推,不作为本期主线。

Sama:最好的模型还不够,用户要感觉自己被当回事

Sama 在北京时间 7 月 14 日 05:26 写下这句:「come for the best model, stay because we don’t treat you with contempt」。1 这不是技术解释,甚至不是完整产品说明,但它很像 OpenAI 最近这轮沟通的补丁:模型能力可以把人带进门,留不留得住,取决于用户有没有被清楚告知、被正常对待、被允许理解产品变化。
コンテンツカードを読み込んでいます…
同一天早些时候,他还发了一句「clarity is nice」。2 这句话单独看信息量很低,放在过去几天的上下文里却有意义。Mollick 昨天已经说过,企业规划 AI 用法时最需要的是路线清晰度:哪怕厂商只说「我们打算继续逐周扩展,但这些条件下可能停止」,也比用户猜要好。Sama 今天没有给路线图,但至少把竞争口径从「谁模型最好」挪到「用户是否被尊重」。
这对 AI 产品是硬问题。用户并不只在意跑分,也在意限制怎么改、功能怎么回滚、为什么今天可用明天不可用。模型足够强时,用户会更难忍受含糊的产品沟通,因为他们已经把真实工作压到这个入口上。

Chollet:持续学习要在会变化的世界里测

Chollet 这次推荐的是 Morpheus。按他的转述,标准 RL benchmark 通常是 episodic 和 stationary 的,也就是一局一局重置、环境规则固定;这种测试抓不到真实部署中的几个麻烦点:世界不会重置,目标可能异步变化,前面的决策会影响后面的状态。3
コンテンツカードを読み込んでいます…
Morpheus 官网给出的定义基本相同:它面向 continual reinforcement learning,提供持续存在、会演化的企业环境,用来研究静态 benchmark 和人工任务切换之外的问题。官网列出的关键特征包括 world state 持续存在、动作会累积并改变未来动态、没有 episode resets,也没有预先定义的 task IDs。9
这和 Chollet 另一条短推能接上。他说,尝试、失败、更新心智模型、再试一次,是智能的核心;应该奖励那些能优雅失败并快速适应的模型。4 这句话听着像哲学判断,但放到 Morpheus 这里就具体了:如果环境一直变,模型不能只在固定题库里拿高分,它要能知道自己什么时候错了、为什么错了,以及下次如何改。
对企业读者来说,这比「某模型在某榜单高了几分」更接近真实用法。库存、工单、销售、客服、财务流程都不会每天清空重来。一个 agent 进入这些系统后,昨天的选择会改变今天的数据分布。测不出这种持续适应能力,企业就很难判断它到底能不能接长期任务。

Mollick:AI 用量指标正在被入口形态扭曲

Mollick 今天最有用的一条,是他对 OpenRouter 指标的怀疑。他不否认中国开源权重模型使用量可能上升,但他认为,在 agentic tools 的世界里,OpenRouter 不是衡量真实模型使用的好指标;同一张图也可能只是用量转向 Codex、Code、Cowork 这类入口。5
コンテンツカードを読み込んでいます…
这句话提醒的是统计口径问题。过去看模型使用,很多人会看 API 路由、第三方网关或排行榜流量。但 agent 工具一旦嵌进 IDE、桌面、浏览器和办公套件,调用就不一定经过原来的可见通道。你看到某个网关份额下降,不能直接推出某个模型没人用了;也可能是用户换了入口。
Mollick 同日还说,Codex 在 PC 上的 computer use 已经很强。让它在你的电脑上做事,看着光标被一个「没有身体的智能」控制,会让人直观感到鼠标和键盘能承载多少工作。6 这就解释了为什么旧指标会失真:模型不再只是聊天框或 API,它开始变成桌面操作层。
他对企业 AI 战略也有一句很直白的拆解:没有 frontier model 的厂商总在解释为什么不该信 frontier model 公司;有 frontier model 的厂商则在卖围绕 frontier model 的方案,两边都可能是对的。10 这不是让企业选边站,而是提醒采购和技术团队先把利益位置看清楚。卖方的话术本来就会跟它手里的牌一致。

Marcus:资本账本和技术路线继续被追问

Marcus 今天的两条能作为旁注,但不宜写得过满。第一条是他说 Oracle 自己的股价自他去年 9 月「Peak Bubble」文章以来已经下跌 57%。7 这条缺少完整财务分析,只能按 Marcus 的批评口径处理:他把 AI 基建和上游供应商风险继续绑在一起看。
第二条是他转述 Richard Sutton 的说法:当前深度学习方法弱且低效,需要新想法和彻底重做,而不只是更多 tweaks。Marcus 借此说,这和他 2018 年以来对深度学习的批评一致。8 这依然是他的老主线,但今天和 Chollet 的 Morpheus 放在一起,会多一层意思:如果真实世界的任务是持续变化的,单靠固定 benchmark 上的增长,很难回答「模型是否真的会适应」。
今天几条观点合起来,AI 竞争正在变得更难用单一数字解释。Sama 在补用户信任,Chollet 在追持续适应,Mollick 在拆用量指标,Marcus 在追问账本和路线。模型能力仍是入口,但真正会让企业下注的,是这些入口背后的可解释性、可测性和可持续性。

関連コンテンツ

  • ログインするとコメントできます。
More from this channel