
核心账号暂空:Mollick 找 AI 测量仪,Marcus 核对 Anthropic 利润表
本期核心追踪账号未见可纳入的窗口内原创长推,文章转向 Mollick 的 AI 行为实验与 harness 观点、Marcus 对 Anthropic 收入预测的利润质疑,以及 Chollet 对行业话语中身份焦虑的提醒,帮助读者把能力、组织和账本分开看。
核心账号暂空,问题转向测量与利润
截至北京时间 7 月 30 日 08:00,Sama、Karpathy、LeCun、Hassabis、Jim Fan 等核心追踪账号没有出现可纳入的原创长推。扩展人物给出的信号却很集中:Ethan Mollick 在研究如何把 AI 行为测出来,也提醒企业可以把生产力提升用于扩张,而不是只用来裁员;Gary Marcus 把 Anthropic 的收入预期拉回利润表;François Chollet 则认为,部分 AI 话语更像前沿实验室员工在处理身份和自尊,而不是在讨论技术能力。
Mollick:模型之外,harness 才刚开始被理解
Mollick 先后发了三条相关内容。第一条宣布实验室开源 AI Behavioral Observatory(AIBO),称它可以对不同提示词下的 AI 行为进行统计有效的测试 1。Wharton Generative AI Labs 对工具的说明更具体:研究者设置对照提示和处理提示,指定评分方法与重复次数,再比较输出。因为模型每次回答都会波动,单次演示不足以区分真实效果和噪声 2。
AIBO 还允许多个模型并行运行,使用更大、更丰富的刺激材料,并让 AI 工具检查原始回答、总结结果、标记不一致之处,再建议下一轮测试 2。AIBO 早期研究完成了约 28,000 次对话,针对单一模型;后续研究扩展到 126,000 次对话,并跨多个模型运行 2。这把模型评测从一次性 demo 推向了实验设计:先写假设,再安排对照,最后看结果是否能跨模型、跨材料重现。
第二条更短,却可能更接近企业真正会遇到的瓶颈:「Model + harness」。Mollick 说,人们几乎还没开始理解 harness engineering 的最佳方法,即使模型不再变强,也有大量尚未挖掘的潜力 3。这里的 harness 可以理解为围绕模型搭建的工具、上下文、权限、任务拆分和检查流程。AIBO 负责把行为测出来,harness 决定这些能力能否稳定进入工作流。
Loading content card…
第三条把技术问题落到了组织选择。Mollick 转发 Dan Shapiro 的「0%、50% 或 200%」框架,认为工作会因 AI 改变,但企业选择怎样改变并不确定:有的公司会把 AI 当成裁员工具,有的公司会扩大人的职责,让团队做更多、更好的工作 4。Shapiro 的原文把选择说得更直白:50% 是用一半的人完成原来的目标,200% 是把生产力提升换成更多产品、更高质量或更大的市场份额 5。
这几条内容连起来,Mollick 的重点不是「AI 会自动带来增长」。他是在提醒企业,模型能力、harness 设计和组织目标是三件事。只升级模型,却不改任务流程,可能只会得到更快的返工;只削减人数,则把本来可以用于扩大产出的能力直接变成成本节约。
Marcus:收入预测不能替代利润表
Gary Marcus 的新推文没有继续泛泛讨论泡沫,而是具体质疑 Anthropic 的收入叙事。他写道,Anthropic 的收入预测可能过于乐观:他提到 Q1 约 48 亿美元、Q2 预计 109 亿美元,并质疑在 tokenmaxxing 热潮和强劲中国模型竞争之后,公司能否完成全年超过 1000 亿美元的后续目标 6。
这些数字在本文中只能作为 Marcus 的论据,不应当被读成 Anthropic 已确认的财报。Marcus 的落点其实在第三点:长期问题是利润,而不是收入增长速度。他认为 Anthropic 最好的季度受一次性因素和高 token 消耗环境帮助,其他季度仍在亏损,第三季度表现也并不清楚 6。
这条批评和 Mollick 的 200% 选项形成了一个有用对照。把 AI 生产力用于扩张,必须回答新增收入从哪里来;把模型使用量换成收入,也必须回答每个 token 的边际成本、客户留存和利润率。前沿实验室可以同时拥有很快增长的收入和仍未解决的盈利问题,不能用前者替后者盖章。
Loading content card…
Chollet:先把技术讨论和身份焦虑分开
Chollet 的短推没有提供模型规格或评测数字,却提供了另一种筛选方法。他写道,当前相当一部分 AI discourse 讨论的不是技术能力,而是前沿实验室员工如何处理自己的自尊与身份 7。
这句话不等于所有前沿观点都只是心理投射,Chollet 也没有在这条推文里指向具体个人。它更像是在提醒读者,AI 讨论常把三类东西搅在一起:模型实际完成了什么,组织希望外界相信什么,以及从业者如何理解自己在这轮变化中的位置。AIBO 试图用重复实验拆出第一类,Marcus 试图用利润和成本检验第二类,Chollet 则把第三类摆到桌面上。
Loading content card…
今天这组观点的共同问题很具体:AI 的进步,究竟有没有进入可重复的行为、可持续的业务和可核验的判断。Mollick 要求给模型配上测量工具和工作 harness,Marcus 要求收入预测接受利润表检验,Chollet 则提醒我们先分清技术事实与身份叙事。对企业团队来说,下一步不是再找一句更乐观或更悲观的口号,而是把一次输出变成一组可复现的实验,把一次增长预期变成一张能承受成本追问的账。
References
- 1Ethan Mollick 发布 AI Behavioral Observatory
- 2From building an AI research tool to prompting the research itself
- 3Ethan Mollick on model and harness engineering
- 4Ethan Mollick on how work changes around AI
- 50%, 50%, or 200%
- 6Gary Marcus on Anthropic revenue projections
- 7François Chollet on AI discourse and identity
Related content
- Sign in to comment.
