
模型在降价,机器人开始协作:Sama、Hassabis、Mollick 与 Chollet 的 24 小时验收题
Sam Altman 把模型价格与延迟继续往下压,Demis Hassabis 把能力推向机器人动作与协作,Mollick 和 Chollet 则提醒企业:产能、人工基线、测试配置与成本披露才决定这些进步能否被验收。
本期窗口里,Sam Altman 和 Demis Hassabis 给出了两种很不一样的进展:前者把模型价格与延迟继续往下压,后者把模型能力推向机器人动作和复杂工作流。Ethan Mollick 与 François Chollet 随后补上了容易被发布消息跳过的验收条件:组织能不能接住更多产出,评测有没有人类基线,模型外面的
harness 是否公平,成本是否公开。Karpathy、LeCun、Jim Fan 和 Ilya Sutskever 在窗口内没有可纳入的原创长推,因此本文不拿旧内容填充。主线集中在一个更实际的问题:模型变便宜、机器人变灵活之后,企业究竟凭什么判断它真的产生了价值?
价格下降,模型开始像基础设施
Sam Altman 在 X 上宣布一组价格和速度调整:他写的是 GPT-5.6 Luna 输入每百万 token 降至 0.20 美元、输出每百万 token 降至 1.20 美元,降幅为 80%;GPT-5.6 Terra 降价 20%,输入和输出价格变为 2 美元和 12 美元;GPT-5.6 Sol 则新增 API Fast mode,速度最高可达原来的 2.5 倍,价格是原来的 2 倍,同时声称智能水平不变。1
这条信息里有三个不同的信号。第一,模型价格已经不只是在发布日制造话题,而是在不同档位之间重新切分。第二,速度被单独定价,说明对 Agent 或批量任务来说,等待时间正在成为和 token 成本同等重要的采购变量。第三,「同等智能、不同速度」是 Sam Altman 的产品表述,不是独立评测结论;读者不应把它直接换算成所有任务上的性价比提升。
Loading content card…
价格下降会让更多实验变得可行,却不会自动解决任务设计。一个模型每次调用便宜了,企业仍要回答:调用次数会不会因为更长的上下文和更多重试而反弹?快速模式节省的等待时间,是否足以覆盖两倍价格?如果没有这两张账,降价只是 API 账单上的好消息,还不是业务结果。
从 token 到动作:机器人把问题换了单位
Demis Hassabis 同期宣布 Gemini Robotics 2 上线。他描述的新模型套件可以「推理每一个动作」,处理过去做不到的任务,例如打出精细的结;机器人还可以组队解决复杂工作流。这里的能力、任务边界和效果数字都来自 Hassabis 的原帖,原帖没有给出独立 benchmark、成功率或部署条件。2
Loading content card…
这和 API 降价是同一条产业链上的两端。云端模型把单位从「一次调用多少钱」说清楚,机器人则迫使供应商面对「一次动作能不能完成」:视觉判断、连续控制、失误后的恢复、人与机器人之间的交接,任何一环出错,最后都要落到返工时间和安全责任上。
「团队协作解决复杂工作流」尤其值得单独看。它意味着评价对象可能不再是一台机器人完成一个孤立动作,而是多台设备或多个步骤如何接力。对采购方而言,下一步不该只问模型会不会打结,还要问任务失败时能否停机、回退、交给人处理,以及这些动作是否留下可复盘的记录。Hassabis 的推文只提出了产品方向,后面这些问题仍没有答案。
企业最先被击穿的,可能是承载能力
Mollick 把同一个问题从模型端拉回组织端。他写道,组织通常围绕一个狭窄的「人类生产力预期范围」搭建;产出太少当然有问题,但产出太多也可能同样糟糕,因为审批、人员配置和协作系统接不住。3
这比「AI 能让员工更快」具体得多。假设一个团队把报告、代码或客户方案的生成速度提高一倍,真正可能堵住的地方包括:审批人只有一个,发布窗口没有变,法务仍按原来的队列工作,销售和交付也没有能力承接新增需求。于是效率提升会先变成待审文件、待处理工单和更长的协调链。
Mollick 另一条体验记录也说明了接口不是装饰。他尝试用三种方式控制 Codex,觉得语音对讲设备 Ting 出人意料地好用;Codex micro 外形有趣,但相比 Stream Deck 能提供的信息太少。4 这不是一份通用产品排名,却说明新用途会逼出新的控制面:语音适合快速下达意图,实体按键适合密集状态反馈,漂亮的小设备未必适合需要持续观察的工作。
企业部署前,至少应把「模型变强」拆成三问:
- 输出送到哪里:生成结果进入审批、生产、客户交付,还是只停留在草稿区?
- 谁来吸收波动:模型偶尔多产、错产或重复产出时,哪一个岗位负责筛选和回退?
- 接口暴露什么状态:用户能否看见任务进度、权限、失败原因和下一步动作?
这三问的答案,比一次漂亮的演示更接近部署成本。
评测先回答:与谁比、用什么测、花多少钱
Mollick 还提醒,前沿 AI 的 benchmark 越来越复杂,评测正在丢掉一个基础维度:和人类比较。他认为,经过验证的 benchmark 应该有一个人类基线,最好是多个;建立这种基线越来越困难、越来越昂贵,但仍然重要。5
这条提醒会直接改变企业的验收表。模型得分提高,至少可能有三种解释:模型真的更擅长了,题目对模型更友好了,或者人类根本没有被纳入同一条件的比较。没有人类基线,团队很难知道自己是在购买超越人工的能力,还是在购买一张看起来很高的机器分数。
Chollet 则把问题推进到模型外部的
harness。这个词可以理解为围绕模型运行的配置、API 参数、上下文压缩和其他测试外壳。他为 ARC-AGI-3 写下边界:专门为解决该 benchmark 定制、或包含其格式与内容知识的 harness 不可以;没有为 ARC-AGI-3 特制、所有 API 用户都能使用的通用设置可以接受。不同供应商使用不同设置会带来可比性问题,但只要设置和成本清楚披露,他认为这种差异可以被接受。6Loading content card…
这里有一条很容易被忽略的采购原则:评测的对象从来不只是裸模型。真实系统有上下文长度、工具权限、压缩策略、延迟上限和调用预算。把这些配置藏起来,榜单分数就无法说明复现成本;把它们公开,读者才知道自己比较的是能力、工程包装,还是两者的组合。
结语:把进步翻译成一张验收表
四个人的观点并不一致。Sam Altman 在降低调用门槛,Demis Hassabis 在扩大动作与协作的能力边界;Mollick 提醒组织容量和接口会成为瓶颈,Chollet 则要求评测把人类、配置与成本写进记录。
把它们放在一起,今天最实用的结论不是「模型越来越强」,而是验收维度正在变多。模型价格要看实际调用和重试后的总成本;机器人演示要看动作失败后的恢复与责任交接;组织效率要看审批和协作队列是否能承受新增产出;benchmark 则要同时报告人类基线、
harness 配置和费用。只有这些变量被写出来,能力才有机会从发布消息变成可比较、可复盘、可采购的结果。Related content
- Sign in to comment.
