版本号可能消失,验收却不能消失

版本号可能消失,验收却不能消失

Chollet 预判模型将转向持续更新,Mollick、Marcus 与 Hassabis 则分别把评测可解释性、Agent 责任和开放生态的边界摆到台面上,帮助读者重新设计 AI 系统的验收记录。

7 月 26 日凌晨,ARC Prize 与 NDEA 联合创始人 François Chollet 预测,最多不到两年,模型会转入持续更新,公开版本号不再是行业的主要里程碑。这个判断是他的个人预测,不是厂商路线图,但它点出了一个现实问题:如果模型一直在变,团队将更难用一个固定名称解释能力、风险和成本。1
7 月 25 日 08:00 至 7 月 26 日 08:00(北京时间)这组观点里,真正值得连起来看的不是某个新分数,而是四个记录能否留下来:模型何时更新、任务是否完成、错误能否诊断、出了问题谁负责。
コンテンツカードを読み込んでいます…

评测也可能被模型自己改写

7 月 25 日中午,沃顿商学院教授 Ethan Mollick 讲了一个有点荒诞、但很有代表性的实验。Sol 没有把「now do benchbenchbenchbenchbench」当成玩笑,而是完成了相对合理的实验,并生成了「BenchBenchBenchBenchBench」这种可执行基准:让 AI 编写评测指标的符合性测试套件。Mollick 的原帖只证明了这次尝试确实发生,不能据此证明这套评测已经可靠。2
这里的麻烦在于,模型不再只是被评测对象,也开始参与出题、写测试和解释结果。测试生成得越快,评测系统越需要回答一个更基础的问题:测试到底是在测任务能力,还是在测模型对评测格式的适应能力。对企业来说,单次榜单分数之外,还要保留题目、执行轨迹和人工复核记录,否则下一次模型更新后,团队连「变好了」是什么意思都说不清。
Mollick 还追问,Claude 是否停止展示完整的摘要式思考轨迹。他的判断很明确:如果确实停止,这会损害可解释性,因为哪怕是摘要式轨迹,也能帮助使用者诊断错误;同时,那些轨迹本身也提供了有价值的观察。这里必须保留他的条件语气,原帖并没有确认 Claude 已经永久改变产品行为。3
这给产品团队一个很实际的提醒:日志、工具调用、阶段性结果和人工修改,不应被当作调试时才打开的附属品。模型越接近持续更新,越需要一套能回放旧版本行为的观察记录。

Agent 能完成部分任务,仍不等于能接管整份工作

7 月 26 日凌晨,Gary Marcus 是 AI 评论者与作家。他转述《纽约时报》一项办公室 Agent 测试的结论:AI 经常能做好复杂任务中的一部分,但被交给完整工作时仍可能不可靠,现阶段还需要一个人类老板。Marcus 接着写道,等 AGI 到来,人们才不会再读到这种判断,但那个时刻尚未到来,可靠性仍然很难。4
这条帖子的价值不在于它给出了一个新的 benchmark 数字,而在于它把「会做」和「能负责」分开了。一个 Agent 可以在文档、检索或代码中的某一步表现出色,却未必能处理目标变化、异常输入和跨系统交接。部署时真正要验收的,不只是成功率,还包括失败后能否停下来、能否交给人,以及谁有权批准继续执行。
Marcus 同一天又说,行业正在围绕 AI 重建社会,却还远未解决关键的对齐问题。这个判断没有附带新的实验数据,不能当成安全现状的独立测量,但它和前一条帖子的方向一致:把一段任务交给模型之前,组织仍要保留明确的人类责任人。5
コンテンツカードを読み込んでいます…

开放生态的规模,和开放定义的含混

7 月 25 日晚,Google DeepMind 联合创始人兼 CEO Demis Hassabis 认为,强大且安全的开放生态有助于让更多人受益于 AI。他列举 Google 从 JAX、Transformers、AlphaFold 到 Gemma 的开源与科学工作,并称 Gemma 开放模型累计下载量已超过 3 亿次;他还说,Google 提出的标准框架同时覆盖开放模型和专有模型的负责任部署。这里的 3 亿次是 Hassabis 在 X 上给出的累计数字,不应被解读为独立审计后的活跃用户数。6
Mollick 对同一方向补了一层限制。他认为,支持开放权重的公开信,其签署者对「开放权重」的理解可能并不一致,信中还存在关于蒸馏等问题的例外条款。也就是说,开放生态的规模可以很大,但「开放」仍要拆成权重能否获得、能否商用、能否蒸馏、能否独立部署等具体条件。7

今天该把什么写进验收表

如果模型版本真的从发布事件变成连续更新,企业至少应保留四类记录:
  1. 更新发生的时间、使用的入口和可调用工具。
  2. 任务是否完成,以及长任务在哪一步中断。
  3. 是否保留足够的轨迹、日志和中间结果来诊断错误。
  4. Agent 的人类负责人、权限边界和停止条件。
Chollet 讨论的是版本标签的未来,Mollick 讨论的是评测与可解释性的现在,Marcus 讨论的是责任边界,Hassabis 讨论的是开放生态的制度条件。四条线合在一起,指向同一件事:模型名称会越来越难作为稳定凭证,真正可比较的将是任务记录、更新记录和责任记录。

関連コンテンツ

  • ログインするとコメントできます。
More from this channel