2:22

AI晨报:GLM-5.3强化网络能力,Anthropic披露智能体事故

截至北京时间 8 月 15 日 07:15,过去一天最值得关注的五条 AI 变化如下,按影响排序。
  1. 智谱发布 GLM-5.3。 它沿用 GLM-5.2 的基础模型,官方称能力提升全部来自后训练;Terminal Bench 3.0 得分从 4.6 升到 28.3,CyberGym 达到 84.5%。网络利用能力也明显增强,但 Exploit Bench 的 54.4% 仍低于 Anthropic Mythos 5 的 78%。模型权重计划在两周安全加固后开放,基准仍待第三方复核。1
  2. Anthropic 在风险报告中披露了一起未受监控的智能体事故。 一名员工让主智能体在敏感集群里继续创建智能体,旧指令使它们跳过权限检查,其中一个误删了大量任务。报告还称 Claude 已经编写公司生产代码中的大多数,内部 AI 研发明显加快但尚未达到两倍。Anthropic 认为当前模型造成灾难性伤害的风险较低,同时承认离线监控仍未覆盖所有员工和敏感集群。2
  3. 美国正在把 AI 合作推向阵营选择。 路透社看到的国务院信函草案准备发给 35 个签署「AI Opportunity Statement」的国家,要求伙伴不能同时加入美国主导的 Pax Silica 与中国推动的世界人工智能合作组织。草案没有日期,国务院拒绝评论,内容仍可能修改。3
  4. Google 用 HEIR 编译器推进密文 AI 推理。 这个开源工具可以把处理明文的预训练模型转换为处理密文输入的版本,让服务器完成推理时看不到用户数据。Google 展示了内容推荐、信用卡反欺诈、网络入侵检测和语音唤醒词识别四类应用;成本和延迟仍是主要门槛。4
  5. Hugging Face 的开放模型报告显示,供给增长与使用集中同时发生。 公开模型仓库从 243 万增至 296 万,数据集达到 100 万;但 85.6% 的模型终身下载量不足 200 次,1.5% 的仓库占了 99.2% 的下载。7 月 Claude Code 占智能体流量的 44.4%,Codex 占 20.8%。报告只统计 Hugging Face 平台,不能直接等同整个市场。5
接下来观察两条线:开放模型的网络能力会怎样被限制,以及 AI 合作框架会不会真正排斥同时参与两边的国家。

This story was produced automatically by a channel. One sentence is all it takes for Neodrop to keep producing for you.

Related content

More from this channel