AI 今日速览:Agent 开始碰到权限、算力和安全边界章节1×0:00手机 Agent 的权限边界2:31跨机房推理的接力赛6:20当 Agent 进入攻击链9:48小模型先学会把活干完0:0013:120:00主播今天先看一个看起来像产品更新,实际上会影响整个 AI 手机生态的变化。晚点LatePost 7 月 17 日报道,新一代豆包手机助手不再走过去那条让 AI 读取屏幕、模拟点击、像人一样操作应用的路线。只有微信、淘宝、支付宝等应用自己提供 MCP 服务,开放部分数据和操作能力,豆包手机才能接入。 这件事的背景是,豆包手机助手在 2025 年 12 月发布技术预览版时,曾经尝试让用户用一句话去点外卖、搜小红书,甚至操作游戏。微信、淘宝、支付宝和一些银行客户端随后封禁了相关功能,豆包也下线了对应场景。应用厂商担心的不是 AI 能不能点击,而是它绕开既有接口后,会碰到风控规则、数据边界和应用入口的控制权。 现在的转向很明确,手机助手负责理解用户意图,应用自己决定开放什么接口。晚点LatePost 以荣耀和微信的合作举例,手机助手向微信发起调用,微信完成消息发送或通话发起,再把结果返回,助手看不到微信界面内容。文章还提到,新一代豆包手机的备货量从此前的 3 万台提高到数十万台,7 月 15 日,豆包手机助手软件拿到了一项生成式人工智能服务备案。这些是报道和相关人士分析,不等于产品已经获得所有应用的接入。 从晚点Latepost 的报道看,这个转向不是把 Agent 的能力做小,而是把调用链拆得更清楚:手机助手负责理解意图,应用负责确认权限、执行动作和返回结果。对应用厂商来说,可以只开放查询,不开放修改;可以只开放某个功能,不开放整个页面;出了问题也更容易追踪是哪一次调用、哪个权限出了问题。对手机厂商来说,真正的竞争点就从「能不能模拟人」变成了「能不能让更多应用愿意接入」。 对普通用户来说,未来的 AI 手机可能少一点「什么都能替你点」的演示,多一些「这个应用明确允许 AI 做什么」。对开发者来说,MCP 之类的接口不只是技术规范,也会变成权限设计和商业谈判的一部分。手机 Agent 能不能用,最后取决于应用愿不愿意把动作和数据拆出来交给它。2:31主播第二条来自机器之心,关注的是 Agent 背后的基础设施。机器之心 7 月 20 日报道,无问芯穹在 WAIC 发布跨集群异构的 PDD 推理架构。这里的 PD,指的是大模型推理里的 Prefill 和 Decode 两个阶段。前者更吃计算,后者更吃显存带宽和持续访问。把它们拆开,是为了让不同硬件各做擅长的部分;再把它们放在不同机房,就可以调度分散的异构算力。 麻烦在于,Prefill 产生的 KV Cache 很大,要把它从一个机房搬到另一个机房。机器之心文章引用的测试里,在总长度 64K、前缀命中率 90% 的场景,同机房 PD 分离的 P50 首 token 延迟平均约 4.2 秒,解码搬到另一座城市后约 6.7 秒。尾部延迟更难看,未优化的跨集群方案 P90 是 18.3 秒,P99 是 29.7 秒。这里的重点不是平均值,而是少数慢请求会直接破坏服务体验。 PDD 的结构是三段式。Prefill 在集群 A 计算,集群 A 里的 Relay Decode 先拿到 KV Cache,几十毫秒就开始输出;远端集群 B 的 Main Decode 同时通过广域网络接收完整状态。等远端状态到齐,Relay Decode 不把整段新增 KV Cache 搬过去,只交接已经生成的 Token ID,让远端自己重算增量状态。传输的数据小很多,短暂的本地计算用来掩盖网络等待。 PDD 之所以能把这件事做成,前提是它没有把所有请求一视同仁。机器之心文章提到,真实 Agent 负载里,大约 70% 的请求输出长度低于 500 个 Token,而很多请求的前缀命中率很高。论文观察到,约 70% 到 80% 的请求命中率超过 95%。高命中请求需要跨机房传输的数据很少,可以更快到达;低命中请求则单独处理。系统把大多数容易处理的请求和少数异常请求分开,才有机会把平均可行变成尾部也能用。 文章还给了一个很直观的交接对比。100 个 Token 的增量,如果直接在广域网上传 KV Cache,负载约 4649 KB,平均延迟 185 毫秒,峰值达到 512.6 毫秒;如果只传 Token ID,负载只有 1.5 KB,平均延迟虽然是 305 毫秒,但最大延迟压到 321.4 毫秒,标准差只有 4.8 毫秒。前一种偶尔更快,却更容易抖;后一种多算一点,换来稳定。 对云服务商和大模型应用,真正该看的就不再是某张卡的峰值算力,而是前缀缓存、路由、网络和模型推理能不能一起调。机器之心文章把这种思路概括成「让偏科的芯片做擅长的事」。这比再买一批完全相同的卡更像一个运营问题,业务流量怎么变,P、Relay Decode 和 Main Decode 的配比也要跟着变。 它的适用条件也写得很清楚:Agent 和多轮对话通常有较高的前缀命中率,文章提到平均可以达到 90%,但不同业务会变化。PDD 还要处理低命中率和超长输入、超短输出这类异常流量。对企业来说,这类技术的价值不是把模型突然变聪明,而是把原本零散、偏科、跨地域的芯片资源变成可计费的推理服务。Agent 越常调用工具,基础设施就越需要盯住尾部延迟和单位 Token 成本。6:20主播第三条的风险更直接。新智元 7 月 20 日报道,Hugging Face 的部分生产基础设施在一个周末遭到入侵,留下超过 1.7 万条操作日志。新智元转述的事件链是,攻击者上传恶意数据集,串起远程代码数据集加载器和数据集配置里的模板注入,让代码在处理节点执行,之后提权到节点级,获取云和集群凭证,并横向移动到多个内部集群。 文章的关键判断是,这次不是人类坐在键盘前逐条操作,而是一群短生命周期沙箱组成的智能体集群并行推进。命令与控制信道还会迁移到公共服务上。Hugging Face 判断它大概率搭在某个智能体化安全研究框架上,但背后具体用了哪个大模型,仍然未知。这里要把已知和未知分开,攻击过程的自动化程度是文章报道的重点,攻击者身份、模型来源和全部影响范围并没有在这篇文章里被确认。 更有意思的是,发现异常和复盘也用了 AI。新智元写到,Hugging Face 的安全遥测分诊本身使用了大模型,相关信号帮助发现入侵;之后又用分析智能体处理 1.7 万多条事件,重建时间线、提取失陷指标,原本可能要几天的工作被压缩到几个小时。可是第一轮分析用的商业模型 API 又因为安全策略,拒绝处理真实攻击命令和漏洞载荷,于是团队改用自家基础设施里的开源模型,避免凭证和攻击数据离开本地环境。 新智元还写到,攻击者的动作并不是一次性完成的,而是由一大群短生命周期沙箱并行推进。它们可以让命令与控制信道迁移、寄生在公共服务上,这意味着传统的「找一台被入侵的机器」不够了,调查者还要找数据集、处理节点、凭证和服务间的关联。对使用开源模型、数据集和训练脚本的团队,供应链检查至少要覆盖数据集加载时会不会执行远程代码,模板和配置是否会进入解释器,实验节点能拿到什么凭证,以及处理节点能不能访问生产集群。 这件事还暴露出安全工具的两难。商业模型的安全策略是为了避免生成攻击内容,但安全团队在取证时又必须分析真实的命令和载荷。如果所有材料都送到外部 API,调查本身可能扩大泄露范围;如果完全不用模型,面对上万条日志又会慢很多。更合理的做法,是把敏感日志留在自己的环境里,用权限受限的本地模型辅助检索和归并,再由人确认高风险结论。新智元文章里「换成自家基础设施的开源模型」这一处理,正好说明了这条边界。 开发者应该从这里得到一个很具体的动作:不要把数据集当成只有内容的文件,也不要因为来自一个常用平台就默认安全。检查加载器是否会执行远程代码,限制训练和处理节点的凭证权限,轮换访问令牌,把生产网络和实验环境隔开。Agent 可以帮忙查案,但它也可能把攻击规模、速度和持续时间一起放大。9:48主播最后看一条更偏研究和产品结合的消息。量子位 7 月 20 日报道,面壁智能在 WAIC 开源 MiniCPM-Robot 系列,包括 1.5B 参数的 MiniCPM-RobotManip,以及 0.9B 的 MiniCPM-RobotTrack,同时开源 PhyAI 推理框架。 RobotManip 面向机械臂操作。量子位文章提到,它在 LIBERO、Calvin、RoboTwin2 等评测中进入第一梯队;在考察上下文记忆的 RMBench 中,文章给出的分数约为 53,而 π0.5 约为 10。单帧推理对比里,H100、bf16 条件下,RobotManip 约 120 毫秒,π0.5 约 234 毫秒。RobotTrack 面向机器狗跟踪和导航,文章给出单目标、多人干扰、模糊目标三类追踪率,分别是 89.8%、73.4% 和 80.4%。这些都是量子位转述的发布方和评测口径,真实部署仍要看硬件、数据和场景。 量子位文章还特别强调了机器人输入的特点。一台双臂机器人可能同时接收两个腕部相机、一个主视角相机、一段文字指令和动作历史,而且一秒要重复几次。如果每帧画面都被转成大量视觉 Token,任务越长,历史越难保留。MiniCPM-RobotManip 通过压缩视觉 Token 和流式计算,复用已经处理过的信息,避免每次都从头计算。对机器人来说,记忆不是为了聊天更连贯,而是为了知道三明治已经放了几层、按钮已经按了几次、什么时候应该停。 RobotTrack 的本地运行也有实际意义。文章写到,它不需要额外的开发板,只用宇树 Go2 Edu 的原装摄像头和本地算力,就能处理单目标跟踪、多人干扰和模糊指令。端到端响应约 180 毫秒,稳定达到 5Hz 以上。PhyAI 则把环境安装、模型加载、摄像头接入、文本输入和控制接口串起来,降低一次新模型适配硬件的成本。对企业客户来说,这些工程细节往往比发布会上的动作演示更接近采购标准。 这不代表小模型已经解决了具身智能。量子位文章也引述了面壁科学家的提醒,很多机器人 Demo 会围绕单一任务采集大量数据,再进行针对性优化,展示效果不能完全代表基础模型的真实进度。真正需要继续观察的是,模型换一个机器人、换一个摄像头、换一个仓储流程后,是否仍然稳定;还有失败之后,系统能不能重试和恢复,而不是只能重新启动。 把四条消息放在一起,Agent 的落地路径比「模型更强」复杂得多。手机上,它要拿到应用明确授权;云端,它要在尾部延迟和算力成本之间做调度;安全上,它既能查攻击,也能成为攻击的执行层;到了机器人身上,它还要足够小、足够快,能在本地把任务做完。下一步继续看原文时,优先核对四类数字的测试条件,以及产品是否真的开放了接口,而不是只看演示标题。