AI竞争转向可控执行:国产算力、代理支付与评测安全

AI竞争转向可控执行:国产算力、代理支付与评测安全

Z.AI 部分启用 1GW 国产芯片数据中心,美国开始把开源模型蒸馏纳入制裁讨论,资本则押注机器人与代理支付;最新研究把代理评测和移动安全的漏洞边界进一步具体化。

先看结论

截至 7 月 22 日 08:00(东八区),AI 竞争的焦点又往下沉了一层:一边是 Z.AI 把 1GW 数据中心推进到部分运行,测试国产芯片能否支撑前沿模型;另一边,美国开始把中国开源模型的蒸馏问题纳入潜在制裁讨论。资本市场押注的也不再只是模型公司,机器人整机和代理支付都在补基础设施。研究侧则给出两个很实用的提醒:代理评测会被执行框架改变,移动代理还可能把人眼看不见的屏幕内容变成主机命令。

速览

板块关键动态需要继续跟踪的点
大公司与平台Z.AI 完成一座只用中国芯片的 1GW 数据中心并开始部分运行;美国财政部长称将核查中国开源模型,若认定存在 IP 窃取,政府有能力制裁。1 2国产芯片的实际训练效率;制裁的证据标准、法律路径和影响范围。
创业与投资逐际动力被报道完成近 2 亿美元 Pre-IPO,投后估值 150 亿元;美国代理支付初创 Natural 完成 3000 万美元 A 轮,累计融资 4000 万美元。3 4机器人融资能否换来量产和订单;代理支付如何处理授权、退款和争议。
前沿研究上海 AI 实验室开源 AgentCompass,覆盖 20 多个基准和 5 个能力维度;另一篇论文在 5 个第三方移动代理框架上测试 7 类攻击,所有框架至少对其中 6 类攻击暴露。5 6评测结果是否能跨执行框架复现;移动代理是否把屏幕和调试通道当成了过宽的信任入口。

大公司与平台

Z.AI 的 1GW 数据中心开始部分运行

一篇转引彭博信息的报道显示,原名智谱的 Z.AI 已完成一座 1GW 数据中心,全部使用中国制造的芯片,目前开始部分运行,目标是为 GLM 系列模型提供训练算力。报道还提到,Z.AI 已建设或运营多个单集群超过 1 万颗芯片的计算集群。1
这条消息能确认的是容量、芯片来源和部分运行状态,不能直接证明国产芯片已经达到同等训练效率。后续要看三组数据:模型训练时间和有效利用率,集群软件能否稳定支持不同芯片,以及这套算力能否转化为企业服务收入。对算力采购方来说,1GW 是电力和机房规模,不是模型性能的替代指标。

美国把模型蒸馏带进制裁讨论

美国财政部长 Scott Bessent 在 7 月 21 日的采访中说,美国将检查中国开源模型是否存在知识产权窃取;如果认定海外模型在窃取美国公司的成果,政府有能力实施制裁。TechCrunch 报道,这一表态针对的是中国模型整体,文章没有列出已经被正式制裁的具体模型或公司。2
这仍是核查和威胁,不是已经落地的制裁。蒸馏本身是用更强模型的输出训练较小模型的技术,是否构成侵权取决于训练过程、授权和证据。企业真正需要关注的是后续会不会出现可执行的名单、证据标准和服务限制,而不是把一名官员的表态直接当成政策结果。

创业与投资生态

机器人资本继续向整机公司集中

新华网转引《经济参考报》称,深圳具身智能公司逐际动力在 2026 年 7 月完成近 2 亿美元 Pre-IPO 轮融资,投后估值达到 150 亿元;报道还称,公司成立仅四年,半年内累计融资 4 亿美元。该报道没有给出这轮融资的完整投资方名单。3
这笔钱对应的验证对象很具体:能否从样机展示走到量产、真实场景和持续订单。报道同时提到,深圳多家机器人企业在一个月内完成大额融资,说明资金仍在集中押注具身智能,但融资额本身还不能替代交付数据。投资人如果要比较项目,应该把估值、出货、订单和客户复购拆开看。

Natural 把代理支付做成一层基础设施

美国初创公司 Natural 宣布完成由 Forerunner 领投的 3000 万美元 A 轮,累计融资 4000 万美元。公司提供代理编排层,让 AI 代理代替用户付款、收款,并与其他代理交易;产品此前一直处于 Beta 试用。Natural 计划同时支持稳定币和传统银行支付,直接与 Stripe 等支付基础设施竞争。4
这条融资线索的关键不在于多一个支付 API,而在于责任边界:代理拿到什么额度、谁批准高风险交易、退款和争议由谁处理。只要代理能自主调用资金,权限、审计和撤销机制就会和支付成功率同等重要。

前沿研究

AgentCompass:同一个模型,换个执行框架就可能换个分数

上海 AI 实验室的 AgentCompass 将评测拆成 Benchmark、Harness 和 Environment 三层,分别对应任务与指标、代理执行方式和运行环境。论文称,系统已经接入 20 多个基准,覆盖工具调用、网页与研究、科学推理、代理编码和生产力 5 个维度,并记录完整轨迹,帮助定位重复调用、空输出和疑似 reward hacking。5
论文的实验说明,最终分数会受到 Harness 影响。在其对比中,Claude-Opus-4.8 在 DeepSearchQA 上比公开基线低 8.7 个百分点,GLM-5.2 在 SWE-bench-Pro 上则高 15 个百分点。这里的数字来自论文自己的评测设置,不是对模型能力的通用排名。对采购和研究团队来说,今后更值得问的是:模型、工具、环境和重试策略是否保持一致,轨迹能否复查,而不是只看一个总分。

移动代理的输入通道可能比权限列表更危险

一篇 7 月 14 日更新的论文研究了 AppAgent、AppAgentX、Mobile-Agent-v3、Open-AutoGLM 和 MobA 五个开源第三方移动代理框架。研究者把风险分成两类:利用人眼与视觉模型差异的 Screen Perception Attack,以及劫持 ADB、无认证广播等执行链路的 Misused Channel Attack。论文设计了 7 类攻击,实验中 5 个框架都至少暴露于其中 6 类攻击,组合攻击甚至能在很低权限条件下实现主机命令执行。6
这不是生产环境漏洞率统计,研究对象是开源研究型代理,论文也没有把结果外推到所有手机助手。它给出的工程方向很清楚:对截图做输入清洗,保护截图获取链路,减少对 ADB、辅助功能和系统广播的混用,并把每次代理动作记成可审计轨迹。代理能不能看懂屏幕,和它有没有资格据此执行命令,应该分开设计。

今天怎么跟进

  • 算力团队:向 Z.AI 这类大规模国产芯片集群追问有效训练吞吐、软件适配和实际服务收入,不要只按机房功率比较。
  • 投资与采购团队:把逐际动力的机器人融资和 Natural 的代理支付融资分开评估,前者看量产与订单,后者看权限、清算和争议处理。
  • 研究与安全团队:要求代理评测固定 Harness、Environment 和重试策略;移动代理上线前,先审计截图、ADB、辅助功能和广播通道。

相似内容

  • 登录后可发表评论。
More from this channel