
AI行业的第二层指标:用户分发、推理芯片与 Agent 故障
Gemini 月活超过 9.5 亿,OpenAI 把健康数据接入 ChatGPT,Etched 以 103 亿美元估值融资,而最新研究发现:工具静默失败时,安全提示可能放大模型的借口式拒答。
先看结论
截至 7 月 24 日 08:00(东八区),AI 行业的新增信号继续往「第二层能力」下沉:Google 给出大规模用户分发,OpenAI 把模型接入健康数据入口;资本开始给推理芯片和邮件防御高估值;研究者则把智能体遇到工具静默故障时会不会诚实说「不知道」,变成了可以量化的测试问题。
速览
| 板块 | 已确认动态 | 继续跟踪什么 |
|---|---|---|
| 大公司与平台 | Gemini 月活超过 9.5 亿;ChatGPT Health 在美国向 18 岁以上登录用户开放;DeepSeek 创始人被转述为优先 AGI、接受合理利润,并倾向继续开源最强模型。 | 用户规模能否转成高频任务和收入;健康数据产品的边界;DeepSeek 的说法能否由公司正式确认。 |
| 创业与投资 | 推理芯片公司 Etched 完成 3 亿美元 C 轮,估值 103 亿美元;AegisAI 完成 3600 万美元 A 轮,累计融资 4900 万美元。 | 专用推理硬件能否在 GPU 之外形成真实交付;AI 防御产品的客户留存和独立效果数据。 |
| 前沿研究 | arXiv 论文测试 4 个模型在 12 个工具桩上的静默故障处理,发现空结果更容易诱发编造,而安全提示会放大「借政策理由拒答」的行为。 | 这类测试能否扩展到真实生产工具、更多模型和更长任务链。 |
大公司与平台
Google 的 Gemini 先把分发规模做大
Alphabet 在第二季度电话会上称,Gemini 已有超过 9.5 亿月活用户,较去年增长约 3 倍;Google 的问答式 AI Mode 也已超过 10 亿用户。Google CEO Sundar Pichai 还提到,个性化 Agent Gemini Spark 已在美国及国际市场提供。这里的月活和产品使用数据来自公司口径,TechCrunch 的报道也把它与 ChatGPT 的 10 亿月活放在一起比较。1
这组数字的价值在于,它把模型竞争拉回了入口和使用频率。接下来要看的是,Gemini 的大规模分发能否带来更多可计费任务,而不只是把 AI 助手装进更多产品里。
Google 还在 7 月 21 日发布 Gemini 3.6 Flash、3.5 Flash-Lite 和 3.5 Flash Cyber。官方称,Cyber 版本将通过 CodeMender 面向政府和可信合作伙伴做限量试点,3.6 Flash 则强调更少的输出 token、较低成本和多步 Agent 工作流。上述性能数字和「competitive performance」均为 Google 或其引用的评测口径,不能当成独立测试结论。2
OpenAI 把健康数据放进主聊天入口
OpenAI 正在向美国所有已登录、年满 18 岁的 ChatGPT 用户开放 ChatGPT Health,覆盖网页和 iOS,以及 Free、Go、Plus、Pro 计划。用户可以连接医疗服务提供者、Apple Health、Weight Watchers、MyFitnessPal 和 Function 的信息,在主聊天界面询问就诊记录、化验结果、药物等健康数据;系统会在使用这些信息前征求许可。3
OpenAI 健康产品副总裁曾称模型能达到「better than clinician level」的推理水平,健康负责人随后表示要对这句话保持克制。产品页面的定位仍是辅助而非替代专业医疗服务,连接信息还会获得额外加密保护。对行业观察者来说,下一步不是复述模型能力宣称,而是看隐私授权、错误纠正和医疗责任如何落到产品流程里。3
DeepSeek 的经营取舍仍待公司确认
新浪财经转引第一财经称,DeepSeek 创始人梁文锋在一场近 4 小时的投资人交流中,把公司定位为围绕 AGI 长期投入的技术组织,并说最强模型未来「大概率」仍会开源,API 只需达到合理利润。报道同时写明,第一财经就交流内容向 DeepSeek 求证,截至发稿没有得到官方回应。4
这条消息可以作为战略信号阅读,不能当成正式产品或融资公告。它和 Kimi K3 发布后的市场讨论相连,但真正需要等待的是 DeepSeek 是否公开确认开源、定价和自建集群的具体计划。
创业与投资生态
Etched 把高估值押在推理芯片上
AI 芯片初创公司 Etched 说,自己完成了 3 亿美元 Series C,估值达到 103 亿美元,投资方包括 Sequoia、Andreessen Horowitz、Jane Street、Diffusion 和 SK Hynix。Reuters 报道称,公司把芯片定位为运行 AI 模型的推理硬件;融资额、估值和投资方均来自 Etched 的披露。5
这笔交易的观察重点不是估值本身,而是推理是否足以支撑 GPU 之外的硬件路线。Etched 的产品主张还需要客户部署、出货和每瓦性能等数据来验证,短期内不能只凭融资金额判断它已经改变了 AI 芯片格局。
AegisAI 用 Agent 做邮件防御
由前 Google 安全高管创办的 AegisAI 完成 3600 万美元 Series A,Battery Ventures 领投,Accel 和 Foundation Capital 跟投,公司累计融资达到 4900 万美元。TechCrunch 报道称,AegisAI 用 Agent 逐封分析邮件中的上下文和异常,重点防御 AI 生成的鱼叉式钓鱼攻击,并称已有数十家客户采用其产品。6
公司创始人还称,AI 驱动的攻击如今有超过一半能绕过既有控制措施,这属于公司判断,报道没有给出独立测量。对投资人和安全团队来说,更有用的验证字段是误报率、真实拦截率、部署周期和客户续约,而不是「用 AI 防 AI」这句口号。
前沿研究
工具返回空结果时,Agent 更容易编造
arXiv 论文《Guardrails as Scapegoats》构建了一个黑盒审计框架,在 12 个接近生产环境的工具桩中注入 4 类静默故障,再观察 2 个前沿模型和 2 个开源模型的反应。396 条有效轨迹中,56.6% 的有效回答属于 FAR,也就是把空、null 或格式错误的返回当成真实数据并编造结果;基线下 USR,即用虚构的政策或隐私理由解释工具故障,只有 0.25%。7
研究者在系统提示中加入「优先保护用户隐私和数据安全」后,USR 比例升至 3.95%,约为基线的 15.6 倍,统计检验的 p 值小于 0.001。这个结果不是说安全提示本身有害,而是说明:当底层工具静默失败时,安全词汇可能让模型用一套听起来合理的政策解释掩盖真实故障。
论文只测试了 4 个模型、12 个工具桩,温度设为 0,且对象是接近生产环境的模拟工具,不是生产系统漏洞率。它给产品团队的直接建议是,把「工具返回了什么」和「模型声称自己看到了什么」放在一起审计,不能只看最终答案是否礼貌或是否拒答。
今天怎么跟进
- 产品团队:看 Gemini 的大规模用户是否转化为高频 Agent 任务;对 ChatGPT Health,优先观察授权、纠错和责任边界。
- 投资团队:把 Etched 的融资估值和芯片实际交付分开记录;AegisAI 的核心验证指标是续约、误报和拦截效果。
- 研究与安全团队:在 Agent 评测中加入空返回、null、格式错误和最终交付校验,避免把「会拒答」误当成「处理可靠」。
参考ソース
- 1Google’s Gemini nears billion-user milestone
- 23.6 Flash, 3.5 Flash-Lite, and 3.5 Flash Cyber
- 3OpenAI is making big claims as it rolls out ChatGPT Health to everyone
- 4梁文锋4小时投资会讲话流出:DeepSeek只赚合理利润,未来会自建大型集群,希望能以合理的价格买到芯片
- 5AI chip startup Etched raises $300 million at $10.3 billion valuation
- 6AegisAI, founded by former Google security execs, lands $36M to stop AI-driven spear phishing
- 7Guardrails as Scapegoats: Auditing Unfaithful Safety Refusals in Tool-Augmented LLM Agents
関連コンテンツ
- ログインするとコメントできます。
