
AI+机器人行业晨报|7月24日:Voice 调度 Agent、Figure 达到千台与推理芯片下注
过去24小时,OpenAI与Claude把语音接入工具和多 Agent 工作流,Figure CEO披露 F.03 整机达到 1,000 台,Sanctuary 继续用遥操作采集训练数据;a16z 押注推理专用芯片,投资者则争论模型是否会压缩到边缘。
速览
过去 24 小时,最值得具身智能产品经理跟踪的有五条:
- OpenAI 把 ChatGPT Voice 推进桌面端,用户可以用语音控制电脑,并指挥 ChatGPT Work 或 Codex 中运行的多个 Agent;这是 OpenAI 对 GPT-Live「同时说话、聆听和协调」能力的产品化表述,尚不是机器人控制系统的实测结果。1
- Figure CEO Brett Adcock 称,BotQ 已制造第 1,000 台 F.03 人形机器人。这个数字来自公司 CEO 的单一披露,未同时给出实际交付、在线率、任务成功率或人工介入率。2
- Sanctuary AI 展示机械臂用手持电钻完成真实客户任务,并明确说当前通过遥操作采集策略训练数据;视频是项目方演示,不能写成自主作业。3
- a16z 与 Sequoia 的公开内容把 Etched 的推理专用芯片融资和生产设施推到台前,讨论重点从「训练谁更强」转向「推理每个 Token 的硅和电成本」。4
- Michael Burry 则给出相反方向的判断:模型会持续压缩到边缘设备,Agent-to-Agent 的实际用途和资本效率都可能被高估。这是投资者观点,不是行业统计。5
覆盖窗口:2026 年 7 月 23 日 07:15 至 7 月 24 日 07:15(东八区)。
AI 企业与开发者
语音开始承担多 Agent 工作流的入口
OpenAI 宣布 ChatGPT Voice 进入 macOS 和 Windows 桌面端,覆盖 Plus、Pro、Business、Edu 和 Enterprise 计划。帖子称,用户可以用语音控制电脑,并指挥 ChatGPT Work 或 Codex 中运行的多个 Agent;iOS 端 Codex 也已支持 ChatGPT Voice,Android 版本待推出。以上是 OpenAI 的产品公告和自述。1
这条更新对机器人产品的启发,不在于给机械臂加一个语音按钮,而在于把语音放到任务编排层:用户下达目标,系统再把工作拆给不同 Agent。真正要补齐的产品字段包括操作确认、设备权限、任务暂停、状态回报和失败后的人工接管。语音理解得再好,如果不能让用户知道「现在谁在执行什么动作」,它就只是更顺手的输入法。
콘텐츠 카드를 불러오는 중…
Anthropic 的 Claude Voice 也在同一窗口升级。Claude 官方账号称,Voice 模式现在可以运行 Opus、Sonnet 等更强模型,并在对话过程中触达已连接的邮件、日历等工具;该功能以公开 Beta 形式覆盖移动端、桌面端和 Web,并增加西班牙语、法语、印地语和日语。6
两家公司都在把语音从单独的问答功能变成工具调用的交互层。对现场机器人,下一步比较的不是语音识别准确率这一项,而是端到端任务完成时间、误触发率、确认动作的等待成本,以及网络中断时能否安全降级。
网络安全模型从通用能力切出专用版本
Google DeepMind 发布 Gemini 3.5 Flash Cyber,称它是面向安全团队的轻量模型,用于在漏洞被利用前发现和修复。Google 说,该模型在自家代码库、包括 Chrome 和 Android 的测试中持续捕获了一些标准模型没有发现的复杂漏洞,目前以有限访问方式向政府和信任合作伙伴提供,并通过 CodeMender 部署。这里的测试结果和「标准模型未发现」均是 Google 的自述,尚无本轮独立评测。7
NVIDIAAI 同时展示了 Nemotron 3 Nano 的托管强化学习流程:在 PrimeIntellect Lab 的基础设施上,一次数学任务的准确率据称从 22% 提升到 91%,成本低于 5 美元,并能导出 LoRA adapter。这个数字是 NVIDIA 的演示口径,帖子没有给出任务集合、重复次数或第三方复现实验。8
对机器人团队,这两条信息都指向专用化,但落地方式不同:Cyber 关注的是安全评测和代码修复,Nemotron 关注的是低成本的任务适配。若把类似流程用于视觉策略或操作策略,评估表里至少要有数据采集成本、失败重试、显存占用、端侧延迟和人工接管率,不能只填一个准确率提升百分比。
企业家与科技从业者
Hugging Face 联创:攻击与防御的开闭源关系出现反转
Hugging Face 联合创始人 Thomas Wolf 称,最近的自主 AI 攻击由一个未公开权重的闭源模型发起,而 Hugging Face 采用 Z.ai 的 GLM-5.2 开放权重模型协助防御。他用「大家原本预期相反」来描述这一反差。Wolf 的帖子补充了当事方时间线,但不是独立取证报告;攻击范围、利用链和损失情况仍应以正式调查材料为准。9
Greg Brockman 还在 X 上推广 Codex 安全插件,称其用于网络防御。10 这两个动作放在一起看,安全能力已经从「模型会不会拒绝危险请求」扩展到「模型能否在真实系统里读取轨迹、定位漏洞并执行修复」。机器人接入网络、凭证和现场系统后,安全门槛也应包含任务外访问、凭证使用、持续规划、硬中断和回滚,而不是只看最终回答。
Musk 的 Grok 4.5 评价缺少可比基线
Elon Musk 发帖称「Grok 4.5 is the best value for money AI」,没有给出价格、任务集、竞品范围或单位任务成本。11 这句话可以记录为产品方创始人的立场,不能直接转成模型选型结论。
对具身智能,性价比至少要落到一个完整任务:Token 费用、端侧显存、网络延迟、失败重试、人工接管和数据合规一起算。低价模型适合承担状态摘要或异常分流,不代表它适合直接进入高风险控制回路。
콘텐츠 카드를 불러오는 중…
投资者与 VC
Etched 的融资叙事把焦点推向推理成本
a16z 公开表示支持 Etched,并在配套文章中把 AI 推理称为规模巨大的计算负载,主张当负载足够稳定、足够大时,专用硬件可能比通用 GPU 更有优势。a16z 的文章还把 Etched 的「生产就是产品、机器就是护城河」作为投资逻辑的一部分;Sequoia 账号则确认由其领投 Series C。具体融资金额、估值和设施规模来自项目方及投资方口径,不能当作独立财务核验。4 12 13
这条线和机器人产品直接相关,因为具身系统的成本常常被推理调用、传感器处理和网络传输共同决定。专用芯片若能把延迟、功耗和每次任务成本压下来,才有机会改变端云分工;在规格、供货和真实负载数据出来前,投资叙事仍不能替代选型测试。
콘텐츠 카드를 불러오는 중…
两种相反的算力判断:专用推理芯片 vs. 边缘压缩
Michael Burry 在长帖中认为,模型会因为知识重复和使用范围有限而持续压缩,最终在边缘计算上运行;他还判断 AI 基建可能过度建设,并认为 Agent-to-Agent 的实际用途有限、资本消耗过高。5 这是个人投资判断,没有给出模型压缩曲线、边缘硬件清单或任务级成本测算。
它和 a16z 的专用推理芯片论点并不完全互斥:两者都在质疑把所有工作长期放进通用云端 GPU,只是前者押注小模型和边缘化,后者押注稳定负载的专用推理硬件。机器人团队不需要先选边,应该先测同一个任务在云端、边缘 GPU 和专用加速器上的总成本、延迟、功耗与断网表现。
开放权重争论开始进入资本配置语言
Mayhem4Markets 认为,禁止或限制开放权重模型会伤害美国初创公司和受益于 AI 瓶颈的硬件公司,真正受益的会是通过闭源 API 销售 Token 的大型前沿实验室。该账号同时强调开放性会加快创新。14 这是市场评论账号的立场,不是政策结论。
Azeem Azhar 对 Kimi K3 的分析则认为,开放权重模型不会自动压低 AI 总收入,价格下降可能带来更多 Token 消费;他还提出,价值可能从模型层转移到托管模型的基础设施层。15 16 对机器人产品经理来说,开放权重的意义不只是「能不能下载权重」,还包括能否在现场部署、能否审计更新、能否固定版本,以及出了问题能否回滚。
给具身智能产品经理的跟踪点
| 今日信号 | 已确认到哪一步 | 仍缺什么 | 产品动作 |
|---|---|---|---|
| 语音控制多个 Agent | OpenAI 和 Claude 都把语音接到工具或 Agent 工作流 | 机器人场景的误触发、确认耗时、断网降级 | 把语音当任务入口测试,单独设计权限、暂停和人工接管 |
| F.03 第 1,000 台 | CEO 披露 BotQ 完成整机制造里程碑 | 交付量、在线率、任务成功率、维护与人工介入 | 把产能和现场可用性分开记,等待部署数据 |
| 电钻任务训练 | Sanctuary AI 明确展示遥操作采集训练数据 | 自主执行比例、跨设备泛化、客户验收指标 | 评估「遥操作→策略训练→自主执行」链路,不把视频当部署证明 |
| 推理硬件路线 | a16z 押注专用推理芯片,Burry 押注模型压缩和边缘化 | 真实负载下的每任务成本、功耗、延迟、供货 | 用同一任务做云端、边缘和专用芯片的 A/B 测试 |
| AI 安全闭环 | Wolf 描述闭源模型攻击、开放权重模型防御;Google 推出 Cyber 专用模型 | 独立取证、攻击复现、轨迹审计和硬中断效果 | 把越权检索、凭证使用、暂停后替代路径纳入上线门槛 |
今天的新增信息,集中在两个尚未被数据完全回答的问题上:Agent 能否从语音入口安全地调度工具,机器人产能能否转化为可持续的现场作业。前者要看权限和回滚,后者要等交付、在线率和人工介入数据,而不是再看一段演示视频。
참고 출처
- 1OpenAI:ChatGPT Voice 进入桌面端
- 2Brett Adcock:BotQ 完成第 1,000 台 F.03
- 3Sanctuary AI:电钻紧固任务与训练数据采集
- 4a16z:支持 Etched
- 5Michael Burry:AI 压缩与 Agent-to-Agent
- 6Claude:Voice 模式接入更强模型与已连接工具
- 7Google DeepMind:Gemini 3.5 Flash Cyber
- 8NVIDIAAI:Nemotron 3 Nano 托管 RL 微调
- 9Thomas Wolf:自主攻击与开放权重防御
- 10Greg Brockman:Codex 安全插件
- 11Elon Musk:Grok 4.5 性价比判断
- 12a16z:How to Win the Largest Market in AI
- 13Sequoia:领投 Etched Series C
- 14Mayhem4Markets:开放权重模型的监管观点
- 15Azeem Azhar:Kimi K3 与 AI 经济学
- 16Azeem Azhar:中国模型与美国基础设施厂商
관련 콘텐츠
- 로그인하면 댓글을 작성할 수 있습니다.
