
AI行业核心动态:具身推理走向多机器人,资本转投芯片互联与工作流浏览器
Google发布具身推理模型,WAIC呈现中国AI产业的系统交付信号,融资和评测则把注意力推向芯片互联、登录态工作流与长流程合规。
今日判断
截至 2026 年 7 月 31 日 08:00(北京时间),AI 行业的新增信号集中在「执行」:Google 把具身模型推向多机器人协作,中国 WAIC 现场把算力和机器人放进系统交付的尺度里,资本则继续投向芯片互联和登录态工作流。两篇新评测也给出同一个提醒:Agent 能完成任务,和它能在长流程里守住规则,仍是两件事。
| 板块 | 关键动态 | 读者该跟进什么 |
|---|---|---|
| 大公司与产品 | Google 发布 Gemini Robotics ER 2;WAIC 2026 的中国厂商把竞争从单芯片、单机演示推向超节点和产线交付。1 2 | 机器人模型的评测是否包含连续视频、工具调用和多人协作,而非只看单次动作。 |
| 创业与投资 | Eliyan 以 1.45 亿美元融资达到 10 亿美元估值;Polar 获 570 万美元种子轮,做面向知识工作的 AI 浏览器。3 4 | 钱投向了两处瓶颈:芯片之间的数据搬运,以及 Agent 在登录态网页中执行工作。 |
| 前沿研究 | HANDBOOK.md 的严格 pass@1 最佳成绩为 36.2%;GuardianAgentBench 发现工具数量和流程长度增加后,Agent 表现持续下滑。5 6 | 评测应把「是否完成」和「是否违规」分开记分,并把工具权限纳入系统边界。 |
大公司与产品
Google 7 月 30 日发布 Gemini Robotics ER 2,定位是机器人的高层具身推理模型。它能持续看视频、跟踪任务进度、调用搜索或自定义函数,并与低层视觉—语言—动作模型配合;新版本还加入多机器人协作。模型已在 Gemini API 和 Google AI Studio 提供,Gemini Enterprise Agent Platform 为私有预览。Google 页面报告,进度分类准确率为 57.4%,时刻定位准确率为 91.3%,这些属于厂商自测结果,不能直接当作真实工厂的成功率。1
中国侧的变化更像产业现场的集体样本。新华网 7 月 30 日报道,WAIC 2026 展览面积首次超过 10 万平方米,1100 余家企业参展;算力展品的重点从单颗芯片转向超节点、超集群,具身智能则有 200 余家企业、208 款终端产品和超过 300 台真机参展。这个信号比「又发布了一个模型」更接近采购方的验收表:集群能否稳定运行,机器人能否进入工序,软件是否能跨硬件复用。2
创业与投资
Eliyan 的 1.45 亿美元是已完成融资,投后估值为 10 亿美元;Reuters 报道称,Seligman Ventures 领投,Cisco 和 Lumentum 参与。公司做的是 AI 芯片之间的数据互联技术和 chiplet,并称今年会开始初始发货、预计 2027 年底销售额可达数亿美元。后两项是公司预期,不能与已实现收入混写。它说明资本正在给「GPU 之外」的瓶颈定价:模型更大之后,芯片如何交换数据也变成独立的基础设施生意。3
Polar 则拿到 570 万美元种子轮,Madrona 领投。它把浏览器当作 Agent 的工作入口:用户可以根据打开的网页安排流程、保存提示词,再把任务交给 Agent,目标客户是销售、招聘、营销、研究和运营团队。创始团队自己也承认,当前不少用户仍把它当自动化工具,日常浏览继续使用另一款浏览器。这个产品形态把商业化难点说得很直白:Agent 要在登录态网页里可靠工作,权限、可回溯性和失败后的人工接管都必须算进产品成本。4
前沿研究
HANDBOOK.md 把长篇企业流程当成硬约束来测:65 个任务分布在 10 家虚构公司,配有 20 至 124 页的 SOP、邮件和项目管理工具,共 824 条程序化判定标准。研究评测 30 个模型配置,严格 pass@1 的最佳成绩只有 36.2%,多数前沿模型低于 25%。放宽为允许错一条标准后,分数大约翻倍,说明「大体做对」和「完全合规」之间有明显距离。该基准是合成企业环境,不能直接当作生产系统成功率。5
GuardianAgentBench 进一步把变量放到多步工具调用:580 个场景覆盖客服、邮件、日历、商业分析、金融和内部知识,使用 81 个工具。论文报告,最佳整体准确率为 74.8%,流程更长、工具更多时表现持续下降;规则型 guardrail 可恢复 19.9% 的失败,误报率为 0.5%。这仍是 proof of concept,且依赖有限的生产框架和自动评审。对产品团队来说,结论足够实际:Agent 评测不能只问「答案对不对」,还要记录它调用了什么、漏掉了什么,以及有没有在高风险动作前停下来。6
接下来观察
今天的四条线索可以合成一个可检验的判断:模型能力正在向实体系统、登录态软件和长流程规则里迁移,竞争指标也随之从单次分数变成 成本、权限、持续运行和人工接管。下一步应看三件事:Gemini Robotics ER 2 的 API 是否出现真实开发案例,WAIC 展示的系统是否形成批量订单,以及长流程 Agent 的严格通过率能否离开合成环境后仍然成立。
References
- 1Gemini Robotics ER 2
- 2算细账、拼交付、进工厂:WAIC 2026中国AI产业的新发现
- 3Eliyan raises $145 million at $1 billion valuation to ease AI chip data bottlenecks
- 4Perplexity employee who worked on Comet launches an AI browser aimed at knowledge work
- 5HANDBOOK.md: A Benchmark for Long-Context Agentic Instruction Following
- 6GuardianAgentBench: Where Agents Fail and How to Guard Them
Related content
- Sign in to comment.
