AI+机器人行业晨报|7月25日:Opus 5、机器人数据标注与开放权重升温

AI+机器人行业晨报|7月25日:Opus 5、机器人数据标注与开放权重升温

过去24小时,Claude Opus 5、LeRobot 语言标注、Unitree 轮式机器人与 Newton 1.4 同时推进了模型、数据和仿真工具链;开放权重讨论升温,但客户部署与现场指标仍缺少新公开数据。

速览

过去 24 小时(2026 年 7 月 24 日 07:15 至 7 月 25 日 07:15,UTC+8),高信号动态集中在模型能力的价格下探、机器人数据工程和开放权重争论:
  • Anthropic 发布 Claude Opus 5,称其在接近前沿能力的同时,价格与上一代 Opus 4.8 相同,并提供约 2.5 倍速度的 Fast 模式。这里的性能与成本比较仍是公司自述,不能替代独立评测。1 2
  • LeRobot 新增完整语言标注支持,VLM 可以为每个机器人 episode 自动写入子任务、计划、记忆和 grounded Q&A,官方估算成本约为每 100 个 episode 1.20 美元。3
  • Unitree 发布 Super Athlete AS2-W 轮式机器人,宣称连续 16 kg 载荷和空载 30+ km 续航;目前看到的是项目方演示与规格口径,不是客户部署或量产交付证明。4
  • NVIDIA Robotics 宣布 Newton 1.4 开源物理引擎在 SIGGRAPH 2026 发布,由 Disney Research、Google DeepMind 和 NVIDIA 联合开发。5
  • Sam Altman 表示,希望美国在开放模型和专有模型两条路线上都取得领先;a16z 联合创始人 Ben Horowitz 也公开呼吁保持开放权重模型的可获得性。这是两位行业人物的立场,不是政策已经改变的事实。6 7

AI 企业与开发者

Opus 5 把「更强」和「同价」放在同一张产品牌上

Claude 官方账号发布 Claude Opus 5,称它是「thoughtful and proactive」的模型,接近 Fable 5 的前沿智能,但价格只有后者的一半;另一条官方帖则称 Opus 5 即日起向付费计划和 Claude API 提供,定价与 Opus 4.8 相同,并提供约 2.5 倍默认速度的 Fast 模式。后一组可用性与价格信息可以核对,前一组跨模型比较仍属于 Anthropic 的发布口径。1 2
这条更新对机器人团队的意义不是「马上换模型」,而是重新计算模型分层。高难度规划可以调用更强模型,状态摘要、异常分类和低风险工具调用则要比较 token 费用、首 token 延迟、失败重试和网络依赖。官方说的同价并不等于任务级总成本下降,尤其当模型更愿意持续思考时,调用时长和上下文长度可能反过来抬高成本。

Prompt injection 的安全宣传开始进入组合防御

Anthropic 的 Claude Code 开发者 Boris Cherny 称,Opus 5 是公司迄今最难被 prompt injection 攻击成功的模型;他还说,在模型对齐、prompt injection 探针和 Claude Code Auto Mode 三层防御叠加后,攻击成功率降至「~0」。这是内部开发者对产品防御体系的描述,不是公开独立评测,帖子也没有给出攻击集、基线或置信区间。8
对具身产品,最该复用的是分层思路,而不是那个「~0」的数字。上线门槛仍应记录越权检索、凭证使用、任务外访问、持续规划、暂停后的替代路径,以及硬中断和回滚是否真的生效。机器人一旦能读现场系统、调用工具并修改任务状态,最终回答安全不够,轨迹安全才是验收对象。

LeRobot 把一条任务指令扩展成可训练的语言结构

Hugging Face 旗下 LeRobot 项目发布完整语言标注支持。新工具 lerobot-annotate 会用视觉语言模型为每个 episode 生成子任务、计划、记忆和 grounded Q&A,帖子称成本约为每 100 个 episode 1.20 美元;同一数据集可以服务 planning、memory、tool call 和 low-level control,不必重新设计数据格式。3
这比「自动打标签」更值得产品经理关注:数据集从记录一项动作,变成可以支持多种策略训练的共享接口。落地时要单独检查 VLM 标注错误率、时间对齐、语言描述是否真正 grounded,以及加上计划和记忆后任务成功率是否改善。1.20 美元是项目方估算,不能直接当成团队的完整数据成本。

xAI 把语音和搜索插件放到开发入口

xAI 账号宣布 Grok STT 可在 OpenRouter 试用,另一个帖子宣布 Exa 插件接入 Grok Build,用于 agentic web search。两条都是产品接入信息,没有给出语音识别准确率、端到端延迟、调用价格或机器人场景的安全边界。9 10
对机器人开发者,这类能力适合先放在任务规划和信息检索层做灰度测试,别直接塞进高风险控制回路。需要比较的是语音误触发率、搜索结果污染、权限隔离、断网降级和人工确认成本。

机器人与具身智能

AS2-W 给轮式机器人留下了一个很具体的性能问题

Unitree 官方账号发布 Super Athlete AS2-W 轮式机器人,称其支持连续 16 kg 载荷,空载行驶距离超过 30 km,并配有运动演示视频。推文没有披露客户、订单、任务成功率、维护周期或量产交付数据,因此当前只能把它记为新品发布和项目方规格宣称。4
如果这组参数在真实场地成立,产品问题会从「能不能走」转到「载荷、续航、地面适应性如何同时保持」。物流和巡检团队应要求同一任务下的有效载荷、速度、坡度、地面类型、温度和电池衰减数据;30+ km 的空载续航不能直接换算成带工具、传感器和任务停顿后的工作半径。

仿真器更新,价值取决于能否补上真实世界的误差

NVIDIA Robotics 宣布 Newton 1.4 在 SIGGRAPH 2026 发布。该开源物理引擎由 Disney Research、Google DeepMind 和 NVIDIA 联合开发,官方以 Disney Imagineering 的 Olaf 机器人学习行走为例,展示强化学习与雪地求解器的组合。帖子证明了版本发布与演示用例,未提供 sim-to-real 成功率或跨场景泛化数据。5
对机器人团队,升级仿真器的验收不应只看 demo 是否更顺滑。要把摩擦、接触、软物体、传感器噪声和控制延迟逐项对齐,再比较仿真训练策略在真实设备上的任务成功率、失败类型和人工接管次数。

Agility 把运维人员写进人形机器人政策

Agility Robotics 官方账号转发其「Safeguarding America's Humanoid Future」政策材料,称人形机器人不会只减少工作,也会创造部署、维护和维修岗位,并把技术人员培养列为六项支柱之一。这里是公司的政策倡议,不是就业统计,也没有在帖子中披露车队数量或新增岗位数。11
对产品设计,这条观点倒是很落地:现场诊断、备件更换、远程接管、日志导出和维修培训不能等到交付后再补。人形机器人如果需要专业技术人员才能维持在线率,运维能力就是部署模型的一部分,而不是售后部门的附属工作。
本窗口内能核实到的机器人原创动态,主要落在新品、数据工具、仿真和运维议题;没有拿到新的客户部署数量、任务成功率或人工介入率。对本频道长期关注的「部署是否真的扩张」,这个空白本身需要保留,不能用演示视频填上。

企业家与科技从业者

Sam Altman 对开放模型的表态,先记作路线信号

OpenAI CEO Sam Altman 发帖说,希望美国在开放模型和专有模型两条路线上都取得胜利,并表示对这一趋势感到高兴。帖子本身没有宣布 OpenAI 发布新开放模型,也没有改变公司的产品政策,因此应记录为路线表态,而不是产品事实。6
如果这种双轨表态继续落实到模型发布,机器人团队会多一个需要验证的变量:开放权重是否能让现场版本固定、审计和回滚更容易。眼下不能从一句话推断具体模型计划,先观察是否出现权重、许可证、推理硬件和支持承诺。

OpenAI 招募菲尔兹奖得主,能确认的是人才动作

OpenAI 总裁 Greg Brockman 发帖欢迎数学家 Jacob Tsimerman 加入团队。研究单元核对到的背景是,Tsimerman 是 2026 年菲尔兹奖得主;但 Brockman 的帖子没有说明其团队、职位或具体项目。12
因此,能确认的事实是高水平数学人才加入,不能直接写成某个模型数学能力已经提升。对产品路线的合理跟踪点是:后续是否出现数学推理、科学发现或形式化验证产品,而不是先把招聘消息等同于 benchmark 结果。

Thomas Wolf 提醒:更高的 effort 不一定带来更高成功率

Hugging Face 联合创始人 Thomas Wolf 观察到,Claude Opus 5 在 FrontierCode 上出现「non-monotonic success-effort curve」,即成功率与投入的推理 effort 可能不是单调关系。帖子没有附图表和具体数值,这是一条技术观察,不足以证明该现象在所有任务上成立。13
这提醒机器人团队不要把「让模型多想一会儿」当成免费的性能开关。对长时任务,应分别测推理预算、成功率、动作延迟、工具调用次数和错误恢复;如果 effort 增加后出现过度规划或偏离任务,系统需要有预算上限和可回退策略。

投资者与 VC

a16z 联合创始人公开站到开放权重一侧

a16z 联合创始人 Ben Horowitz 说,美国软件领导力建立在开放之上,AI 也有同样机会;如果希望 AI 生态具有竞争力和安全性,并让收益不只集中在少数公司,就需要保持开放权重模型的可获得性。a16z 官号随后转发了这段表态。7 14
这是投资者的政策与产业判断,不是开放权重监管已经落地。对具身智能产品经理,开放权重的价值要拆成几个可测字段:许可证能否用于商业部署,模型版本能否固定,现场是否能离线运行,更新是否可审计,出现异常能否回滚。下载得到权重只是起点。

OpenRouter 的增长数字,说明路由层正在被单独计价

Menlo Ventures 合伙人 Deedy 披露,OpenRouter 的月度 token 使用量从 2025 年 1 月的 2T 增至 2025 年 4 月的 8T、2026 年 2 月的 50T,并在 2026 年 7 月达到 250T;他把这概括为 18 个月增长 125 倍。数字来自投资人个人帖子,没有同步的财务报表或第三方流量审计。15
如果这个口径持续成立,模型路由会从「接哪个 API」变成一层独立的产品基础设施。机器人系统可以据任务风险、延迟、价格和数据合规动态选模型,但路由策略必须保留版本、提示词、工具权限和失败原因,否则省下的 token 成本可能换来更难排查的现场问题。

实体 AI 的大判断,还没有替代交付数据

a16z 发布 Applied Intuition 联合创始人 Qasar Younis 在 2026 RAISE Summit 的发言片段。Younis 说,实体 AI 的规模最终可能超过 LLM,并强调真实世界从业者关心的是能完成工作,而不是 agent 的抽象性能。16
这是创业者的市场判断,帖子没有提供市场规模测算、客户收入或部署数据。对产品经理而言,判断是否值得跟进的标准仍应落到工位、任务和维护账本:单位任务成本、在线率、人工介入、异常恢复和客户续约,比「比 LLM 更大」更能说明商业化是否发生。

给具身智能产品经理的跟踪点

今日信号已确认到哪一步仍缺什么产品动作
Claude Opus 5 同价上线官方宣布模型、付费计划/API 可用和 Fast 模式独立任务评测、真实调用成本、长时任务稳定性按规划、摘要、工具调用和控制回路拆分模型路由测试
LeRobot 自动语言标注已公布工具、标注字段和项目方成本估算标注错误率、时间对齐、加语言后的任务收益先做小批量 episode 对照,保留原始轨迹与自动标注版本
AS2-W 轮式机器人官方演示与 16 kg、30+ km 规格宣称带载续航、地面适应、客户部署、维护和量产数据要求带载任务实测,不把空载续航当工作半径
Newton 1.4开源版本发布,公布联合开发方和演示用例sim-to-real 成功率、跨场景泛化、真实接触误差用统一场景比较仿真训练和真实设备的失败类型
开放权重路线升温Sam Altman 与 Ben Horowitz 公开表达支持具体权重、许可证、支持周期和部署承诺把可审计、可离线、可固定版本列入模型选型表
Agent 安全防御Anthropic 开发者描述三层防御与内部成功率口径攻击集、基线、复现和独立评估加入越权访问、凭证使用、硬中断和回滚测试
本期最值得继续追的不是某个模型的宣传分数,而是两条能被工程验证的线:Opus 5 的高能力是否能在任务级总成本内成立,机器人数据和仿真工具的升级是否会转化为更少的人工接管。至于客户部署和现场运维,窗口内公开白名单账号没有提供足够新数据,仍不能提前下结论。
本期没有足够的新公开数据支持客户部署量、任务成功率或人工介入率的判断。窗口内出现的空时间线、句柄不匹配和无原创帖账号,也不能被解读为「没有动态」。

Contenido relacionado

  • Inicia sesión para comentar.
More from this channel