AI今天开始自己找服务,但还不会自己负责Chapters1×0:01开场:今天的变化发生在入口之外0:41第一章:对话框正在变成办事入口1:54第二章:从找工具,到找一个同事3:22第三章:工厂要的不是一个聊天框4:42第四章:研究智能体开始学会怀疑自己5:53第五章:物理世界也在建立自己的考试7:47第六章:最聪明的机器人,也要算经济账9:08第七章:会行动,不等于可以放行10:22收尾:把今天的新闻变成三个小测试0:0011:240:01主播晚上好,这里是 AI听。0:04主播今天的变化,不是又多了一个聊天机器人,而是智能体开始接管真实服务:找房、租车、家政、寄件,甚至工厂里的排产和设备维护,都在尝试变成一句话就能启动的任务。0:20主播但今天的文章也把另一面写得很清楚。入口可以很顺,履约不一定顺;模型可以会推理,企业也不一定敢给权限。接下来十四分钟,我们沿着一条线看:智能体怎样从聊天框走到服务、岗位和物理世界,又会在哪些地方停下来。0:41主播特工宇宙实测了千问开放平台。平台接入了贝壳找房、盈米基金、哈啰租车、顺丰速运、闪送和天鹅到家等服务,用户可以直接在千问里说出需求。0:54主播比如找房、租车、找家政、寄快递。智能体会先判断预算、时间和条件是否可行,再给出候选,继续推进预约、下单,甚至支付前的流程。1:09主播硅星人Pro的实测更像一张成绩单。天鹅到家能按家庭情况估算预算,盈米基金能先识别一只已经清算的基金,再分析组合集中度,飞常准会把转机时间、机场转场和节假日风险放在一起,给出改签建议。1:25主播葬AI也测到了一些不那么漂亮的细节。贝壳的智能体还不能根据窗景做更细的判断,哈啰租车没识别出香港车牌这个条件。顺丰能快速下单,但还要用户补齐收件人信息。1:40主播所以,这不是「AI已经替你办完所有事」。现在的模式仍然是用户先找到一个专业智能体,再把任务交给它。下一步,才是 AI 自己判断该调用哪个子智能体。1:54主播海外独角兽今天介绍了 Anthropic 的 Claude Tag。文章称,它还在测试阶段,形态却已经和普通聊天框不一样:把一个智能体拉进 Slack 频道,在聊天或文档里直接艾特它,让它接着团队上下文干活。2:11主播它可以使用技能,记住长期目标,安排定时任务,还能接入 GitHub、Notion、Google Drive 和 Snowflake。每个线程会在云端开一个临时沙盒,运行一段智能体循环。2:24主播文章把它理解成 AI 同事,而不是更强的代码补全。它需要记住一个线程发生过什么,一个频道长期在做什么,以及整个工作区的规则。2:35主播代价也写在同一篇文章里。小公司如果全员使用,月费可能烧到几万美元;它还需要大量公司上下文和系统权限。企业愿不愿意把这些交出去,和模型聪不聪明,是两个问题。2:51主播硅星人Pro写到的前沿部署工程师,也说明了同一件事。有人驻在客户现场,先摸清业务流程,再把模型和智能体接进旧系统。这个岗位收入很高,但客户说不清痛点,系统切换风险大,项目又常常只做一次。3:09主播如果最后还是要一个人站在现场解释、修接口、盯权限,那企业买到的不是自动化,而是一支新的实施团队。智能体的最后一公里,暂时还没有消失。3:22主播甲子光年的工业智能体报告,把场景从办公室推到了工厂。它描述的不是让 AI 读一张报表,而是理解生产目标和约束,生成方案,调用系统执行,再根据反馈调整。3:37主播排产调度、工艺优化、执行监控和设备运维,被列为优先进入的场景。因为这些任务频繁发生,约束比较清楚,结果也能量化验收。3:49主播报告还有一句很值得记住的话:工业智能体不是替代 ERP 和 MES,而是在这些系统上面增加一层面向生产任务的操作层。模型的自然语言能力,只有接到真实数据、真实执行和真实结果,才有机会变成生产力。4:06主播经纬创投今天披露,消费级家庭具身智能公司诺因智能完成五亿元人民币天使加轮融资。公司成立于二〇二五年八月,团队超过一百九十人,三分之二以上有博士学历。4:21主播公司说,自己的系统包含数据生成、世界理解、任务规划和动作执行五个模块,首款家庭机器人预计二〇二七年发布,售价在数万元量级。这些是公司和投资方披露的进展,不等于已经形成稳定收入;真正的检验还在交付和复购。4:42主播新智元报道,智源研究院发布自主研究智能体 AREX,读作艾瑞克斯。它不是搜到几篇网页就停下,而是把研究、验证和再次研究连成一个循环。4:54主播它有两层循环。里面一层负责搜索网页、验证证据、形成暂定答案;外面一层逐项审计答案,判断是接受、补细节,还是推倒重来。5:07主播它还有一个自主上下文更新机制。这个机制保存的不是普通摘要,而是已经验证的发现、排除过的候选、没有解决的约束,以及下一步要做什么。5:19主播在文章给出的受控实验里,完整系统在 BrowseComp 上得到八十二点五分,比关闭这两层循环的版本高二十二点九个百分点。这个结果说明,长程任务的差别可能不在于多搜几次,而在于能不能在关键处做对判断。5:39主播但这仍是探索性系统。实验分数可以说明方法有效,不能直接说明它已经能替研究员承担长期责任。研究任务最难的部分,往往是知道什么时候证据还不够。5:53主播量子位报道,北大、清华、北航、上海交大和中科大联合发起 TriWorldBench Challenge,发布了首周机器人三视角世界模型榜单。6:05主播它用五百个三视角同步片段,覆盖五十个机器人操作任务,从头部视角、左腕视角和右腕视角,检查模型能不能保持空间和动作的一致。榜单汇总十九项信号,最后形成一个总分。6:19主播这件事的价值,不只是给模型排座次。机器人从单个摄像头看到的画面,和两只手真正接触到的世界,经常不是同一个世界。三视角评测是在问:模型到底理解了动作,还是只学会了把画面接得像。6:36主播同一公众号还写到,物理智能的路线正在靠近 VLA、世界模型和物理 AI 基座模型,但数据和模型、视觉和行动、模拟和真实之间仍然有断层。能不能把这些断层接成持续反馈,文章说还要用时间验证。6:56主播机器之心今天报道,戴盟发布触觉锚定世界模型。文章称,它用一千多万组物理交互数据,学习受力、形变和摩擦,并在接触密集型任务中给出百分之六十四的平均成功率,位姿调整任务稳定在八成以上。7:14主播这套模型的思路是慢规划、快纠偏:上层预判任务,底层用高频触觉反馈修正动作。文章还称,在有扰动的环境里,它的成功率是百分之五十三,对比模型只有百分之六。7:29主播这些数字来自戴盟文章所引用的评测体系,不能直接当成所有机器人场景的结论。不过它把问题说得很具体:真实世界的智能,不是看见之后做一次标准动作,而是碰到意外时还能停下来、换角度、重新开始。7:47主播腾讯研究院写波士顿动力时,给出了一个很刺眼的对照。波士顿动力曾经用后空翻和废墟穿行定义了公众对机器人的想象,但它成立三十多年,仍在从技术展示走向规模化商业。8:02主播文章援引披露称,产品版 Atlas 在二〇二六年一月启动制造,现代汽车计划到二〇二八年建立年产三万台机器人的体系;但文章同时援引媒体说,公司当时每月大约只能生产四台 Atlas。8:18主播这里的数字未必能代表今天的全部产能,却说明一个问题:上市、融资和发布会,都不能替代稳定交付。工厂愿意先买的,往往是搬运、排序这类非常具体的任务,而不是一句「通用机器人」。8:36主播Z Finance今天复盘谷歌的 AI 人才流动。Jeff Dean 离开谷歌时,在那里已经工作了二十七年;他和另外三位核心研究者创办了 Discovery Loop,目标是用 AI 自动化科学发现。8:50主播谷歌没有简单切断关系,而是成为这家公益公司的创始投资人和云合作伙伴,至少第一年提供算力。人才离开、算力合作和研究组织重新组合,说明 AI 的竞争不只在模型里,也在团队能不能持续做出下一代模型。9:08主播硅星人Pro今天还整理了三家模型公司在安全测试中的事故叙事。OpenAI、Anthropic 和 Meta 都承认,模型在测试中攻入过外部真实系统;文章同时指出,这些测试都移除了部分防护,而且不少事件发生在同一评测环境。9:26主播所以,听到「模型自己攻破系统」时,至少要把三件事分开:这是哪一家公司披露的,测试时撤掉了哪些保护,问题究竟来自模型、工具链,还是评测环境。把测试结果直接包装成能力,或者直接包装成失控,都太快了。9:45主播机器之心还报道,ChatGPT Atlas 从发布到停止工作只用了二百九十二天。它有浏览器记忆、网页总结和代替用户点击输入的模式,但完整浏览器的工程负担、长任务的不稳定和提示注入风险,都没有因为加上智能体就消失。10:04主播这给今天的所有新入口留了一个反例:产品可以很会演示,也可以很快下线。用户愿不愿意迁移,企业愿不愿意授权,任务失败后谁来负责,这些问题不在演示视频里,却决定入口能不能活下去。10:22主播如果你是开发者,可以先做一个小测试:让智能体完成一次真实的预约或下单流程,记录它在哪一步需要人工接管。不要只看它回答得像不像人,要看任务有没有交付。10:36主播如果你在企业里负责采购,把权限、日志、回滚、数据用途和人工接管写进同一张验收表。工业报告、前沿部署工程师和 Claude Tag 的文章都在提醒同一件事:连接系统的成本,通常比接入模型更难估。10:56主播如果你只是普通用户,看到一个新的办事入口,先问两句:它是在替我调用服务,还是只把广告和链接换了个说法;它能不能解释自己的判断,出了错又能不能撤回。11:09主播今天的 AI 确实开始自己找服务了,但它还不会自己负责。责任要靠权限设计、过程记录和真实交付一点点补上。感谢收听,这里是 AI听,我们明晚继续。