AI 听:模型开始自己变强,企业开始经营 AgentCapítulos1×0:00开场:今天的变化,不在榜单上0:39模型:参数之外,开始比谁更会继续学习2:46Agent:记住答案还不够,还要记住为什么改4:05办公:从教人写 Prompt,转向教 Agent 完成任务6:00基础设施:后台运行,正在成为默认场景8:10产品和模型:一边把 Agent 放进手机,一边把专家挂在基座上10:25创业判断:技术路线之外,还要能承受长周期12:13收束:明天值得继续盯什么0:0012:490:00主播晚上好,这里是 AI 听。今天的消息有一条很清楚的线索:模型不再只是训练完、上线、等用户来用;研究团队在想办法让模型继续成长,产品团队在给 Agent 准备工作知识,基础设施公司则开始按 Agent 的调用方式重新设计云和芯片。0:21主播这和前几天我们讨论的「Agent 能不能真正交付」有一点不同。今天更值得看的,是交付之后怎么办:模型怎样记住改过什么,企业怎样让它按流程做事,算力又怎样承受越来越多的后台调用。0:39主播先看两条模型消息。新智元今天介绍了微信 WeLM 团队的 Hidden Decoding,可以理解成「隐式序列缩放」。普通的思路是让模型输出更长的思维链,WeLM 的做法是把额外计算折叠进序列内部,让每个 token 之间完成更多隐式思考,外部看到的回答长度不一定增加。0:59主播这套方法被推进到六百一十七 B 的混合专家模型。文章给出的数字是,模型从八十 B 续训到六百一十七 B 时,增量续训只用了完整训练量的百分之五点三;在八十 B 和六百一十七 B 版本上,平均效果分别提升大约零点九九和一点零三个百分点。这里的数字来自团队文章,应该把它当作发布方口径,真正的泛化能力还要等更多独立复现。1:29主播另一条来自量子位的消息,是兔展智能团队联合北京大学、鹏城实验室研发的 UniWorld-View 登上 WorldScore 世界模型榜单首位,并适配国产昇腾算力,代码和权重全部开源。它的卖点不是又一个聊天模型,而是从一张图片或一段视频出发,按指定的相机轨迹生成新的视角视频。1:53主播这两件事放在一起看,模型竞争的单位正在变。以前最容易传播的是参数量和榜单名次;现在还要问,它能不能在自己的输入里安排更多计算,能不能理解空间变化,能不能在不同硬件上被真正跑起来。对开发者来说,开源代码和国产算力适配,比一个孤立的分数更接近可用性。 更重要的是,世界模型和语言模型正在碰到同一个问题:它们不能只在静态数据上表现好,还要把「下一步会发生什么」变成可计算、可检查的中间过程。这个过程如果只靠更长的输出,成本会很高;如果完全藏在模型内部,又不容易调试。今天这些方法还没有给出最终答案,但它们把竞争从「谁的回答更像人」推进到了「谁能更有效地分配推理和环境反馈」。2:46主播机器之心今天讲了腾讯微信团队的 SkillHone。它处理的是一个很具体的麻烦:一个 Skill 这周修好了,下周换了网页结构、接口或任务,Agent 又把旧坑踩一遍。SkillHone 会保存每一轮优化中的诊断、候选修改、评估证据和最终决定,形成一份可以被下一轮 Agent 继续使用的决策历史。3:11主播文章中的案例显示,经过五轮优化,探针准确率从百分之三十提高到百分之七十;拿掉决策历史,准确率会下降十三点四和十点九个百分点,移除角色隔离也会下降六点四和五点三个百分点。这些是论文和项目给出的实验结果,不等同于所有企业流程都能得到同样的提升,但它说明一个方向:持续改进的对象,已经从「模型」扩展到了模型使用的工具和规则。3:43主播这对企业很实际。今天很多团队把 Agent 当成一个会写答案的员工,出了错就重新提示一次。SkillHone 代表另一种做法:把失败原因、改动依据和验证结果也当成工作资产。这样下一次接手任务的 Agent 不必从零猜测,人的排错经验也更容易沉淀下来。4:05主播AI 新榜今天介绍了 TRAE Work 的官方 AI 工作知识库。它不是继续堆一百个「神级 Prompt」,而是按真实任务组织内容:七大工作场景、三十多份实战指南、超过四十万字的完整内容。文章还提到,上线六小时累计访问超过一点八万。这个访问数字属于项目方或文章披露,不能直接当成长期留存证明,但产品思路很明确:用户想做的是行研、写稿、处理数据,不是练习调用某个插件。4:40主播腾讯研究院副院长袁晓辉则把问题推到了组织层面。他用阿姆达尔定律举了一个例子:如果百分之八十的工作提速十倍,剩下百分之二十完全不变,整体速度大约只提高三点五七倍。个人都变快了,公司却没有跑得同样快,卡住的地方通常是协作、判断和反馈,而不是某一个人的打字速度。5:04主播所以工作知识库的价值,不只是让新人更快上手。它还要把任务的输入、交付标准、检查步骤和复盘记录放在一起。否则 Agent 只是把每个环节各自做快,最后还是要人来拼接、返工和确认。对企业而言,真正要采购的可能不是一个聊天窗口,而是一套能被审计、能被交接、能持续修改的工作流程。 这里还有一个容易被忽略的门槛:知识库不是把资料集中到一个文件夹里,而是要让 Agent 知道什么时候读取哪份资料,哪一步需要引用原始数据,哪一步必须交给人确认。换句话说,企业真正需要的是任务的状态机。资料是输入,Agent 的动作是过程,验收和回滚是出口。没有这三个部分,知识库越大,检索到错误内容的机会也可能越大。6:00主播如果 Agent 不只是用户问一句才运行,它就需要更多后台算力。甲子光年今天转述 PPIO 联合创始人姚欣的判断:未来绝大多数 Token 流量可能来自 Agent。文章披露,PPIO 日均 Token 消耗量从二零二五年十二月的两千七百一十亿,增长到二零二六年六月的一点二万亿,注册开发者从十二点五万增到六十六点六万。6:25主播这些数字来自企业访谈和公司口径,不能当成全行业统计。但它们至少说明了一个变化:云服务的竞争不只在于有没有 GPU,还在于能不能让大量小任务稳定排队、调用工具、保存状态,再把结果交回业务系统。PPIO 把自己的方向称为 Agentic Cloud,名字可以先放一边,需求变化是真实的。6:51主播三十六氪今天报道,原粒半导体完成超七亿元 A 轮融资,三个月累计融资超过十二亿元,首款芯片已经完成工程验证。它把芯片定义成面向 Agent 的端侧生产力平台。这里也要留一个问号:融资和工程验证是进展,不等于产品已经被大规模采购。企业最终会看延迟、功耗、软件生态和长期供货,而不是只看一张融资公告。7:20主播从 Token 工厂到 Agent Computer,行业都在把「后台长期运行」当成新的硬件和云计算问题。开发者接下来要关心的,可能是调用是否稳定、状态能不能恢复、成本能不能按任务拆开算,而不是只比较一次对话的峰值速度。 这也会改变计费方式。一次问答可以按输入输出 Token 计费,但一个长期 Agent 还会产生检索、浏览器操作、代码执行、失败重试和人工复核。未来用户买的可能不是「模型每百万 Token 多少钱」,而是一项任务完成得是否稳定,以及一次失败会浪费多少时间和算力。对平台来说,如何把这些成本透明地记在每个任务上,会成为比宣传参数更难的产品问题。8:10主播爱范儿今天体验了 Vertu 的 AlphaFold 大折叠手机。它起售价三点九七万元,最高接近五十万元,主打 Hermes 智能体,宣称可以连接七十多个应用,控制六十四项手机设置。文章的体验并不完全乐观,部分功能被认为不够稳定,而且它能做什么,很大程度上仍然取决于手机系统和外部服务。8:36主播这件事对普通用户的提醒很简单:AI 写在产品介绍里,不等于权限、稳定性和责任边界都已经解决。越贵的设备,用户越有理由问清楚,Agent 到底能改什么,失败后谁来确认,数据会经过哪些服务。价格本身不能替代可验证的体验。8:57主播硅星人 Pro 今天还介绍了 Mind Lab 的 Macaron V1。它把 GLM 五点二冻结成基座,再挂上多个 LoRA 专家,形成一个混合结构。文章称,七百四十八 B 的版本里,大约七百四十四 B 来自原基座,Mind Lab 自己训练的部分约四 B;在十二项评测中,它有七项超过 GPT 五点五和 Claude Opus 四点八。这个结果仍然主要来自项目方和文章测试,不能直接理解成全面超越。9:30主播但路线很有意思:模型不必每次都从头变大,也可以在一个稳定基座上,把针对聊天、编程、界面操作的专家能力逐步挂上去。对企业来说,这种方式可能更容易控制成本和版本;对开发者来说,关键则是专家之间会不会互相干扰,以及长任务的稳定性是否真的提升。 把专家能力挂在基座上,还有一个版本治理问题。一个企业可能希望财务专家保持稳定,销售专家快速迭代,安全策略则必须经过审批。如果所有能力都跟着一个大版本一起更新,风险会集中爆发;如果每个专家都能独立更新,系统又需要更严格的兼容性测试。模型的模块化,最后会落到很传统的软件工程问题上:谁有权限改,怎样做灰度,出了问题怎么退回上一版。10:25主播晚点 LatePost 今天对话了姚颂,他正在做正行创新,方向是物理 AI 和通用机器人。文章里有一句很有用的判断:物理 AI 不是单个模型的问题,还要把场景、数据、算力、人才和系统工程放在一起。这个行业很容易被一个漂亮演示吸引,但真正难的是让机器人在不同环境里重复完成任务。10:51主播刘润今天整理梁文锋的十八条决策原则,提到 DeepSeek 约两万张 H 等效算力、美国头部公司约二十万张,价格也曾降到原来的四分之一。这是对一篇内部交流实录的二次整理,数字和观点都应该按文章口径理解。它给创业者的启发不是「少花钱就能赢」,而是资源有限时,怎样把算力、团队和产品目标压到同一条主线上。11:20主播把今天这些消息放在一起,我看到的不是一个新的万能模型,而是一条更具体的产业链:模型要能在训练后继续吸收经验,Agent 要能按工作知识运行,云和芯片要能承担后台调用,企业还要把协作和验收接上。任何一环掉链子,用户看到的仍然只是一个偶尔很聪明、偶尔很麻烦的聊天窗口。 这也是为什么,今天的消息看起来分散,却可以放进同一个判断里。模型研究在解决「怎样多想一步」,Skill 和知识库在解决「怎样把这一步放进流程」,云和芯片在解决「怎样让它持续跑」,组织管理则在解决「怎样让结果被别人接住」。四个问题合在一起,才是 Agent 从演示走向生产的完整链条。12:13主播如果你是开发者,今天可以优先看两件事:一是 SkillHone 这类方法怎样保存工具优化历史,二是工作知识库怎样把任务拆成可复用的流程。如果你是企业负责人,先别急着问模型分数,问清楚 Agent 的权限、失败回滚、状态保存和验收记录。如果你是普通用户,看到手机或办公软件宣称「智能体」时,先看它到底能不能稳定完成一件具体工作。12:44主播今天的 AI 听到这里。明天我们继续只看当天的新消息,晚安。