AI今天开始长出自己的工作系统Chapters1×0:00开场0:27工作上下文开始变成基础设施2:55入口不再是一台设备5:37AI转型先改变组织,再改变软件8:06机器人把记忆拉进动作10:04评测也要从指标变成系统11:39空间能力开始交给可计算的部分12:54模型市场的中间层正在重新定价14:27收束0:0015:460:00hostVoice今天最值得注意的,不是又有哪个模型刷新了榜单,而是越来越多的人工智能,开始直接伸手去拿我们的工作上下文。0:10hostVoice晚上好,这里是 AI听。0:11hostVoice今天我们沿着一个问题往下听:当模型、工具、手机、汽车和机器人都能做事以后,谁来把这些能力组织成一件真正办完的事?答案可能不再是一个更大的模型,而是一套自己的工作系统。0:27hostVoice先看企业内部。三十六氪今天报道了一家叫沌序科技的新公司。它没有把自己定位成又一家基础模型公司,而是提出要在现有智能单元和应用之间,增加一层叫 Organization Layer 的组织层。0:42hostVoice这层组织层要做的事情很具体:把能力不同、成本不同、形态不同的模型、设备和智能体接起来,分配任务,让它们互相反馈,再把一次有效的协作沉淀成下一次可以复用的规则。三十六氪把这条路线称为 Collective AGI,也就是群体人工智能。1:04hostVoice这篇报道里有一组很能说明问题的材料。团队在低空安全方向积累了五十 TB 以上的多模态无人机探测数据、超过一千五百万帧有效标注目标样本和两千多次实验。数字很大,但真正难复制的不是数字本身,而是换天气、换设备、通信延迟和节点故障以后,系统还能不能继续工作。1:27hostVoice更值得留意的是,这家公司从种子轮交割不到三个月就长到五十多人,但从研究所出来的只有大约十人。创始人没有把原来的实验室整体搬过去,而是要把研究团队、市场、工程和外部协作者放进一个新的组织里。一个研究群体如何协作的问题,反过来成了公司的产品和管理问题。1:52hostVoice量子位今天报道的另一个项目,把同一个瓶颈放到了办公桌上。阿里千问办公开源了 MyContext。它的目标,是把钉钉聊天、文档、会议和业务记录里分散的历史信息,持续加工成每个人可以授权给 Agent 使用的工作档案。2:11hostVoice量子位转述的设计里,每条结论都保留了能回到原始聊天、文档和会议记录的证据链;信息也仍然受个人和组织权限约束。遇到事实冲突时,系统不是简单只留最新的一条,而是保留冲突、降低置信度,把还需要人拍板的地方露出来。2:32hostVoice这对开发者的提醒是,接入一个工具不等于接入了业务。真正的前提,是数据来源、权限、版本变化和证据链都能被管理。对企业来说,最贵的可能不是再买一个模型,而是把那些人都知道、机器不知道的背景,整理成机器能够安全使用的上下文。2:55hostVoice如果说 MyContext 在补数据加工层,爱范儿今天写到的支付宝 AHA,则是在补服务之间的连接层。AHA 的全称是 Agent Hub Access,也就是智能体之间的跨端互联体系。3:10hostVoice爱范儿转述,在支付宝的演示里,用户只要说一句帮我叫车、顺便买咖啡,第二天再让它把发票发到邮箱,背后就可能是手机里的 Agent、支付宝里的服务 Agent 和商家服务接力完成。自六月开放测试以来,超级服务智能体阿宝已经完成万余项服务的智能化适配,覆盖出行、餐饮、文旅和政务民生等场景。3:38hostVoice它还披露了跨端合作的规模:已经和五家主流手机厂商打通协同,合作厂商的市场份额超过百分之七十;车端覆盖十六家主流车企品牌,并和六十多家车企达成合作意向。这里要分清楚,这些是大会和报道转述的合作进展,不等于每个用户今天都能用到完整链路。4:01hostVoice爱范儿还提到一个很重要的边界设计:用户的隐私和偏好留在手机端,服务履约和支付留在阿宝端,两边按权限协作,而不是把所有数据都交给一个总管。支付宝把这个合作过程概括成三堵墙:信任、技术,以及支付和金融属性带来的安全互信。4:23hostVoice同一天,赛博禅心只用一条很短的更新,展示了另一种入口变化:企业微信已经可以被 Codex、Claude Code 和 WorkBuddy 这类 Agent 调用,文章给出的方式是通过一个统一的技能包安装。信息量不大,但它说明一个趋势,企业协作软件正在从人操作的界面,变成 Agent 能调用的工作能力。4:47hostVoiceMacTalk 对豆包更新的实测更完整。豆包的工作任务可以在本地电脑或云电脑里执行,能操作浏览器,能复用技能和连接器,还能通过手机远程发指令,让桌面端继续跑任务。Mac 目前主要覆盖浏览器,Windows 的电脑操作更完整,这个限制不能略过。5:09hostVoiceMacTalk把这次更新拆成四层:电脑操作负责动手,技能负责按什么方法做,连接器负责读写飞书、企业微信、钉钉、文档和数据库等真实系统,工作伙伴则用角色和交付标准组织分工。对普通用户来说,最有价值的不是会话里多一个按钮,而是任务能不能被看见、随时暂停,并在写入业务数据前按需确认。5:37hostVoice一旦 Agent 真的进入公司,难题就不只是能不能调用,而是公司要不要为它重新分工。晚点 LatePost 今天发表的一篇深度报道,追踪了理想汽车两年多的 AI 转型。5:50hostVoice晚点采访了近二十位理想在职和离职员工,并明确说统计并不完整。报道提到,理想在今年一月把研发体系从智能驾驶、智能座舱这样的汽车功能,改按基座模型、软件本体和人形机器人分工;两年里,超过二十名技术骨干离开,其中至少六人曾是高级管理者或关键技术负责人,理想前员工创办或加入的具身智能公司至少有六家。6:19hostVoice这不是一个简单的转型成功或失败故事。报道写到,理想早期的端到端智驾项目开发很顺利,但后来把语言模型加入驾驶方案时,复杂场景的应对成功率一度只有端到端方案的八成。原因之一,是语言层拉长了推理链路,而驾驶是毫秒级的连续决策。后续更新把响应时间缩短到两百毫秒,加减速控制也逐步交给模型,体验才有所改善。6:47hostVoice另一条线索来自公司内部推广。理想给员工统一接入多种 AI 应用和调用额度,也办培训和答疑。但晚点同时记录了员工的疑问:大家做了很多 Agent,最后到底给公司带来什么收益?对多人协作来说,一个人用 AI 变快,不代表十个人把模型生成的代码放到一起以后,项目就同样变快。7:11hostVoice经纬创投今天整理的黄仁勋访谈,给出了一个更抽象但很实用的答案。黄仁勋回忆,英伟达最初选的技术路线完全错了,团队只好承认现实,从教材重新学起。他把经验压成四件事:发现错了要转向,不懂的事要尽快学,创始人要靠近一线,先开始再逐步解决困难。这里是经纬创投对访谈的整理,不是独立管理学实验,但它和理想的故事放在一起,形成了一个清楚的对照。7:43hostVoice公司如果只采购工具,最后得到的是一张很长的工具清单;如果它能重新定义谁拥有上下文、谁有权限执行、谁负责验收,才可能把个人效率变成组织能力。对企业负责人来说,今天真正要问的不是员工装了几个 Agent,而是哪些任务已经有了可复用的流程、指标和责任人。8:06hostVoice从软件组织走到机器人,问题会变得更硬。甲子光年今天报道,具身智能的演示正在从跑跳、抓取和搬运,变成连续做完一串任务。机器人做一份早餐可能要三到五分钟,工业任务则可能连续几十步。前一步出错,后面的任务链都可能跑偏。8:27hostVoice甲子光年重点介绍了墨奇智能的 MoRA 架构和 Agentic Native 路线。它保留系统二负责理解目标、组织任务和全局看护,但让系统一,也就是直接看视觉和触觉、输出动作的部分,同时持有目标、保存执行记忆、判断当前进度。只有遇到能力边界或异常状态,才请求系统二介入。8:53hostVoice这个设计解决的是一个很具体的场景:机器人去冰箱补货,中途转身拿水,再回到原位。视角变了,物品也可能被挪动,但补货这个目标不能丢。文章写到,墨奇要在世界机器人大会展示的家庭任务大约持续十五分钟,从整理桌面、补冰箱到处理衣物。这个展示是报道中的计划和公司信息,不能提前当成已经被独立验证的通用能力。9:21hostVoice甲子光年还转述了墨奇的另一组数据:目前约有三万小时可直接进入训练的高质量真实场景数据,计划到二零二六年底扩大到十五万至二十万小时。报道同时把真正的难点说得很清楚,人类第一视角数据不能直接等于机器人数据,场景、身体结构和动作空间还要做迁移。9:45hostVoice所以具身智能的竞争,正在从学会一个动作,转向能不能记住目标、处理新状态、完成闭环。开发者要看的不只是演示视频里有没有抓起来,而是任务持续多久,失败后怎么恢复,数据如何回流,模型在哪一层承担延迟。10:04hostVoice当任务变长,评测也不能只盯着最后一个分数。机器之心今天报道,MirroS 联合清华、北大、伯克利、麻省理工、英伟达等机构发布了 HarnessEval。它把原来用于组织 Agent 执行任务的 Harness,搬到了评测系统里。10:22hostVoice机器之心的解释是,复杂 Agent 的能力不只来自模型,还来自上下文管理、工具调用、记忆、任务拆解、权限和结果验证。既然被测对象已经是一套系统,评测也要成为一套系统。HarnessEval 不是简单增加一列指标,而是让评测智能体先理解案例,再选择要用的技能,拆解出可验证的问题,最后审计证据再给分。10:48hostVoice它想交付两层结果。一层仍然是方便比较的量化分数;另一层是 evidence tree,也就是证据树,记录测了什么、为什么这样测、调用了什么工具、找到了哪些证据,以及证据怎样支持最终判断。11:03hostVoice机器之心写到,HarnessEval 先把交互式世界模型当成试验场,因为视频可能画面很漂亮,却让物体消失,违反接触关系,或者在镜头移开以后忘掉场景。对于普通用户,这个变化也很实用:看到一个榜单分数时,可以继续问,它测的是最终答案,还是连同过程、状态和失败原因一起测了。11:28hostVoice这和前面 MyContext 的证据链其实是同一个方向:AI 不只要给结果,还要让人知道结果从哪里来、在哪些条件下成立、出了问题能不能追溯。11:39hostVoice研究侧也出现了一个很有代表性的拆分。新智元今天介绍了浙江大学 ReLER 团队开源的 PhyEdit。它不是让图像模型凭文字想象一个物体应该移动到哪里,而是先用三维模型估计几何关系,把物体搬到用户指定的位置,再交给图像编辑模型完成渲染。11:59hostVoice新智元转述的结果里,在 ManipEval 评测上,PhyEdit 的 DIoU 是六十五点三三,盲测整体偏好率是百分之七十八。这样的数字只能说明论文作者报告的评测结果,不能直接等同于所有图片编辑任务的普遍优势。12:18hostVoice这个项目的边界也写得很清楚。三维轨迹仍然由用户提供,它不是会自主预测动作的动力学模型;它处理的是几何位置、尺度和遮挡,不计算力、碰撞或完整动力学。透明反光物体、极端近景和严重的深度分割错误,仍然可能失败。12:40hostVoice这给产品和开发者一个可迁移的思路:把空间里可以计算、可以验证的部分交给几何模块,把身份、纹理和自然画面交给生成模型。不要指望一个更长的提示词,自动解决所有三维歧义。12:54hostVoice最后看一条资本和基础设施信号。硅星人 Pro 今天转述 Axios 和彭博的报道,Stripe 已同意收购模型路由公司 OpenRouter,交易价格超过七十亿美元,另一家媒体给出的估值超过八十亿美元。这里的金额存在报道口径差异,所以我们只保留超过七十亿美元这一层。13:14hostVoiceOpenRouter 的位置很特别。硅星人 Pro 写到,开发者接入一个接口,就可以在四百多个模型之间切换;平台按调用计量、定价和路由,某个供应商出问题时还可以切换到另一家。文章引用的数据显示,OpenRouter 的开发者超过八百万,平台每周处理的 Token 达到二十五万亿。13:36hostVoice它为什么会变得值钱?因为模型越来越多,而且能力、价格和可用性差异越来越大。硅星人 Pro 转述,二零二六年年中,中国模型一度占 OpenRouter 企业流量的百分之四十六,DeepSeek 和 Qwen 在平台上占据很高的使用份额。文章也提醒,这些是平台局部统计,直接调用官方接口的企业、免费额度和测试流量,都可能改变榜单。14:05hostVoice对开发者来说,中间层的价值不只是省一次接入工作,更是让模型选择、成本、故障切换和可观测性变成一个系统问题。对模型厂商来说,低价和免费额度能换来开发者注意力,但平台的分发效应和收入结构,未必全部留在模型厂商自己手里。14:27hostVoice腾讯研究院今天复盘一场 AI 游戏创作黑客松时,统计了五百六十一件代表性作品。三个人、三天做出游戏 Demo 的故事,不再只是个别高手的奇闻;工具已经把念头推到能运行的成本压低了。14:44hostVoice但腾讯研究院也把后半句写出来了:AI 进入创意、代码、美术和测试之后,作品还是要面对稳定运行、持续打磨,以及怎样被玩家发现。门槛下降,供给会变多,专业能力没有消失,只是人的位置更往上游移动,要定义问题、拆任务、交接上下文和验收结果。15:07hostVoice刘润今天写到,他会把 AI 当成提高收集、核实和比较效率的工具,而不是替自己产生判断的机器。把今天的线索放在一起,我觉得这句话正好落在结尾:AI 正在接管越来越多的动作,但真正的工作系统,必须把上下文、组织、证据和责任一起接上。15:29hostVoice所以今晚可以留下一个具体问题:你愿意把哪一件工作交给 Agent?先别问它会不会做,先问四件事:它看到了哪些上下文,它能调用什么权限,它怎样证明做对了,以及出错以后谁能把事情停下来。