AI听:从会聊天到会行动,今天的十条验证题Chapters1×0:00开场:今天的变化,不只是更会回答0:37第一章:手机开始遥控一项任务2:03第二章:办公智能体先把产品边界摊开3:13第三章:推理开得越大,结果未必越好4:27第四章:世界模型先学会承认自己看错了5:55第五章:Action 不该只在最后补课7:12第六章:触觉不是多接一根数据线8:41第七章:社会世界模型在模拟什么10:02第八章:会自我改进的系统,谁来评它11:28第九章:资本开始问,用户留下来了吗12:53第十章:普通人今天该看什么0:0014:210:00主播晚上好,这里是 AI 听。今天的十篇白名单文章放在一起看,变化不在于模型又多会聊天了一点,而在于它们开始被要求替人推进事情,理解真实环境,还要拿出能持续赚钱的结果。0:16主播办公智能体要面对授权和审批,世界模型要面对动作到底准不准,研究型智能体要面对评估器会不会被钻空子,应用公司则要证明用户愿不愿意持续付费。今天沿着这条线听下来,AI 正从「给答案」移动到「做事情」,只是「做成」还远没有变成默认结果。0:37主播新智元写到,奥特曼在七月二十六日深夜发帖,说自己用手机让 ChatGPT 替他和八个朋友安排一个长周末旅行。0:47主播任务不是查一份攻略,而是用聊天记录找点子,规划三个方案,做一个供九个人讨论的全栈网站,等大家达成一致后再预订,还要在 Gmail 里起草邮件。ChatGPT Work 的 Sites、插件和定时任务,分别负责建站、连接外部应用和重复运行。1:09主播但文章也把边界写清楚了:Work 能读什么、什么时候询问、动手前要不要批准,由用户和工作区管理员决定。邮件最后仍然要由人审定和发送,付款、授权和个人数据也没有交给模型自行拍板。1:27主播对普通用户来说,真正值得观察的不是它能不能生成一个漂亮网站,而是它能不能把一件跨几天、跨多个应用的事持续盯住,并在关键节点把决定权交还给你。1:41主播这也改变了验收方式。以前检查一个聊天回答,通常只看这一轮说得对不对;现在要检查任务有没有漏步骤,外部数据有没有过期,最后的草稿和实际动作是不是两回事。对个人用户,先从低风险、可撤回的事务开始,更容易看清它到底替你省了多少时间。2:03主播赛博禅心的速测文章称,千问办公网站已经上线。它不是钉钉里的一个小功能,而是一个独立的 Agent 办公产品,同时打通钉钉生态,可调用消息、日程、文档、知识库、表格和审批,也支持定时任务、连接器以及 Word、PPT 和 PDF 处理。2:26主播文章列出的月费是零元、九十八元和一百九十八元三个档位,但它也特别注明,产品官方还没有正式发布,最终形态以发布为准,连接器和自定义能力仍在变化。2:40主播这件事对企业的启发很直接:办公 Agent 的差异不只在回答质量,还在它能碰哪些系统,任务能否排队和复跑,权限怎么管,出了错谁来审核。功能列表很长,真正决定能不能部署的是最后几项。2:58主播如果产品还处在速测阶段,企业也不必急着把它接进核心流程。先用没有付款和敏感信息的内部任务,记录它的成功率、人工返工时间和权限请求次数,往往比看一张功能清单更有用。3:13主播量子位今天提醒了一个很实用的模型使用细节。有人在 FrontierCode 编程基准上,把 Opus 五的推理档位从低一路调高,结果 medium,也就是中档,反而接近性能峰值,拉到 max 并没有继续变好。3:31主播对信息提取、分类和短文档,多出来的预算可能只会让模型反复检查,偏离要求。修几行代码时,高档位还可能顺手重构无关函数、改导入、重命名变量,把小补丁扩成大改动。3:47主播文章建议,机械任务用低档,日常编码和审查用中档或高档,只有长时间自主运行的任务才考虑更高档位。切换 effort 档位还可能让上下文缓存失效,所以单轮价格下降,不代表整个工作流的成本一定下降。4:06主播这条经验并不只属于 Opus 五。任何可以调推理预算的模型,都应该先按任务类型做小样本对照,比较完成率、延迟、返工和总 Token,而不是只比较一次回答的长短。对一个固定流程,稳定命中缓存也可能比临时把油门踩到底更划算。4:27主播机器之心介绍的 CD-LAM,瞄准的是世界模型里一个容易被画面掩盖的问题:视频看起来流畅,不等于动作控制正确。4:38主播研究团队发现,普通的隐动作模型会把背景、场景和镜头变化也编码进动作表征。世界模型于是可能只凭画面连续性猜下一帧,没有真正理解「这个动作会带来什么结果」。CD-LAM 先把上游隐动作去偏,再训练世界模型,最后接入真实机器人动作。4:59主播文章称,去偏后动作误差下降超过百分之三十,后训练只需要三千到六千步,训练开销约为基线的百分之十。接入真实机器人动作后,二 B 和十四 B 模型的动作误差分别下降百分之三十四点八和百分之三十点四。5:18主播更值得记住的是评测方法。传统画面指标,比如 PSNR,和动作误差的关联很弱。对机器人来说,画面像不像只是第一关,给定动作有没有改变结果,才是更接近使用的问题。5:35主播论文还做了两种干预测试:把动作全部设成零,看机械臂会不会保持静止;再把动作换成另一段序列,看生成轨迹会不会跟着变。基线模型在这两种测试里都暴露出问题,这说明动作控制要用干预来检验,不能只看一段顺滑的视频。5:55主播Z Finance 对 NVIDIA Cosmos 负责人的专访,把问题往训练路线又推了一步。受访者认为,Action 不应该只放在后训练阶段,而应该成为预训练的一部分。6:08主播Cosmos 的方向,是把视频、音频、文字、图像和动作放进同一个多模态体系。文章提到,模型规模从二 B 到八 B 再到三十二 B,八 B 可能是从「还不能工作」到「突然有效」的重要台阶,三十二 B 更多是在减少瑕疵、提升稳定性。6:29主播但一个动作模型不能直接适配所有机器人。不同设备的低层控制很难统一,高层目标和部分中层控制更有机会迁移。对企业来说,工程难题仍是硬件、数据和控制器之间的配合,不是接上一个更大的模型名称。6:51主播受访者还把 critic、world model、action,以及 memory 和 long context 都列为具身系统需要的能力,不过他同时承认,短期任务的可靠性问题还没有解决。长上下文不是自动驾驶式的万能钥匙,先把几秒钟之后的动作做好,仍然是更近的考题。7:12主播硅星人 Pro 写到,李飞飞等研究者的 T-Rex 项目,让灵巧手用触觉完成真实操作。十二项真实世界任务里,T-Rex 平均成功率百分之六十五,最强纯视觉基线是百分之三十五,翻书页是百分之九十六对百分之六十八,开锁是百分之七十对零。7:31主播但一个反直觉的结果更重要:把触觉直接拼到预训练 VLA 模型上,成功率反而从百分之十七降到百分之六。T-Rex 让单独的触觉专家处理高频信号,再和视觉、语言及动作规划配合。7:47主播触觉反应要求毫秒级,视觉模型通常只有每秒五到十帧,传感器还会有漂移和噪声。项目使用一百八十赫兹的触觉信号,训练分成大规模视频、中期遥操作和任务演示几个阶段。8:06主播具身智能的难点,越来越不像「再加一个模态」这么简单。每种感知都有自己的频率、噪声和数据成本,系统必须知道什么时候该听视觉,什么时候该听触觉。8:18主播T-Rex 的架构把视觉语言、低频动作规划和高频触觉精修拆成不同专家,触觉还要看过去约半秒的十六帧历史,并压缩成离散码字。这个设计说明,真正的多模态不是把输入拼在一起,而是让不同感知在各自合适的时间尺度上工作。8:41主播Founder Park 带来的是另一种世界模型。境瞳科技完成数千万元人民币天使轮融资,文章称其社会模拟器里已经运行超过一千三百五十万个拟人化 Agent,覆盖一百多个国家。8:57主播这套系统模拟人的意图、社会反应和群体协同行动,按个体心理、交互动力、群体行为和社会制度分层,使用中国综合社会调查数据来设置人口特征、价值观和社会关系。落地方向包括营销和公关、产品改版与定价、政策预演。9:19主播公司计划在二零二六年下半年把规模扩到一亿个 Agent,为二零二七年的社会世界模型预训练积累状态数据。这里要保留一层谨慎:一千多万个模拟 Agent 是文章转述的公司披露,不等于已经准确预测了真实社会,结论仍要和现实结果长期对照。9:41主播社会模拟器的价值,最终也要落到可比较的决策上。比如同一个定价方案在模拟里引发了什么反应,现实市场是否出现相近变化。如果只展示 Agent 数量,不公布预测误差和失败案例,规模本身不能证明模拟器有用。10:02主播集智俱乐部介绍的红皇后协同演化哥德尔机,把注意力放在评估器上。智能体如果只对着固定指标优化,很容易学会迎合指标,而不是把任务做好。10:16主播RQGM 在一个 epoch 内固定评估标准,到了边界再更新 utility 和 evaluator,让智能体和评估器一起演化。它还保留人工标注的黄金测试集,替换评估器后,旧评估器产生的历史效用记录会被擦除或标记失效。10:35主播文章称,在 Polyglot 编程任务上,它节省了一点三五到一点七二倍的搜索 Token;在 IMO 评分任务上,搜索成本约为此前最好方法的三分之一。实验结果只适用于文中任务,不能直接当成通用自我改进已经解决。10:55主播对企业 Agent 的提醒是,验收标准不能只写一次。业务变化后,评估器也要更新,同时保留一小组稳定、可信的基准,才能分辨模型是真进步,还是只学会了讨好评分表。11:10主播这也是为什么文章提到的 Goodhart 定律值得留意:一个指标一旦变成目标,就可能失去衡量目标的能力。真实部署里,最好同时看固定基准、人工抽检和线上业务结果,三者互相打脸时,先停下来查原因。11:28主播36 氪今天讨论了 AI 应用的估值标准变化。文章的判断是,资本越来越看重正毛利、高留存和持续付费,DAU 不再是唯一指标。11:41主播文章举的海艺案例里,最近完成超亿元 B 轮融资,整体毛利率超过百分之四十,ARPPU 约六十美元,核心产品续费率超过百分之六十。它还披露了六千五百万累计注册用户和超过百分之九十的海外用户占比。12:00主播这些数字来自文章对企业案例的整理,不是独立审计结论,更适合当成商业化信号。文章自己也提醒,用户规模和付费数字都不是终点,还要看单位经济模型能不能长期成立。12:17主播放回前面的新闻,逻辑就清楚了:Work 要证明任务真的完成,世界模型要证明动作真的可控,应用公司要证明用户真的愿意留下来。下一轮竞争会越来越少靠一句「能力很强」,越来越多靠可复核的结果。12:33主播对创业团队来说,这个变化也会影响产品路线。一个小而稳定的付费工作流,可能比一个高峰期很热、但每次调用都亏钱的应用更有价值。先把单位成本、续费和人工介入记下来,才能知道增长是不是在放大损失。12:53主播爱范儿从手机市场讲了另一条入口。文章预计,二零二六年中国新出货手机里,AI 手机渗透率可能达到百分之五十三,厂商希望把手机从一次性硬件变成持续提供 AI 服务和订阅的入口。13:08主播但文章也提醒,很多产品现在仍是「AI 加手机」,还不是彻底重做的原生 AI 终端。不同地区的合规、外部模型合作和权限控制,也让单一模型覆盖全球变得困难。13:24主播所以普通用户挑 AI 产品时,可以少看一点发布会里的 Agent 故事,多问三个问题:它能替我完成哪一段具体流程,关键动作是否需要我确认,出了错有没有办法追溯和撤回。13:40主播还可以把手机和办公软件里的智能体当成实习同事来用:给它范围清楚、风险可控的任务,要求留下中间结果,涉及发信、付款和删除时必须人工确认。这样既能试出能力,也不会把一次演示当成长期授权。13:58主播今天这些文章给出的不是一个已经完成的答案,而是一组更具体的测试:模型能不能少做无关改动,世界模型能不能让动作跟着指令变,模拟器能不能被现实验证,应用能不能把用户留住。AI 从演示走到日常使用,真正要交的是这些作业。这里是 AI 听,我们明晚再见。