AI今天从会回答,走到要办完了Chapters1×0:00开场:从会回答到能办完0:35端侧算力与异步编程 Agent3:41入口变成软件商店与新模型传闻7:34旅行与办公 Agent 开始履约10:53上线之后,Agent 能不能成长12:57模拟用户如何帮助评测产品14:46AI 搜索的商业化难题16:33具身数据与治理责任18:52收束:能力接管入口之后0:0020:120:00hostVoice晚上好,这里是 AI听。 今天的线索,不是又一个模型刷新了榜单,而是模型开始被要求完成一件更难的事:从会回答,走到能办完。今天十五篇白名单文章,分别写了端侧芯片、AI 编程、Agent 商店、旅行履约、办公入口、持续学习、模拟用户和商业化。把它们放在一起看,变化很清楚:模型能力正在变成入口,入口正在变成工作流,而工作流最后必须面对真实世界的成本和责任。0:35hostVoice先从算力说起。量子位报道,新加坡 AI 计算基础设施公司 Acrab 完成了一点三亿美元 B 轮融资,累计融资超过四点八亿美元。公司成立不到两年,已经发布第一代端侧 AI 芯片 GΞLIX 1,以及搭载它的个人 AI 中心 Agent Box。 这里有两个口径要分开。融资和产品发布,是报道转述的公司与投资方信息;文章里提到的七百 TOPS 峰值算力、长上下文 Prefill 速度,则主要是公司自测。公司称,在运行 Gemma 二十六 B、四万 Token 上下文缓存和一万 Token 输入的条件下,平台 Prefill 达到每秒一千四百一十六 Token,比业界领先端侧平台快七倍。这个结果值得关注,但还不能当成第三方性能结论。 Acrab 真正押注的,不只是更快的 NPU,而是 Agent 长时间运行之后,终端会需要一套完整底座:统一内存、CPU 和 NPU 协同、长上下文处理、Runtime,以及工具编排。因为 Agent 不是问一句、答一句就结束。它要读文件、保留状态、调用工具,再回来验证结果。高频、隐私敏感、需要低延迟的任务,可能会逐渐留在本地;最重的推理仍然会在云端。对开发者来说,端侧模型要比较的也不只是 TOPS,而是内存、带宽、软件栈和长时间运行的稳定性。 这也是为什么 Agent Box 比一台「本地大模型电脑」多了一层含义。它既是产品,也是参考系统:把芯片、模型、Runtime、记忆和工具调用放在一台机器里,先验证一条完整任务能不能跑通,再尝试复制到 AI PC、汽车、工业设备和机器人。真正要看的不是发布会上的一次演示,而是首批客户会把它放进什么设备,连续运行多久,以及出错后能不能降级到云端或人工。芯片融资只是起点,量产、生态和软件适配才是商业化验证。 同一篇量子位文章还写到,AI 编程公司 Cognition 的 Devin 年化收入逼近十亿美元,报道其新一轮估值目标直奔四百亿美元,三个月前还是二百六十亿美元。这里要特别说明,新融资当时还没有正式官宣,四百亿美元是报道中的估值目标,不是已经完成的交易。 Devin 和 Cursor 的分野,也正好说明 Agent 入口的变化。Cursor 更像人在编辑器里和 AI 一起写,Devin 则试图接过一个任务,自己读取工单、探索代码、编写代码、跑测试、修错误,再提交变更。Cognition 介绍的新能力,是三秒准备一套带代码仓库、依赖和环境变量的工作快照,并支持多个系统环境。真正的竞争于是从「能不能补一行代码」,转向「能不能在异步状态下把一件事做完」。3:41hostVoice第二章,我们看入口。新智元今天报道了 Claude 相关的新消费入口,也有一条关于 Ilya Sutskever 首个模型的爆料。 先说确定性更高的一条。新智元介绍,Eazo 把自然语言创作、可运行的 App、三维世界和 AI Agent 放进一个 Feed。创作者不只生成一个答案,而是做出可以被发现、打开、使用和 Remix 的互动作品。赛博禅心也从另一篇文章补充了这个产品设想:它想做的不是又一个 AI 编程工具,而是一间可以持续装入 App、三维资产和 Agent 的数字商店。 这个方向的关键变化是,软件开始接近内容。过去软件要先发布到应用商店,用户再主动搜索;现在一个人描述想法,系统负责产品结构、前后端和部署,作品可以像内容一样被刷到、试玩和再创作。对创作者来说,难题从「我能不能做出来」转向「别人为什么要打开、能不能留下、反馈如何回到下一版」。对平台来说,分发、版权、权限、收益和质量筛选会一起到来。Eazo 方面披露过一万多名内测用户和十万多个 App,这些是产品方口径,不能直接等同于活跃使用和商业成功。 如果这个模式成立,Agent 商店卖的就不只是调用次数,而是发现和复用。用户可以把一个小工具当成内容打开,也可以把别人的作品拆开、修改,再变成自己的版本。但「能生成」和「值得使用」之间,仍然隔着稳定性、数据权限和售后。一个可以处理家庭记账的 Agent,谁能看到账单?一个能操作网页的 Agent,能不能替用户提交订单?当互动作品真的开始行动,平台就必须把作品质量和行动权限分开管理。 新智元另一篇文章则称,知名 AI 研究者 Ilya 正在 SSI 构建一个小型推理引擎,核心可能涉及测试时训练,也就是模型在推理阶段继续调整。这里必须把它放在传闻区:文章明确采用爆料口径,没有可供我们核验的正式产品发布、模型权重或技术报告。因此可以观察这个方向,但不能把「首个模型来了」当成事实。它至少提醒我们,基础模型的竞争可能从训练前的规模,转向推理时的适应速度和算力使用方式。 同样在模型之外,机器之心介绍了小红书开源的 dots.tts 语音合成基座。文章强调连续自回归、流式输出、音色与情绪控制,以及在基座上继续扩展语音编辑。它的价值不只是「声音更像谁」,而是语音可以成为 Agent 的实时接口:模型边想边说,用户可以只修改一句话的情绪、停顿或局部内容。文章里的榜单和测评来自论文及项目材料,开发者如果要接入,仍要用自己的语言、延迟和授权场景复测。 机器之心还报道了牛津和新加坡国立大学提出的心智世界模型方向。普通世界模型预测环境怎么变化,心智世界模型进一步尝试推断另一个智能体看到了什么、相信什么、接下来会怎么行动。对协作 Agent、机器人和游戏来说,这个差别很重要:系统不只要知道桌子在哪里,还要判断另一个人是否知道桌子在哪里。 但它也更容易带来误判。推断别人的信念,不等于真正理解一个人;在高风险决策里,模型推演只能作为辅助证据,不能替代当事人的表达和人的核验。7:34hostVoice第三章,从「能生成」走到「能履约」。特工宇宙今天报道,飞猪推出新一代旅行 AI「飞猪帮帮」,把能力分成「帮我想、帮我订、帮我办」。它不只生成攻略,还尝试处理实时价格、库存、下单、退改、值机、选座、升房、接送机和报销。 这里最值得听的是工程细节。产品团队没有把所有希望押在模型猜对上,而是让模型使用 A1、B1 这样的短别名,真实商品编号由后台回填;日期和行程的先后关系交给规则引擎;在线环节再对关键结果做即时校验。飞猪方面称,交付结果可用率评分比上一代提升超过七成,可比任务平均耗时减少近一成。这是官方口径,仍需要更多真实订单验证。 产品界面也没有完全变成聊天框。复杂的宠物、老人和预算要求适合用自然语言表达,但比较十家酒店、看退改规则、确认付款,列表、地图和按钮仍然更清楚。好的 Agent 产品可能不是用对话替代所有界面,而是让自然语言负责打开上限,让图形界面负责守住下限。 飞猪团队还把一个原则说得很直白:如果原来在 App 里点两下就能完成,就没有必要为了显得智能而改成一轮对话;只有过去做不到,或者需要用户花很大力气的任务,才值得重做。这个原则对所有 Agent 产品都适用。AI 的新增价值不是让每个按钮都变成聊天,而是把用户原本需要翻译、拆分和来回确认的复杂意图,交给系统处理。 飞猪这篇文章也承认,旅行履约还没有打通全链路。值机、升房和退订,牵涉航司、酒店和服务商的授权与接口。有些环节甚至还要依赖电话和客服。模型能理解需求,不等于产业链已经给它准备好标准动作。对企业来说,垂直领域真正值钱的 know-how,可能就是这些实时数据、规则、接口和出错后的补救流程。 百度搭子也在做类似的入口重构。Z finance 专访百度搭子负责人李景秋,文章介绍它从春节后立项、三月启动,在不到两周内做出内测版本,再逐步接入百度搜索、地图、数字人、文档和开发工具。 李景秋把办公 Agent 的特征概括为五件事:接受任务委托,而不是只回答问题;能调用各种工具;能感知设备和环境;能执行跨文件、跨步骤的长程任务;以及能反思、验证和修改。这里是受访者的判断,不是独立评测,但它提供了一个很实用的产品检查表。 对个人用户来说,统一入口的价值是少开七八个软件。对企业来说,难度更大:企业版要面对数据库连接、代码安全、权限审计、团队共享和资源消耗。也就是说,入口越统一,后面的管控台就越不能缺席。模型负责把任务拆开,系统负责让每一步都能被观察、被确认、被撤回。10:53hostVoice第四章,Agent 上线之后会不会成长。甲子光年今天专访火思动力创始人 Kevin Ding。他提出一个很简单的判断:今天的 Agent 已经会工作,但还不会成长。 一个 GUI Agent 可能通过更强的视觉模型、提示词和少量微调,修好已经见过的任务;但换一个新应用、新界面或新异常,成功率又掉下来。这说明它是在修已知的题,而不是把经验变成能力。 火思动力的观点是,Prompt、记忆、Harness 和工作流都很有用,但它们主要改变模型看到的上下文;只有持续后训练,才可能稳定改变模型自身。这个观点属于受访者和公司判断,并不是所有 Agent 的统一结论。固定流程、异常有限的任务,用工作流或一次性微调反而更简单;只有当环境持续变化、能力需要长期复利、人工维护已经很贵时,持续学习才值得投入。 文章给了一个实用区分:如果任务有固定 SOP,错误类型有限,规则和工作流足够;如果任务涉及多步决策,还要同时平衡效果、成本、合规和用户偏好,而且环境不断变化,才需要让生产数据和人工反馈持续回流。企业每天产生的数据,也不会自动变成能力。错误、复核和业务反馈要先变成奖励信号,再经过训练、评估和灰度上线,最后才可能变成下一次任务的改进。 企业选择 Agent,未来也许要多问一句:过去三十天,它学会了什么。数据不会自动变成能力,错误、人工判断和业务反馈,必须进入可验证的训练闭环。火思动力还分享了质检误报率、复核人力和大小模型协同的案例,但这些是公司披露的项目结果,不能当作跨行业保证。12:57hostVoice第五章,怎样知道一个 Agent 真的好用。集智俱乐部介绍了 MatrAIx 模拟用户评估框架。它用 Persona 8B、四类交互环境和一千零十项规范任务,尝试在真人测试之前,让大量具有不同经验、语言和风险偏好的数字角色去使用产品。文章报告了八十三亿条角色记录、一千二百九十个属性维度、一万八千一百八十九次试验,以及九十一点五%的行为遵循率。 但最后这个数字非常容易被误读。它证明的是模型在受控条件下能够遵循设定的人物行为,不是数字用户已经像真人,更不是可以替代真人证据。MatrAIx 更像发布前的压力测试:先找出新手、专家或高风险偏好人群可能遇到的障碍,再用真实用户研究去验证。 这套框架的另一个限制,是模拟用户本身也依赖一个驱动模型。同样的角色、任务和产品,换一个底层模型,可能得到很不一样的行为。角色属性之间还必须保持合理关系,比如年龄、教育程度、地域和语言能力不能随机拼接。研究提出的属性依赖和交互轨迹,能让测试更可重复,但不能把可重复误认为真实。尤其在医疗、金融和就业等高风险场景,数字角色最多帮助生成假设,最后仍要由真人和真实数据确认。 这也给开发者一个评测顺序:先测任务能不能完成,再测不同人群如何使用、在哪一步放弃,最后把模拟结果和真人结果交叉验证。不要只追一个平均分,也不要把模拟人口的精度写成真实人的精度。14:46hostVoice第六章,用户入口变大之后,怎么赚钱。刘润今天讨论豆包尝试对酒店推荐订单按成交收佣金。这里要区分佣金和竞价排名:前者是在交易发生后按比例收费,后者是花钱买曝光。文章的重点不是说豆包已经找到答案,而是 AI 搜索遇到一个结构性难题:越快给出合适答案,用户停留越短,传统广告能影响决策的空间反而越小。 文章提到豆包月活三点八二亿,以及业内估算日均收入不到一百万元。这些数字来自文章引用或业内估算,不是我们今天独立核验的财务披露,听众应该把它们当成讨论商业化的背景信号。 AI 助手常见的路有三条:订阅、广告和交易佣金。订阅收入可预测,但模型调用有持续成本,用户用得越多,平台不一定越赚钱;广告可以把用户意图卖给供给方,但如果推荐结果被竞价影响,信任会迅速下降;佣金离交易最近,却需要平台面对支付、退款、商品质量和售后责任。豆包尝试的是第三条,逻辑成立,但它也把「推荐」推向了「交易代理」。 成交佣金的逻辑成立,但责任也会跟着来:酒店描述不准确怎么办,取消和退款找谁,推荐是否因为真的合适,还是因为佣金更高。AI 一旦从信息入口变成交易入口,平台就不能永远只说「我只是推荐」。越接近钱,越需要明确商品、支付、售后和责任边界。16:33hostVoice第七章,模型进入物理世界,数据基础设施也在融资。三十六氪报道,艾欧智能完成数亿元融资,围绕 TeleXperience 遥操作、SenseXperience 真实世界人类数据采集,以及 EmbodiFlow 数据管理平台展开。公司称已经适配八十多款机器人,并积累了百万级人类操作数据;这些属于企业披露与媒体报道口径。 具身智能的问题,不只是看懂画面,还要知道手指有没有碰到物体、力度是不是合适、动作有没有完成。机器人需要空间关系、动作轨迹、触觉和真实反馈,而这些数据不像互联网文本那样天然存在。融资买到的是建设数据闭环的时间,真正的壁垒仍要看数据质量、标注流程、模型迭代和现场部署能不能接起来。 艾欧智能把链路拆成三段:TeleXperience 负责遥操作和机器人端数据采集,SenseXperience 采集第一视角、腕部和夹爪等真实世界操作数据,EmbodiFlow 再负责标注、审核、质检、可视化和格式转换。公司称 TeleXperience 已经适配八十多款机器人,数据平台支持 LeRobot、MCAP 和 HDF5 等格式。这些参数说明它在做基础设施,而不是只做一次性的机器人演示;但真正的考验仍是换设备、换场景之后,数据能不能继续复用。 腾讯研究院今天的文章标题是「硅谷大厂又不需要伦理学家了」。它讨论的是,当企业把伦理和治理岗位拆进产品、安全、法务和政策流程之后,专门的伦理角色可能减少,但伦理问题不会消失。这个判断更接近组织观察和观点,而不是一项行业普查。 把它和今天的 Agent 新闻放在一起,结论很现实:伦理不是一个发布前的单独闸门,而是权限、评测、数据、交易和售后里的连续动作。岗位可以换名字,责任不能消失。虎嗅报道上海争取 AI 人才的故事,也把这条线拉回产业竞争:城市争夺的不只是一个明星研究员,而是研究、算力、数据、资金和应用能否留在同一个生态里。18:52hostVoice最后收束一下。今天的增量不是模型又多会了一个技能,而是能力开始接管入口。 模型和芯片决定它能不能跑;Agent 商店和统一办公入口决定用户能不能找到它;旅行履约和机器人数据决定它能不能接触真实世界;持续学习和模拟评测决定它能不能越用越好;商业化、权限和伦理则决定它出了问题谁来负责。 如果你是开发者,今晚值得检查的是:你的 Agent 有没有真实工具、回滚和人工确认,而不是只有一段很长的 Prompt。如果你在企业里,先问数据授权、任务成功率、成本和责任链。如果你是普通用户,听到「我已经替你完成」时,记得确认它实际调用了什么、结果能不能撤回。 还可以再多问三句:它的输入来自哪里,是否有未经授权的个人数据;它做出的每一个关键动作,是否留下了可审计的记录;它失败时,是自动重试、交给人,还是继续把错误扩大。真正成熟的 Agent,不是让人感觉不到系统存在,而是让系统在需要的时候能够被看见、被暂停、被解释。 感谢收听,这里是 AI听,我们明晚继续。