AI 听:从模型分数到真实工作流チャプター1×0:00开场:今天的主线0:33真实工作流:模型一进专业软件就露怯2:17真实工作流:下一批训练数据在企业手里3:45记忆与持续学习:模型开始把经验留下来5:34算力进入办公室:私有化不只是买一台机器8:00从聊天框到执行:产品开始围绕任务收费9:16模型预览:能力变强,不等于可以托付10:15政策与治理:谁能叫停,和谁能调用一样重要12:02收束:把模型当成系统来验收0:0012:570:00host晚上好,这里是 AI 听。今天有十篇白名单公众号的当日文章,指向同一件事:AI 的下一关,不是再把回答写得漂亮一点,而是把一项真实工作做完。0:10host今天的材料把它拆成几道门槛:工作流怎么测,真实数据从哪里来,模型能不能记住,算力能不能进办公室,以及出了问题谁能叫停。0:24host先说结论:模型能力正在从一次性生成转向对过程负责;过程越长,验收、成本和权限就越不能含糊。0:33host机器之心今天介绍了一个叫 Workflow Gym 的评测,中文可以理解成工作流健身房。它不让 Agent 只在浏览器里点几下,而是把它放进五十六款专业软件,安排三百三十八个真实工作流任务。0:50host这些任务平均超过一百步,最长达到一百一十步,覆盖工程、科研、财务和地理工具,并有明确验收,不是凭感觉说一句「看起来还行」。1:02host结果并不乐观。文章给出的数据里,Gemini 三点一 Pro 单次平均通过率是百分之三十点六七;几个模型做三次,平均也只在四成上下。到了最难的任务,Gemini 三 Flash 的三次通过率只有百分之二点六七。1:19host换句话说,Agent 不是每一步都错,而是长链条里只要有几步不稳,整条任务就会被拖垮。对短演示来说,这个差别不明显;对真实业务来说,它就是能不能上线的差别。1:34host这说明模型会操作界面,不等于它能完成工作。长程一致性一断,前面一个小错就会一路扩散;目标一漂移,最后即使画面看起来热闹,交付物也可能不合格。1:49host机器之心的判断很实在:眼下更像样的产品形态,还是人给框架、AI 做原子操作,或者 AI 先跑一遍,人来验收。对企业来说,先别急着把完整流程交出去,先把验收点写出来。开发者也可以把流程拆成可重试的小段,给每一段留下输入、输出和失败原因。这样做看起来慢,实际是在给后续训练积累可用反馈。2:17hostFounder Park 今天写到,真实工作流正在变成下一代训练数据。这里的关键不是数据量大,而是它保留了任务从出现到解决的全过程,包括历史状态、工具依赖、组织规则和那些意外分支。2:33host文章拿 GitHub 举例:提交记录、问题单和修复结果连在一起,能看见问题怎么出现、怎么被修好,比一条漂亮答案更接近 Agent 要学的东西。2:46host文中还提到 DoorDash 的菜单录入场景。商家上传菜单图片后,模型不只要识别文字,还要按照企业自己的商品、加料和规格规则整理成电子菜单。企业内部标准,通用模型并不会天然理解。3:02host这会带来一个分工变化:模型实验室工程师多、独特业务数据少;企业数据多,却不一定能把流程变成训练环境。能把流程、评测和反馈接起来,才更接近后训练的价值。3:17host但这不是企业都该自训模型。文章认为,数据独特性、评测清晰度、任务频率和单次改善价值,只要一项接近于零,投入回报就很难成立。文章把这类服务分成两种:一种替模型实验室准备高质量数据,另一种替企业把业务流程搭成可训练、可反复验证的环境。后者更像软件工程和机器学习的混合工种。3:45host如果说 Workflow Gym 在测模型能不能把事情做完,那么硅星人 Pro 和 Z Finance 今天的两篇文章,讨论的是做完以后能不能留下经验。3:57host硅星人 Pro 报道,记忆张量完成近亿元人民币的 Pre-A 轮融资。创始人熊飞宇强调,公司不想只做一个记忆产品;记忆只是第一个商业化入口,目标是把长期状态从系统层推进到模型架构层。4:13host这类产品要解决的,是 Agent 每次见到用户都像第一天上班:记不住人,记不住任务,也接不上跨会话的上下文。融资信息来自公司披露,参与方和金额都应当按这一口径理解,不能当成独立审计后的结论。4:32hostZ Finance 介绍的 Mind Lab 更激进。文章把 Macaron 一代描述成持续生长的结构:七百四十八 B 参数主体,加上四个一 B 的 LoRA 底座,并配套长期记忆和强化学习基础设施。4:49host文章还写到,Mind Lab 的 API 商业化后,两周 ARR 达到一千万美元,并展示了生成界面、复杂约束对话和多步骤软件工程任务。不过这些性能和商业数字主要来自文章作者的现场测试与公司口径,尚没有独立第三方复核。5:09host这里值得记住的不是参数多大,而是模型形态在变:经验可能成为可持续更新的本地状态。记忆的写入、检索、遗忘和污染,都要像数据库权限一样设计。尤其是企业场景,系统必须知道哪些信息可以跨任务保留,哪些只能在一次会话里使用。否则记忆越强,泄露和误用的半径也越大。5:34host新智元今天还报道了美团的 LongCat 二点零。文章称,它是首个在五万张国产卡集群上完成全流程训练和推理的万亿参数模型,预览版一度进入 OpenRouter 全球调用量前三。5:48host这篇文章同时在讲一件更现实的事:美团把人才计划从原有体系里单独拆出来,给出行业顶级人均算力、扁平组织和不内部赛马的承诺。五万张卡是能力,能不能让研究者持续试错,才决定能力会不会变成产品。新智元文章还提到,LongCat 团队把算法和工程放在同一个组织里,不把模型团队和基础设施团队切成互相提需求的部门。对大模型来说,协同速度本身就是训练效率。6:20host这些信息主要来自新智元的报道和美团团队口径,调用量与组织效果还需要后续公开数据验证。至少可以确认,模型竞赛正在同时争夺三种资源:算力、人才和把实验跑完的组织速度。6:36host特工宇宙今天在 WAIC 现场看到一台 TokenBox 单机设备,文章称它最高支持一点六 T 参数模型,采用 GPU、CPU、内存和存储四类独立模块,支持多机互联,并用液冷把主流负载下的噪声压到三十五分贝左右。6:54host文章还转述了一个医疗测试:本地部署旗舰模型,面对约五千 Token 的长上下文请求,一百二十八并发下请求全部成功,累计处理超过一千二百万 Token。7:08host这些数字属于设备厂商和现场文章的口径,不能直接等同于所有企业都能复现。可它说明了一个现实:当数据不能出机房,企业又需要长上下文、检索和多 Agent 协同,算力就会从云端账单变成办公室里的空间、噪声、散热、供电和运维问题。7:30host所以私有化部署不是把云上的模型搬到本地这么简单。真正要算的是任务频率、数据敏感度、并发峰值和两三年的总成本。买机器之前,先把这些数字列出来,往往比先争论模型排行榜更有效。对医院、工厂和研发团队来说,少一次数据出域,可能比多几分 benchmark 更有价值;但这个价值也必须拿业务结果来证明。8:00host36 氪今天写 WorkBuddy。文章引用易观报告称,六月它的月访问量突破两千万,月活用户超过第二、第三名的总和,并继续保持桌面 AI Agent 市场第一。8:14host产品形态也在变。用户不一定先和模型聊半天,而是直接拿到趋势分析、项目周报、电商标题等成品;系统负责查资料、分析、生成初稿、整理格式,再调用工具完成任务。用户看到的不是一轮问答,而是一条可以复用的流水线。产品真正难的地方,是让这条流水线在换一个人、换一种输入之后,仍然稳定交付。8:42host腾讯高级执行副总裁汤道生把这类变化概括成「实用、好用、可规模化」,说 Agent 已经「长出了手和脚」。这句话是腾讯方面的产品判断,月访问量等数据则来自文章引用的易观报告,两者不要混成同一层证据。9:01hostWorkBuddy 从内部工具 CodeBuddy 演进而来,一百天迭代超过五十个版本。我的判断是,产品竞争正在从聊天轮次变成任务完成率,但指标必须能被第三方复核。9:16hostAI 新榜今天提醒,千问三点八还没有正式发布,当前能体验的是 Max 预览版。文章转述的公开信息包括二点四 T 参数、即将开源,以及生成 SVG 海报、黑洞模拟、小游戏和三维建模等演示。9:34host作者还做了价格对比:生成像素足球动画的案例里,千问预览版约花零点零一二美元。单个案例不能直接推导出长期成本优势。9:45host原文自己也留了边界:预览版的能力、稳定性和价格还会变化,单个案例可能受随机性、推理时间和工具环境影响。对普通用户来说,最实际的做法是把它当成可试用的候选,不要当成已经验收的生产系统。预览版特别适合测试自己的任务边界:能否稳定完成,失败时是否说明原因,成本会不会随上下文突然跳高。这些比演示截图更接近真实选择。10:15host数字生命卡兹克今天解读了北京刚发布的智能体政策文件,文章说文件一共十条。里面出现了持续学习、超长任务、工具调用、记忆、Harness Engineering、技能市场、Token 经济和智能体运行时治理。10:36host这份解读里有一句很关键:企业级 Harness 会比基础模型更分散。每家公司都要把自己的数据、流程、权限和规则接起来。换句话说,模型越来越通用,真正落地的那一层反而越来越像业务系统。10:55host政策文章还把权限越界、提示词注入、长期记忆污染和多 Agent 放大错误列为治理问题,并提到最小化权限、人类确认、可查和可停。这里的政策原文和作者解读需要分开看,不能把文章中的延伸判断都当成政策条文。11:16host腾讯研究院今天发布的趋势研判,也把记忆固化、可信执行和任务完成率放在重要位置。报告首发于二零二六世界人工智能大会,属于研究机构的趋势判断,不是企业现状普查。11:32host但两篇文章放在一起,方向很清楚:Agent 的评价单位会从「回答得像不像」转向「任务有没有完成,过程能不能追溯,出错时能不能停」。开发者做产品,至少要同时设计权限、日志、回滚和人工接管。政策里关于 Token 经济的讨论也值得留意:如果未来从按 Token 计费转向按价值计费,系统就必须记录任务结果,而不是只记录调用次数。12:02host把今天十篇文章放在一起,顺序大致是这样的:先有真实工作流,才有像样的评测;有了评测,企业才知道该收集什么数据;数据进入持续学习和记忆,模型才可能接住长任务;模型要进办公室,又要面对算力和隐私;最后,所有执行都要落在权限和治理上。12:25host所以今天最值得继续读的,不是某个新模型又赢了几分,而是这些文章共同追问的四个问题:它在哪个真实流程里工作,怎么证明做对了,经验能不能留下来,出了错谁能停下来。12:40host开发者可以从一个可回滚的小任务开始,企业可以先算清数据、并发和人工验收的成本,普通用户则要把「演示很惊艳」和「可以托付」分开。今晚的 AI 听就到这里,我们明晚再见。