AI 今日速览:从会聊天到会交付,Agent 开始进入工作流챕터1×0:00今天的主线:AI 开始接活0:38模型账本:更快、更便宜,不等于更聪明2:34从写文档到做示范:Skill 开始吸收隐性经验3:53办公 Agent:交付文件,才是产品分水岭5:53企业 Agent:真正难的是上下文、权限和验收7:55业务闭环:AI 最后要对经营结果负责9:22研究视角:世界模型不能只看一张榜11:32评测提醒:强模型也可能不稳定0:0013:100:00主播晚上好,这里是 AI 今日速览。今天的白名单文章,表面上分散在模型发布、办公产品、企业服务和电商应用,放在一起看,却都在回答同一个问题:人工智能什么时候不只是回答问题,而是真的把一件工作交付出来? 今天的答案是,能力已经开始往前走,但交付的门槛也一起变得更具体。模型要有更好的工具调用,产品要能读懂项目上下文,企业要给出可控权限,最后还要有人验收结果。下面用十篇今天发布的文章,把这条线串起来。0:38主播先看模型侧。爱范儿今天报道,谷歌一口气发布了三款 Flash 模型,其中 Gemini 三点六 Flash 被定位成主力干活模型。按文章转述的官方数据,它的输入价格是每百万 token 一点五美元,输出价格是七点五美元;相比三点五 Flash,输出 token 少百分之十七,在 DeepSWE 这类场景里,节省幅度甚至达到百分之六十五。 机器之心补充了更完整的官方成绩单。三点六 Flash 在 DeepSWE 上从百分之三十七升到百分之四十九,在机器学习研究测试 MLE Bench 上从百分之四十九点七升到百分之六十三点九,计算机操作测试 OSWorld Verified 从百分之七十八点四升到百分之八十三。与此同时,谷歌期待的 Gemini 三点五 Pro 仍在和合作伙伴测试,尚未向更多用户开放,Gemini 四的预训练任务已经启动。 但这组数字不能直接等同于模型变聪明了。爱范儿引用 Artificial Analysis 的判断说,三点六 Flash 的智能水平和三点五 Flash 基本原地踏步;文章作者把它概括成「快是真快,菜是真菜」。所以开发者今天最值得看的,不是排行榜上的单个分数,而是自己的任务到底更在乎成本、延迟,还是一次成功率。一个少用百分之十七 token、却在关键步骤多错一次的模型,账未必更好看。 机器之心还提到,三点五 Flash Lite 的定位是最低成本和高吞吐,最高速度每秒三百五十个 token;网络安全版本则因为双重用途风险,近期只通过 CodeMender 面向政府机构和受信任合作伙伴限量试点。模型能力正在分层,开放范围和责任边界也在分层。2:34主播第二条变化来自新智元。文章介绍,Anthropic 在 Claude 桌面端 Cowork 里加入了 Record a Skill。用户可以一边录屏操作电脑,一边用语音解释为什么这么做;录制结束后,Claude 自动把流程提炼成可复用 Skill,保存之后再调用。 这件事的关键不只是少写一份 Markdown 文档。很多工作经验本来就很难写成规则,比如什么时候应该跳过某一步,客户要求的格式到底是什么,哪个异常数字必须人工复核。过去专家要先把这些经验写进手册,现在可以直接演示给模型看。新智元援引的产品说明显示,这项功能目前面向 Pro、Max 和 Team 用户,第一次使用需要录屏和录音权限,录制时还要避开密码、密钥、应用程序接口密钥和信用卡信息。 对团队来说,这意味着知识库的入口可能从「谁愿意写文档」变成「谁能把关键流程演示清楚」。但也别把录屏等同于安全。Skill 一旦能操作文件和软件,就必须配套最小权限、可撤销授权和人工复核。隐性经验被提炼得越顺,错误流程被复制的速度也越快。3:53主播量子位今天做了一个很具体的产品实测。金山办公的灵犀专业版处理了五份具身智能 coffee chat 记录,合计十万字,内容涉及世界模型、VLA、机器人强化学习和仿真数据。文章说,它把散落在不同文档里的讨论重新串成知识库,归纳出五场活动的主题、世界模型和 VLA 的关系,以及具身智能的数据困境。 接着,作者让它根据知识库生成一份八页的内部分享 PPT,不到十分钟交出初稿,之后又要求重写其中一页并补充演讲者备注。表格测试里,作者修改一项原始数据,灵犀继续联动更新汇总指标、图表和文字结论。文章给出的结果是,总订单从两万九千多单变成两万八千零六十八单,总营收从六百六十二点九万元变成六百三十九万元,整体 ROI 从三点三七变成三点二五,结论也从继续加码变成收紧预算。这里要强调,这是量子位文章中的编辑部实测,不是通用基准成绩。 甲子光年从产品定位角度补充,灵犀专业版不是 WPS 里多放一个按钮,而是负责理解项目、调用资料和执行任务,WPS 负责文件编辑和正式流转。它可以接入用户授权的云文档和文件,也允许用户查看、校准、删除或关闭记忆。金山办公方面同时承认,在写代码、操作浏览器、生成网页这些通用能力上,没有必要假装全面超过 Codex 或 Claude。它更像一个办公场景专用 Agent。 这给普通用户一个很实用的判断标准:AI 说自己能生成,不如看它能不能把资料、公式、格式、备注和后续修改一起交付。对办公产品来说,生成只是起点,交付才是终点。5:53主播腾讯研究院今天的文章把 Agent 的变化说得很直白:到了今年第二季度,Agent 已经开始自己读文件、跑代码、做表格、操作软件,甚至接入企业内部系统。文章引用的 OpenAI 报告说,四到五月两个月里,Codex 用户中有百分之二十来自不做编程的人,这部分用户增长速度是编程用户的三倍。 但同一篇文章也提醒,复杂 Agent 任务会反复读取目标、历史状态、工具结果和错误信息,token 消耗可能是普通问答的几十倍,甚至上千倍。企业还得解决审核、测试、集成、发布和担责。多 Agent 也不自动等于群体智能,文章把它比作项目经理指挥几组互不来往的外包团队,几个 Agent 放在一起,准确率有时还不如一个掌握完整信息的 Agent。 Founder Park 今天发布的五位创业者访谈,给了组织层面的补充。特赞曾经把开发中使用 AI 的比例从百分之三十推到百分之九十,但整体研发效率并没有同步提升,因为代码写快了,产品和业务没有变化。后来产品和业务人员开始在需求分析和原型阶段使用 AI,工作流才真正改变。得物的实践则是按任务分配最小权限,初期全部从只读开始,并把平台打通、工程稳定、任务效果和人效验证分层验收。 这类经验说明,企业做 Agent 不能只问模型分数。招聘场景可能更看重任务完成率,律师场景更看重人机协作和审阅界面,财务计算更看重精确性和沙箱验证,低毛利业务则先看成本。FDE,也就是深度交付工程师,适合需求明确、边界清楚的客户;需求模糊、数字化基础很弱的客户,先让全员用起来,往往比直接做深度定制更现实。7:55主播硅星人 Pro 今天写到,腾讯正在把 AI 从聊天推向生意,产品路线一端是 QClaw、WorkBuddy、Marvis、ima 和元宝,另一端连接企业微信、腾讯会议、腾讯文档和 Agent Suite。文章强调,企业侧的关键不是模型单独多聪明,而是能不能把知识、权限、业务流程、文件流转、审计和支付接起来。也就是说,模型只是执行链路中的一环。 赛博禅心今天梳理淘宝的四条 AI 线:拍立淘实时多模态 Agent、If Studio 创作工作台、Coupella 智惠引擎和 Dream 推荐系统。文章写道,拍立淘可以根据画面和自然语言连续找商品,Dream 已经放进首猜场景,带来百分之三的整体成交金额提升;Coupella 则试图把商家发券后的真实增量算清楚,文章口径是已经覆盖数十万商家,AI 红包整体转化率提升百分之八十一。 这些数字都来自各公众号文章的产品或案例口径,不能直接当成独立审计结论。但它们说明了一个方向:AI 的价值开始从「生成一段内容」转向「帮用户完成搜索、创作、推荐和经营决策」。当结果进入交易和生产流程,指标、权限和追责就必须一起进入产品设计。9:22主播今天还有两篇文章提醒我们,模型发布之外,评价 AI 的尺子也在变化。集智俱乐部发起的世界模型读书会,把问题定义成:模型能不能建立对外部环境的内部表征,预测状态变化,评估一个动作的后果,然后支持决策和行动。这里的世界模型不是一个单独的产品,而是表征、环境动力学、规划、控制和开放系统研究的交汇点。 Z Finance 则把 WAIC 之后常见的四类榜单拆开来看。V Bench 看的是像不像,主要看视频是否逼真、主体是否一致、运动是否流畅;World Model Bench 看的是懂不懂,测试模型对物理和常识环境的理解;RoboTwin 二点零看的是动不动得了,关注双臂机器人能不能把模型用于五十个协同操作任务;Physics IQ 看的是准不准,让模型看真实物理实验的前几秒,预测后几秒会发生什么。 文章给出的数据很能说明问题。World Model Bench 中,最好的模型也只有百分之六十一的视频能正确完成指令,百分之十二违反质量守恒,百分之十一出现物体互相穿透。RoboTwin 二点零的困难设置下,多数方法成功率仍低于百分之二十。也就是说,生成一段看起来合理的视频,和真正理解世界、预测结果、控制机器人,是四个不同问题。 这对开发者的启发是,评测要和实际任务对齐。做视频生成,不能只看画面美不美;做机器人,要看换设备、换环境之后还能不能稳定行动;做 Agent,要看长任务中是否会记住约束、及时停手,并且给出可追溯的依据。集智俱乐部文章强调,世界模型最终要面对机器人、工业现场和多主体社会;Z Finance 的文章则提醒,世界模型现在没有统一定义,也没有一个分数可以包打天下。今天的榜单,更多是帮我们把宣传语拆成可验证的问题。11:32主播最后看葬 AI 今天发布的 Kimi K3 实测。作者说,测试持续近一周,所有模型合计花了接近一万元 API 费用,还用知识图谱、浏览器打分、前端复现和五百天的 AI 创业公司经营模拟做横向比较。作者的结论是,Kimi K3 的综合能力排在第一梯队,尤其强在视觉理解、前端和一次性生成小游戏。 但作者同时明确写到,这不是官方成绩,而且 K3 和 Qwen 三点八预览版都不稳定,分数每轮会波动。在经营模拟里,K3 一度通过低价走量,后来把广告强度开满,最终在第二百六十二天倒下。这个结果很适合提醒我们:模型一次把网页写得漂亮,不等于它能在长链路任务里持续做对判断。 今天的结论可以收成一句话:Agent 的竞争,已经从「谁能回答」进入「谁能交付」,但交付能力不只由模型决定。上下文决定它懂不懂你的业务,权限决定它能不能动手,成本决定它能不能规模化,验收和审计决定你敢不敢把结果放进生产。 如果你今晚只继续读三篇原文,我建议优先看量子位的灵犀实测,理解办公 Agent 怎样把长资料变成文件;看 Founder Park 的访谈,理解组织和权限如何拖住效率;再看腾讯研究院的文章,理解通用 Agent 进入企业后为什么需要 Human in the Loop。这里是 AI 今日速览,我们明晚继续。