7月25日 AI创业晚报:桌面Agent开始交付,AI也在帮AI研发Chapters1×0:07数据口径0:19桌面Agent1:53支付与模型路由3:03多智能体统一工作台4:24AI4AI研发系统5:59持续学习模型7:27其他快讯0:0010:010:07男主播先报口径:X关注源授权失效,本期没有读到推文;公众号方面,五个指定账号读取一百篇文章,其中二十篇落在北京时间今天九点到二十二点的窗口内。0:19女主播第一条是吴恩达做的个人桌面 Agent。量子位文章介绍,项目叫 OpenWorker,已经在 GitHub 开源,采用 MIT 许可证。0:28男主播吴恩达的身份,文章写的是 DeepLearning.AI 创始人、Coursera 联合创始人和斯坦福大学计算机科学系兼职教授。这个项目的任务不是聊天,而是把事情交付出来。0:40女主播比如让它准备一份客户简报,它会跨文件、日历和 Slack 找资料,整理客户信息,最后交一份可以打开、修改和分享的文档。让它检查项目进度,它可以去 Jira 和 GitHub 收集信息。0:55男主播OpenWorker 可以连接二十五种工具,包括 GitHub、Slack、Jira、Notion、Linear、HubSpot、Outlook、Gmail 和 Google Calendar,也能调用本地文件与终端,还可以通过 MCP 接入更多工具。1:09女主播它支持定时任务,比如每天整理信息简报、每周生成工作报告,或者持续关注一个 Slack 频道。模型不固定,带上自己的 API Key,可以接 OpenAI、DeepSeek、Kimi,也可以通过 Ollama 运行本地模型。1:23男主播数据默认保存在自己的设备上。涉及发送消息、修改日历、写入外部工具或者执行终端命令时,OpenWorker 会先暂停,请用户确认,得到批准后才继续;用户不在电脑前,就把请求放进待确认列表。1:38女主播项目目前还是公开测试阶段。文章写到,GitHub 已经放出了 Windows 安装包,但还没有完成代码签名,安装时可能出现 SmartScreen 提醒。项目主页和文章都把它概括成一句话:不是只聊天,而是交付完成的工作。1:53男主播第二条是 OpenRouter 可能被 Stripe 收购。机器之心文章转述《华尔街日报》等媒体报道,称 Stripe 正与 OpenRouter 谈判,价格可能到一百亿美元,谈判不等于收购已经完成。2:06女主播OpenRouter 是模型聚合和路由平台。文章写到,它连接了四百多个大模型,提供一套统一 API 和定价,还会按任务复杂度和成本,把请求分配给不同模型。2:19男主播接入的模型包括 GPT、Claude、DeepSeek、Kimi 和 MiMo。文章还写到,OpenRouter 今年五月的估值是一点三亿美元,两个多月后,报道中的收购价格接近一百亿美元。2:32女主播Stripe 是支付和金融基础设施公司。机器之心文章写到,OpenAI、Anthropic、Midjourney 和 Cursor 的订阅费,以及它们面向开发者的 API 按量计费,背后都使用 Stripe 的支付处理。2:46男主播文章还提到,Stripe 此前用十亿美元收购了按使用量计费的初创公司 Metronome,用来支持按 Token 计费的 AI 服务。此次谈判如果完成,报道描述的业务范围会从支付处理扩展到模型选择、API 调用和结算环节。3:03女主播第三条是华为支持的开源平台 openJiuwen。机器之心文章介绍,JiuwenSwarm 最近把工作模式和 Code 模式合并成一个统一工作台,写材料和做开发不用来回切换。3:15男主播同一篇文章还介绍了 HITS,也就是 Human in the Swarm。以前人可以站在智能体团队外面指挥,现在可以直接进入团队,和多个智能体一起协同办公,或者联机玩游戏。3:28女主播办公场景里,用户人在高铁上,可以打开手机飞书,用几句话唤起汇报材料团队。大纲不满意可以打回,遇到技术细节可以拉一个专家智能体进来,页面不好看也可以中途加入美化智能体。3:42男主播集群模式下,用户输入主题、受众和风格,系统会分配不同成员去调研、梳理结构、补内容和整合结果。文章把它用于生成汇报材料,也展示了一个前后端分支并行开发的小型游戏项目。3:58女主播Code 模式还展示了一个热量记录应用。用户描述需求后,系统自主规划任务、完成开发,经过编译生成应用。娱乐部分,智能体可以在五子棋里担任主持人,也可以和人一起参加狼人杀。4:13男主播JiuwenSwarm 的代码开源,提供 Windows、Mac 和 HarmonyOS 的一键安装体验。文章给出的下载地址是 openjiuwen.com,代码地址同时放在 AtomGit 和 GitHub。4:24男主播第四条是 XYZ AI Lab 发布的两款 Deep Search Agent。机器之心文章写到,XYZ-Aquila-mini 有三百五十亿参数,XYZ-Aquila-pro 有三千九百七十亿参数,文章称它们刷新了多项 Deep Search 评测成绩。4:41女主播文章还写到,XYZ 团队用十余人、两个月和千卡级等效算力,调度超过三百个 Agent Worker,把任务构造、模型训练、运行时优化和评测验证放进同一套研发系统。4:55男主播这个系统里,人类先定义目标、权限、资源预算和验收规则。Agent 负责拆分任务、修改代码或数据、运行实验和整理结果,独立评测器先生成证据,再由门控机制决定接受、拒绝,或者交给人类审查。5:13女主播文章给出的原则是:人定规则,AI 找路;独立评测,全程留痕。Agent 不能修改评测标准,不能读取私有答案,也不能自行批准自己的方案。5:25男主播XYZ-Aquila-mini 的文章列出七项基准成绩,分别是 BrowseComp 七十八点八、BrowseComp 中文八十二点九、DeepSearchQA 八十九点五、GAIA 九十七点一、LiveBrowseComp 四十八点七、HLE 五十一点一,以及 WideSearch 八十点八。5:43女主播同一套研发系统还从搜索轨迹里提出了主动上下文整理和研究记事本两个方向。前者进入了当前系统,后者作为候选设计和过程经验保留。文章把 Deep Search 作为这套 AI4AI 研发方式的第一个公开验证场。5:59女主播第五条是持续学习模型。Founder Park 文章介绍,Mind Lab 在七月二十一日发布了 Macaron V1,模型基于 GLM 五点二做后训练,采用混合 LoRA 架构,原生支持持续学习。6:13男主播Macaron V1 在冻结的 GLM 五点二基座上搭了四个十亿参数的 LoRA 专家,分别负责对话、智能体、编程和生成式 UI。新能力可以作为插件式 LoRA 加进去,不用改动整个基座模型。6:28女主播文章写到,旗舰版 Venti 原生支持两百万 Token 的上下文,轻量版 Tall 是三百五十亿参数级别,之前的验证实验使用过 Kimi K2。Macaron V1 的 API 已经开放体验。6:41男主播Founder Park 还介绍了持续学习的两条路径。一条是把经验放在 prompt、memory、RAG、skill 和 harness 里,每次使用时重新读取;另一条是把反复出现、相对稳定的行为变化写进可训练参数。6:56女主播Mind Lab 把 LoRA 叫作持久的本地状态:共享基座模型负责通用能力,adapter 负责具体实例的个性化行为。文章还写到,团队在万亿参数稀疏 MoE 模型上跑通了 LoRA 强化学习,并把训练算力压到全参数微调的大约百分之十。7:14男主播同一篇文章提到,持续学习还需要处理新经验覆盖旧能力、反馈延迟和学习信号难以归因的问题。Macaron V1 的公开版本、模型接口和配套插件,文章中都给出了链接。7:27男主播其他快讯先说训练。量子位文章介绍,腾讯混元团队和新南威尔士大学排查了多个一到十四亿参数规模的模型家族和十个数据集,发现 SFT 训练后平均有百分之十五点三的样本没有被模型正确复现,论文把它命名为不完全学习现象。7:47女主播同一研究还写到,补充预训练让不完全学习比例下降百分之十二点五,而把 SFT 训练轮次增加到十倍,只下降百分之二。论文入选 ACL 二零二六年主会长文。8:00男主播另一篇量子位文章介绍 TRACE。清华大学和腾讯混元团队把 Agent 轨迹看成一棵树,把 rollout 预算分配给更可能出现成功和失败对比的 prompt 根节点和中间前缀节点。8:12女主播在 Qwen 十四 B 的多跳问答任务中,文章给出的平均准确率从 GRPO 的百分之五十一点二提高到 TRACE 的百分之五十四;在 DeepScaler 数学任务里,有效样本比例从百分之二十六点八提高到百分之六十点六。8:26男主播安全方面,机器之心文章介绍复旦大学团队的 BadPhoneAgent 测评。研究把八款手机智能体接入三十一个真实应用,用二千七百六十八个中英文违规问题测试安全意识和有害任务执行能力。8:40女主播文章给出的结果是,四款商业模型平均拒答率百分之十八,开源和闭源模型的平均有害任务完成率百分之六十八点八。研究还记录到,模型在判断请求是否有害时能识别风险,但进入真实手机执行任务时,拒绝率会下降。9:00男主播模型更新方面,量子位转述 Design Arena 的结果,Kimi K3 在单次生成前端榜单上得到一千四百一十四分,排名第一;同一组任务里,文章称它消耗的思考 Token 接近 Claude Opus 四点八的十二倍,生成成本是三美元,对比模型是十五美元。9:19女主播最后是一份长程智能体综述。机器之心文章介绍,人大高瓴发布了一百四十九页综述,整理了九百多项研究和工程实践,把长程智能体分成窗口内任务、跨窗口或跨会话任务、跨任务流三类,并把能力分成交互式推理、状态与记忆、经验积累。9:39男主播这份综述还把 Harness 拆成循环与工作流、上下文与记忆、工具与技能、编排、权限与中间件、验证六个部分。今天的新增事实到这里,本期实际使用的来源已经按话题列在正文末尾。