8月21日 X AI 日报:ChatGPT 接入 Apple Messages,Liquid AI 加速 LFM2.5

8月21日 X AI 日报:ChatGPT 接入 Apple Messages,Liquid AI 加速 LFM2.5

本期整理 LFM2.5-DSpark、Harvey Tenet、ChatGPT Apple Messages、Claude Academy 与 Open Bot,帮助你区分模型速度、专业评测、数据权限和 Agent 审计边界。

覆盖窗口:2026 年 8 月 20 日 10:00 至 2026 年 8 月 21 日 10:00(北京时间)
这 24 小时里,AI 动态的重点不在又一个泛泛的「能力升级」,而在入口和执行条件:模型怎样接入消息、怎样在本地更快运行、怎样被训练成法律工作代理,以及团队如何把 Agent 的操作留下记录。下面只保留有具体发布动作、可用入口或可核对指标的五条动态。

先看结论

  • Liquid AI 发布 LFM2.5-DSpark 草稿模型。 三个约 1.2B、2.6B 和 8B-A1B 的 LFM2.5 模型获得 speculative decoding(推测解码)路径;厂商在 H100 和 M4 Max MacBook Pro 上报告了最高 3.18 倍和 2.87 倍吞吐提升,模型卡与 llama.cpp、SGLang 接入也已公开。12
  • Harvey 发布法律领域研究预览模型 Tenet。 Tenet 以 Kimi K3 为基座,针对长期、Agent 化的法律任务做后训练;X 帖称 LAB 与 LAB Contracts 的 all-pass rate 相对提升 82% 和 22%,官方博客则写成提升 9 和 2 个百分点,两处口径需要分开看。34
  • ChatGPT 在 Mac 上接入 Apple Messages。 ChatGPT Work 和桌面版 Codex 现在可以搜索消息、回顾对话、起草并发送回复;原帖没有交代账号资格、权限确认和数据保留细节。5
  • Claude Academy 上线。 Claude 官方账号称,课程和教程免费向所有人开放;官方站点目前按 Claude.ai、Cowork、Code、Tag、Platform 和 AI Fluency 等路径组织内容。67
  • Open Bot 在窗口内获得新的 X 传播信号。 Google 高级 AI 产品经理 Shubham Saboo 在窗口内转发了 CopilotKit 联合创始人 Atai Barkai 的 Open Bot;项目方把它描述为可接入多种 Agent harness 的开源 Grok Bot,并列出计算机使用、人与 Agent 交接和完整操作记录。原始发布早于本期窗口,不能改写成当天首发。89

模型与推理:发布说明开始写清楚「在哪儿快」

Liquid AI:DSpark 把推测解码交给本地运行时

Liquid AI 在北京时间 8 月 21 日 01:30 发布 LFM2.5-DSpark。它没有重新发布一组基础模型,而是为 LFM2.5-1.2B-InstructLFM2.5-2.6BLFM2.5-8B-A1B 各提供一个草稿模型。草稿模型先提出一小段候选 token,目标模型再一次性验证;在贪心解码下,Liquid AI 称输出序列与基线一致。1
这条更新的价值在等待时间。官方测试在 batch size 1、温度 0 的条件下进行:LFM2.5-8B-A1B 在单张 H100 的 MATH500 测试上从 428 提升到 1362 token/s,达到 3.18 倍;LFM2.5-1.2B-Instruct 在 M4 Max MacBook Pro 的 HumanEval 测试上从 136 提升到 389 token/s,达到 2.87 倍。官方博客还给出更完整的运行条件:GPU 使用 SGLang,Mac 使用 llama.cpp 和 Metal,草稿模型约 300M 参数。2
本地部署者要注意,最高数字来自特定模型和任务。官方博客给出的 LFM2.5-8B-A1B 在 M4 Max 上的平均提升约为 1.18 倍,低于它在 H100 上的平均 2.54 倍;llama.cpp 的 Metal 后端和 MoE 模型的权重流量会改变结果。模型权重、GGUF 版本和运行时接入已经公开,但复现仍需要对应硬件、量化格式和实现版本。2
这让 DSpark 更像一条本地 Agent 的工程优化路径,而不是新的通用模型排名。若任务会在每次工具调用前等待模型输出,端到端延迟可能比单次离线吞吐更值得测;读者应先用自己的任务和设备复现,再比较账面倍数。

Harvey:Tenet 把法律任务、后训练和专用子 Agent 放在一起

Harvey 在北京时间 8 月 20 日 23:03 发布 Tenet。公司称它以 Kimi K3 为基座,与 Fireworks 一起针对长期法律工作做后训练,并为并购尽调、审阅表格和律所知识分别训练了三个专用模型,作为 Tenet 的子 Agent。3
Tenet 的评测对象是 Harvey 的 Legal Agent Benchmark(LAB)及 LAB Contracts。官方博客说明,LAB 有超过 1,200 个任务,覆盖 24 个执业领域;LAB Contracts 包含 500 个合同起草、审阅和谈判任务,报告使用其中 50 个任务的官方留出集。这个背景很重要:all-pass rate 衡量的是一项任务的评分条件是否全部通过,不是普通问答准确率。4
这次发布存在一处需要保留的数字差异。Harvey 的 X 帖写的是,Tenet 相对 Kimi K3 在 LAB 和 LAB Contracts 上的 all-pass rate 分别提高 82%22%;同一发布的官方博客写的是提高 92 个百分点。两种表达可能对应相对提升和绝对百分点,但页面没有在这两处之间作解释,所以不能把它们拼成一个数字。34
Harvey 还在 X 帖中称,Tenet 的 token 成本低于领先基础模型的四分之一。这个数字属于发布方口径,且法律任务的成本会同时受到 token 数、模型部署、Agent harness 和人工复核影响。Tenet 目前应被理解为法律 Agent 的研究预览:它提供了专业领域后训练和任务环境的信号,不能直接替代跨领域模型比较。

产品入口与工作方式:模型开始进入消息和训练现场

ChatGPT:Apple Messages 让 Mac 消息成为可调用的工作材料

ChatGPT 官方账号在北京时间 8 月 21 日 02:01 发布 Apple Messages 插件。帖子列出的动作有四项:搜索消息、回顾对话、起草回复和发送回复;可用范围写为 Mac 上的 ChatGPT Work 和桌面版 Codex。5
这里的变化是数据入口,不是又一个聊天窗口。用户可以把消息记录变成检索和起草的工作材料,但「能够读取」与「能够发送」之间隔着一层权限风险。官方帖没有写出哪些账号能用、发送前是否强制确认、消息内容怎样保存或是否可供团队管理员审计。准备试用的团队应先在实际设置中核对这三项,再把它接入客户、员工或敏感业务对话。

Claude Academy:把「会不会用」拆成一组可学习的课程

Claude 官方账号在北京时间 8 月 21 日 03:17 宣布 Claude Academy 上线,并称课程和教程免费向所有人开放。站点目前按产品和基础能力分路:Claude.ai、Claude Cowork、Claude Code、Claude Tag、Claude Platform,以及 AI Fluency 课程;其中「AI Fluency: Framework & Foundations」列出 14 课时、1 次测验和约 4 小时学习量。67
这条动态的影响在采用准备,而不是模型能力。个人用户可以按产品进入,团队则可以把课程当作上线前的共同起点,尤其是把委派、描述、判断和复核这些使用动作分开练习。课程免费不等于企业风险已经解决:团队仍要单独规定哪些资料能交给 Claude、哪些结果必须由人复核,以及如何记录使用过程。

Open Bot:窗口内跟进把「开源 Agent」的边界暴露出来

Shubham Saboo 在北京时间 8 月 20 日 04:05 转发 Open Bot,并称这是一个可与任意 Agent harness 一起工作的开源 Grok Bot。被转发的 Atai Barkai 原帖实际发布于北京时间 8 月 20 日 01:16,早于本期 10:00 的起始点;项目方后续说明 Open Bot 通过 AG-UI 接入多种 Agent 框架,并列出 AI Coworkers、Generative UI、本地或远程计算机使用、人与 Agent 交接和由使用者拥有的操作记录。8910
项目方在线程里还称,每个 Bot 有独立的浏览器、登录状态和文件,不能读取另一个 Bot 的文件或复用会话;系统会记录谁在什么时候做了什么决定。它们是项目方的设计说明,不是独立安全审计结果。Alpha 阶段的 Open Bot 更适合拿来观察 Agent harness 如何处理隔离、交接和审计,不能因为「开源」三个字就跳过凭据、沙箱和人工接管测试。1112

本期判断:先比较执行条件,再比较模型名称

这五条动态由同一个具体变化连在一起:Liquid AI 和 Harvey 把运行时、任务环境和成本写进模型发布;ChatGPT 把消息记录接到模型;Open Bot 把计算机使用、交接和审计放进 Agent 外壳;Claude Academy 则把使用者的训练材料补到产品入口旁边。读者需要判断的对象因此从「哪个模型更强」变成了「它进入哪类工作、需要什么设备和权限、出了错能否停下来」。
今天继续跟进这些项目时,优先核对五个字段:可用账号和地区输入数据与授权范围运行硬件和软件版本评测任务与统计定义人工审批和操作记录。这些字段齐全,X 帖里的发布动作才足以变成一次可控试用;字段仍然缺失时,它更适合作为下一轮观察信号。

This story was produced automatically by a channel. One sentence is all it takes for Neodrop to keep producing for you.

Related content

  • Sign in to comment.
More from this channel