
AI 圈 24 小时:ChatGPT 回到 WhatsApp、vLLM 提速和 Agent 长测升温
这期覆盖北京时间 7 月 13 日 09:00 至 7 月 14 日 09:00 X 上 AI 圈的新信号:ChatGPT 回到 WhatsApp EEA,Hugging Face 与 vLLM 推进开源模型高速服务,ZeroGPU 降低 demo 门槛,Long-Horizon Terminal-Bench 把 Agent 评测拉向长周期任务。
过去 24 小时,X 上 AI 圈最值得看的不是又一次大模型参数发布,而是 AI 正在往两个方向同时外扩:一边进入 WhatsApp、Kakao、Viber 这类日常聊天入口,另一边把开源模型的部署、演示和长周期 Agent 评测往前推了一步。
覆盖窗口为北京时间 2026 年 7 月 13 日 09:00 至 7 月 14 日 09:00。窗口内没有看到足够强的一手融资、人事或并购信号,行业动态只保留与基础设施和应用入口有关的确认材料。
先看总览
| 板块 | 窗口内信号 | 可信度 | 读者该看什么 |
|---|---|---|---|
| 产品入口 | ChatGPT 官方账号称,ChatGPT 在欧洲经济区重新可用于 WhatsApp,验证账号 1-800-CHATGPT 支持提问、上传图片、发送语音备忘录、生成图片和多语言聊天;同帖还提到韩国 Kakao 和部分市场 Viber 接入 1 | 高 | AI 入口竞争正在从独立 App 走向用户每天已经打开的聊天工具 |
| 开源推理 | Hugging Face CEO Clement Delangue 称,Transformers 模型现在可以在 vLLM 中以原生速度运行;Hugging Face 博客写到,Transformers 已支持 450 多种架构,并在 Qwen3-4B、Qwen3-32B、Qwen3-235B MoE FP8 测试中达到或超过手写 vLLM 实现吞吐 2 3 | 高 | 新模型从发布到高速服务的等待时间可能继续缩短 |
| 开发者演示 | Hugging Face 的 apolinario 称,ZeroGPU demo 或 app 现在向所有 Hugging Face 用户开放,并给出新建 Space 和 agent skill 入口 4 | 中高 | 做可试用 demo 的门槛下降,开源模型传播不再只靠仓库链接 |
| Agent 评测 | Long-Horizon Terminal-Bench 发布窗口内热度上升:项目页称该基准包含 46 个终端任务、9 个类别、18 个前沿模型,单任务预算 90 分钟,隐藏 verifier 给连续部分分;29 个任务没有被任何模型通过 5 6 | 高 | Agent 评测开始从「能不能开个头」转向「能不能撑完整个下午」 |
| 热门观点 | Ethan Mollick 认为,在 agentic tools 时代,OpenRouter 这类图表不一定能代表真实模型使用,因为用量可能转向 Codex、Code、Cowork 这类工作流;他还说 Codex 的 PC computer use 已经很强 7 8 | 中高 | 以后判断模型竞争,光看路由平台用量可能不够,要看模型嵌进了哪些实际工作流 |
正在加载内容卡片…
产品入口:ChatGPT 回到 WhatsApp,重点不是多一个渠道
ChatGPT 官方账号在窗口内说,ChatGPT 在欧洲经济区重新可用于 WhatsApp。用户可以向验证过的 1-800-CHATGPT 联系人发消息,完成提问、图片上传、语音备忘录、图片生成和多语言聊天;同一条帖还说,ChatGPT 现在也进入韩国 Kakao,以及部分市场的 Viber 1。
这条的看点不是「又多了一个入口」。WhatsApp、Kakao、Viber 都是强关系聊天工具,用户在里面本来就会转发图片、语音、链接和长消息。AI 进到这里,意味着很多小任务不必从聊天上下文里跳出去做:解释一张图、改一段回复、把语音整理成文字、临时翻译一句话。这类入口不会直接证明模型更强,但会提高使用频次。
Sam Altman 几条窗口内短帖也把话题往用户体验上拉。他说「come for the best model, stay because we don’t treat you with contempt」,还说看到模型终于擅长设计仍然让他「breaks my brain」9 10。这不是产品公告,但它很像今天 X 上的情绪背景:模型分数之外,用户越来越在意产品是不是顺手、稳定、别拧巴。
基础设施:开源模型正在少写一层胶水代码
Clement Delangue 的帖子把 Hugging Face 和 vLLM 的新进展讲得很直接:Transformers 模型现在可以在 vLLM 中以原生速度运行,经常可以匹配或超过手写实现;模型作者不必再先写一份 Transformers 实现,再为生产推理另写一份 vLLM 实现 2。
正在加载内容卡片…
官方博客补上了技术细节。Hugging Face 说,Transformers 支持 450 多种架构;新的 vLLM backend 在 Qwen3-4B、Qwen3-32B、Qwen3-235B MoE FP8 三组测试里达到或超过原生 vLLM throughput,使用方式是一行
--model-impl transformers,但线性注意力模型和部分自定义 Hub 代码暂时还不支持 3。这对开发者的实际意义很朴素:新架构如果先进入 Transformers,就有机会更快进入 vLLM 的高吞吐服务路径。少一份移植代码,就少一层维护成本,也少一个训练实现和服务实现逐渐跑偏的地方。
同一条基础设施线还有两个小信号。apolinario 说,ZeroGPU demo 或 app 现在面向所有 Hugging Face 用户开放,开发者可以直接新建 Space 或让 agent 帮忙搭 demo 4。vLLM 官方账号则提到,Novita Labs 为 Kimi-K2.6 和 Kimi-K2.7-Code 开源了 DSpark speculators,vLLM v0.25.0 已原生支持 DeepSeek 的 speculative decoding 方法 11。
这些都不算「大发布」,但它们会改变开源模型的扩散速度。模型权重只是第一步,能不能快速部署、快速演示、快速被别人试到,才决定它能不能从论文和榜单进入真实产品。
论文与评测:Agent 的问题不在开头,在长跑
Long-Horizon Terminal-Bench 是今天技术讨论里最值得单独看的材料。Yucheng Shi 的帖子把问题说成一句话:多数 Agent benchmark 几分钟就结束,但真实终端工作不会这么短 5。
正在加载内容卡片…
项目页给出的设置更硬:46 个任务、9 个类别、18 个前沿模型,同一个 Terminus-2 harness,每个任务 90 分钟预算,隐藏 verifier 给连续部分分。任务覆盖软件与逆向工程、科学计算、地球气候与能源、多模态分析、研究复现、系统与安全、专业工作流、交互式游戏、逻辑与约束谜题等类别。项目页还写到,29 个任务没有被任何模型通过,单任务平均需要 69 到 93 分钟、约 120 到 320 个 agent steps 6。
这类评测的价值在于,它不只问模型会不会写第一条命令,而是问它能不能记住前面做过什么,遇到死路能不能退回来,预算快用完时能不能把剩下的工作收住。很多 demo 看起来已经像工作流,真正难的是让它在一个多小时里不丢状态、不循环、不把目标改没。
热门观点:模型竞争正在被工作流重新计量
Ethan Mollick 对数据口径的提醒很实用。他说,OpenRouter 不一定是 agentic tools 世界里真实模型使用的好指标,因为用量可能正在转向 Codex、Code、Cowork 这类工具 7。换句话说,一个模型在聊天路由平台上的占比下降,不一定代表它没人用;它可能被嵌进了更隐形的工作流里。
他同一窗口内还写到,Codex 在 PC 上的 computer use 已经变得很强,看到鼠标和键盘被一个「disembodied intelligence」控制,会让人直观感到有多少工作可以被完成 8。这和 LHTB 是同一条线的两面:一边是实际产品里的计算机操作体验,一边是 benchmark 里对长周期执行的压力测试。
swyx 的判断更激进。他列了一串年底前可能出现的前沿模型,并说 LLM 前沿从未如此多极化,agent labs、agent orchestration 和 LLM council judges 会从中受益 12。这条更像观点,不是确认日程;但它解释了为什么多模型编排会继续升温。模型变多之后,产品不一定只押一个模型,而是把规划、执行、审查、低成本补全拆给不同模型。
今天的判断
今天的主线可以归成一句话:AI 正在离「单个聊天窗口」远一点。ChatGPT 往用户原本就在用的消息工具里走,Hugging Face 和 vLLM 让开源模型更容易跑进生产推理,ZeroGPU 降低 demo 门槛,LHTB 则提醒大家,Agent 真正难的是长时间保持状态和目标。
如果你在做产品或选型,今天最该追的不是某个模型又多了几分,而是三个问题:用户会在哪里自然遇到 AI,新模型从发布到可服务要等多久,Agent 能不能在一个完整任务周期里不散架。榜单仍然有用,但它越来越像入口,不是结论。
参考来源
- 1ChatGPT 关于 WhatsApp EEA、Kakao 和 Viber 的帖子
- 2Clement Delangue 关于 Transformers/vLLM 的帖子
- 3Hugging Face 官方博客:Native-speed vLLM transformers modeling backend
- 4apolinario 关于 ZeroGPU 全用户开放的帖子
- 5Yucheng Shi 介绍 LHTB 的帖子
- 6Long-Horizon Terminal-Bench 项目页
- 7Ethan Mollick 关于 AI 使用数据指标的帖子
- 8Ethan Mollick 关于 Codex computer use 的帖子
- 9Sam Altman 关于模型和用户体验的帖子
- 10Sam Altman 关于模型设计能力的帖子
- 11vLLM 关于 DSpark speculators 的帖子
- 12swyx 关于多极化前沿模型的帖子
相似内容
- 登录后可发表评论。
