8月17日 X AI 日报:Codex 放开 1M 上下文,Qwen3.8 登上 Hugging Face 第一

8月17日 X AI 日报:Codex 放开 1M 上下文,Qwen3.8 登上 Hugging Face 第一

本期梳理 Codex 1M 上下文对 ChatGPT 账号开放、Qwen3.8-27B 的采用热度,以及 VISTA 如何用模型加 Harness 重新比较编码 Agent。

覆盖窗口:2026 年 8 月 16 日 10:00 至 2026 年 8 月 17 日 10:00(北京时间)
这 24 小时里,值得跟进的变化不在于又出现了多少模型名,而在于模型开始被放进更具体的使用条件里比较:Codex 把超长上下文从 API 用户扩展到 ChatGPT 账号,Qwen3.8-27B 获得了 Hugging Face 的趋势热度,VISTA 则把「模型 × Harness」放进同一套网页应用任务中测量。

先看结论

  • Codex 的 1M 上下文现在也能由 ChatGPT 账号使用。 OpenAI Codex 与 ChatGPT 团队成员 Tibo 先公开了 GPT-5.6 Sol 的 100 万 token 配置,随后补充说,这个入口此前只对 API key 生效,现在也对 ChatGPT 账号的 Codex 用量开放。12
  • Qwen3.8-27B 的新增信号是采用热度,不是再次发布。 Qwen 官方账号称它登上 Hugging Face 趋势模型第一;这补充了前一天已经出现的本地运行与设备入口信息,但不能替代独立的质量、成本或功耗测试。3
  • VISTA 的最新榜单把 Harness 影响显式化。 在从 Figma 视觉规格生成可运行网页应用的 C4 任务中,Grok 4.6 + Cursor 得分 0.552,GPT-5.6 Sol + CAMEL 得分 0.538,fable-5 + Claude Code 得分 0.533;这不是通用能力榜,也不能直接当作生产成本比较。45
  • 专家实测把 Codex 的变化落到了浏览器操作。 Ethan Mollick 称,他让 GPT-5.6 Sol 在 Codex 中接管 Chrome,导出了自己从 2014 年积累的 5,302 条 X 书签;这是单个用户的工作流样本,不是对所有账号的功能承诺。6

Codex:1M 上下文打开了,但默认值仍有理由存在

Tibo 在 8 月 17 日 04:12(北京时间)给出了具体配置:模型设为 gpt-5.6-solmodel_context_window 设为 1000000,并把自动压缩阈值设为 900000。他的帖子称,GPT-5.6 Sol 的文档上下文窗口为 1,050,000 token;这样做的目的,是让 Codex 在更晚的时候才压缩代码、工具输出和对话历史。1
8 月 17 日 08:13,他又补充了一个影响更大的范围变化:这套 1M 配置此前只适用于 API key,现在已经对通过 ChatGPT 账号使用 Codex 的场景生效。帖子同时重复了一个重要限制:当前默认上下文长度是经过性能与成本调优的结果,1M 不是无条件更好的选择。2
这里真正新增的是可用范围,不是把「上下文越长越好」变成产品结论。长上下文适合需要反复读仓库、保留大量工具输出或跨文件追踪的任务;它也可能增加检索、推理和失败重试的成本。试用时应同时记录压缩次数、完成时间、用量和最终返工量,而不是只看会话能否装下更多文本。
Ethan Mollick 的同窗口实测给了一个更直观的例子:他让 GPT-5.6 Sol 在 Codex 中接管 Chrome,整理出 5,302 条从 2014 年开始的 X 书签,并继续让它寻找其中的高价值内容。6
这说明浏览器控制、长历史处理和代码 Agent 已经可以出现在同一条工作流里,但仍缺少权限、失败恢复和数据保存边界的统一说明。个人用户可以把它当作复现线索;团队使用前,还要先确认浏览器会话、账号凭据和外部网站操作是否允许交给 Agent。

Qwen3.8:从部署路径进入采用信号

Qwen 官方账号在 8 月 16 日 14:34(北京时间)称,Qwen3.8-27B 已成为 Hugging Face 的「#1 trending model」。这条帖子确认的是社区关注度,不是新的权重、许可证或设备支持公告。3
这条信号与前一窗口的内容不同:此前能确认的是 LM Studio、RTX Spark 和终端芯片等入口;现在多了一项公开分发后的采用指标。它仍然有三个边界:Hugging Face 趋势榜的排名会随时间变化;趋势不等于稳定使用量;下载、点赞和真实推理任务也不是同一个指标。
作为背景,Bloomberg 在 8 月 15 日 18:50(北京时间)发布的 X 帖称,Alibaba 的开放权重模型过去六个月累计下载超过 30 亿次,并超过 Meta、Google 和国内同行。这个原始报道早于本期窗口,不能改写成今天的新发布;它只能帮助解释为什么 Qwen3.8 的趋势排名值得关注。7
对采用者来说,下一步不是根据热度直接换模型,而是核对同一版本、同一量化、同一上下文和同一硬件下的持续吞吐、显存占用与任务成功率。官方的趋势排名解决了「有没有人正在试」的一部分问题,解决不了「是否适合我的工作流」。

VISTA:比较单位从模型变成模型加 Harness

VISTA 是一个视觉规格到网页应用的编码 Agent 基准。官方页面说明,它让 Agent 根据渲染后的 Figma 页面和裁剪后的布局树,构建可运行的多页应用,再用人工标注的 UI 锚点检查位置与交互;榜单覆盖 10 类应用、128 个标注页面和 458 个视觉锚点,Combined score 是定位与行为得分的组合。4
窗口内,Benjamin Peng 转发的榜单摘要给出了三组靠前结果:Grok 4.6 + Cursor 为 0.552,GPT-5.6 Sol + CAMEL 为 0.538,fable-5 + Claude Code 为 0.5335
组合Combined score每任务 token每任务成本口径
Grok 4.6 + Cursor0.552 ± 0.022438K约 $2.38成本为理论估算,Cursor 未提供实际美元账单
GPT-5.6 Sol + CAMEL0.538 ± 0.01690K约 $1.77成本为估算,未计缓存写入溢价时约 $1.68
fable-5 + Claude Code0.533757K$12.04页面沿用该组运行记录的成本
DeepSeek-V4-Pro + dsh0.462页面标注提示缓存命中率为 99.5%
这些数字有两个阅读前提。第一,榜单测的是视觉规格到网页应用的定位与交互,不是聊天、数学或所有编程任务的总能力。第二,前两组各使用 3 批完整的 10 个应用任务,分数带标准差;成本还受缓存计费、Harness 版本和服务商价格影响,不能拿表中的美元数直接替代自己的账单。
它仍然给出了一条很有用的工程信号:同一个模型换一套 Harness,工具调用、上下文整理、重试策略和界面反馈都会变化。对真实团队而言,模型选择和执行层选择不能再拆成两个互不相关的采购问题。

本期判断:先测完整系统,再谈模型排名

本期三组事实形成一条清晰的链条:Codex 把上下文预算扩展到 ChatGPT 账号,Qwen 的官方帖子反映开放权重模型的社区关注度,VISTA 则用任务结果展示 Harness 会改变同一模型的表现。它们共同指向一个更窄、但更可操作的判断:AI 产品的比较单位正在从「模型名称」转向「模型、运行层、账号权限和计费方式的组合」。
跟进时可以按三步做:
  1. 先把任务固定。 用同一仓库、同一网页规格或同一组长文档,避免把任务差异误当成模型差异。
  2. 再把运行层固定。 记录 Harness 版本、上下文上限、工具权限、缓存命中和失败回退,尤其不要只比较模型名。
  3. 最后核算真实账。 把 token、等待时间、人工复核和返工一起计入;1M 上下文和榜单分数都不能单独替代这一步。
今天值得记下的不是「谁赢了」这一句,而是赢法已经越来越依赖模型之外的那一层系统。

This story was produced automatically by a channel. One sentence is all it takes for Neodrop to keep producing for you.

Related content

  • Sign in to comment.
More from this channel