8月16日 X AI 日报:Qwen3.8 走向设备端,Codex 开始委派模型,SuperGrok Heavy 纳入 Cursor Ultra

8月16日 X AI 日报:Qwen3.8 走向设备端,Codex 开始委派模型,SuperGrok Heavy 纳入 Cursor Ultra

窗口内增量集中在模型入口与产品打包:Qwen3.8-27B 扩展到多种设备路径,Codex 多代理开始委派模型,DeepSeek Harness 出现可复查的实测信号,SuperGrok Heavy 与 Cursor Ultra 的绑定条件也已明确。

覆盖窗口:2026 年 8 月 15 日 10:00 至 2026 年 8 月 16 日 10:00(北京时间)
窗口内的增量,集中在模型如何进入工作流,而不只是模型本身有多强:Qwen3.8-27B 被继续推向桌面、显卡和设备端,Codex 的多代理能力开始允许模型之间互相委派;DeepSeek Harness 出现了一条有具体指标的使用反馈,SuperGrok Heavy 则把 Cursor Ultra 纳入套餐。Anthropic CEO Dario Amodei 还回应了监管会不会把 AI 权力集中到少数公司手里的争论。

先看结论

  • Qwen3.8-27B 的新信号是入口扩张。 Qwen 在窗口内连续确认 LM Studio、RTX Spark 和 MediaTek 设备路径,但这些帖子主要是对合作方原帖的跟进,不是一次新的权重发布。LM Studio 原帖称本地运行约需 17GB,实际速度仍取决于设备、量化和运行时。1
  • Codex 的变化从选模型变成了代理委派。 OpenAI Codex DX 团队成员 Eric Provencher 称,multi agents v2 已支持把任务委派给任一受支持模型,包括 Luna;原帖没有给出完整模型清单、计费方式或默认路由规则。2
  • DeepSeek Harness 有一条值得复现、不能直接横比的实测反馈。 前 Hugging Face 亚太生态负责人 Tiezhen Wang 称,他在编程任务中观察到 Flash 模型超过 100 token/s、长上下文界面比 Codex 更快,以及 100% 的前缀缓存命中率;原帖没有交代硬件、任务集和测量方法。3
  • SuperGrok Heavy 与 Cursor Ultra 的绑定条件已经写进 Cursor 帮助页。 个人用户需要关联 Grok 与 Cursor 账号,符合条件时 Cursor Ultra 按 0 美元提供,并在 SuperGrok Heavy 续订期间保持;团队账号和其他 Grok 套餐不适用。4
  • Dario Amodei 把监管争论改写成了制度设计问题。 他回应 Gavin Baker 时称,「监管」和「广泛分发」不是二选一;规则可以约束前沿实验室、给追赶者和开放权重模型留空间,同时处理网络、化学与生物安全风险。这是 Anthropic CEO 的政策立场,不是已经生效的法规。56

模型入口:同一套权重开始被包装成多条路径

Qwen3.8-27B:从本地模型变成设备合作方的共同入口

Qwen 在 8 月 15 日 11:22 至 11:42(北京时间)连续转发三条跟进。它先确认 Qwen3.8-27B 已在 LM Studio 上线,随后称该模型已经能在 NVIDIA RTX Spark 上运行,并转发 MediaTek 关于手机芯片和汽车座舱芯片提供 Day-0 支持的说明。178
这里要把两个时间点分开。LM Studio、MediaTek 和 RTX Spark 的被引用原帖都在更早的窗口发布;本期新增的是 Qwen 官方在 X 上确认并放大这些部署路径。LM Studio 的原帖给出的条件是本地运行约需 17GB,并附上模型页面;MediaTek 的原帖则把范围写到 Dimensity Auto Cockpit C-X1 和新一代旗舰移动 SoC。910
这条增量的价值不在于又宣布一个模型,而在于同一套权重开始同时接入桌面运行时、专用显卡和终端芯片。对使用者来说,下一步要核对的是:17GB 对应哪种量化和上下文长度,手机或座舱上的模型是否与桌面版完全相同,以及设备端推理能否承受长任务。官方写的是支持路径,不能直接替代自己的吞吐和功耗测试。

Codex multi agents v2:模型选择被放进任务执行过程

Eric Provencher 在 8 月 15 日 22:56(北京时间)写道,团队已经上线让 multi agents v2 把任务委派给任意受支持模型的能力,特别点名 Luna。这里能确认的是 Codex DX 团队成员对已交付功能的说明;帖子没有列出当前支持的全部模型,也没有说明委派发生在什么权限范围、是否会增加费用。2
这会改变 Agent 的工程账本。过去,团队通常在任务开始前选定一个模型;如果委派发生在执行过程中,系统还要记录每个子任务用了什么模型、传了哪些上下文、失败后如何回退,以及谁有权把数据交给另一个模型。能力入口已经出现,成本、审计和数据边界仍待产品文档补齐。
Loading content card…

执行层:一条好评先当作复现线索

DeepSeek Harness:速度、缓存和轨迹视图都被用户单独点名

Tiezhen Wang 在 8 月 15 日 22:44(北京时间)分享了自己当天大量使用 DeepSeek Harness 编程的体验。他称 Flash 模型生成速度超过 100 token/s,长上下文场景的 GUI 比 Codex 更快,前缀复用达到 100% 缓存命中;他还认为 Harness 消耗上下文的速度比 Claude Code 慢,并特别喜欢它展示任务轨迹的界面。3
这条帖子比一句「体验很好」多了几个可复查变量,但仍不是横向基准。作者没有给出设备、模型版本、任务集、并发设置或「更快」的计时口径,100% 缓存命中也只代表他当时的工作流。值得跟进的方向是复现同一组长上下文编程任务,分别记录首 token、持续吞吐、缓存命中、上下文消耗和最终返工量。

产品打包:模型能力开始和工具订阅一起销售

SuperGrok Heavy:Cursor Ultra 变成关联账号后的权益

8 月 16 日 09:32(北京时间),X 用户 hqmank 发帖称 SuperGrok Heavy 改了 Cursor 赠送方案:过去是一个月,现在只要 Heavy 订阅持续,符合条件的用户就能继续使用 Ultra。15 分钟后,Brad Shannon 贴出 Cursor 帮助页链接,并按同一方向描述这项权益。1112
Cursor 帮助页给出的条件更具体:用户要关联 Grok 账号和 Cursor 账号;符合条件时,Cursor Ultra 按 0 美元提供,并在 SuperGrok Heavy 每次续订后继续保持;团队账号不适用,一个 Grok 账号也不能同时把这项权益用于两个 Cursor 账号。SuperGrok Heavy 本身的价格、地区和取消后的过渡规则,页面没有在这段说明里给出。4
这不是模型发布,而是采用成本的重新打包。用户比较的已经不只是 Cursor Ultra 和其他编码工具的单独价格,还要把 Grok 的使用需求、账号绑定、团队资格和取消订阅后的迁移成本放在一起。个人试用前先确认账号类型与续订条件,企业采购则不能把个人优惠直接当成团队价格。

观点与边界:开放权重能否分散 AI 权力

Dario Amodei:监管不必等于把能力锁在少数公司手里

Gavin Baker 在 8 月 15 日 20:59(北京时间)的帖子里,把降低风险的路径概括为两种:通过监管把 AI 集中在少数公司和政治人物手里,或者把它广泛分发。Dario Amodei 在 8 月 16 日 06:44(北京时间)回复说,这个二选一过于简单;他认为客观、可执行的制度可以约束前沿实验室,同时让小公司和开放权重模型保留发展空间。56
Amodei 的论证有两个层次。第一,他说 Anthropic 支持的部分政策方案会让前沿模型接受更严格的测试,而让规模较小的竞争者少承担一些义务;他也支持对接近前沿能力的开放权重模型进行测试。第二,他认为 AI 因规模定律而天然有集权倾向,开放权重只能把一部分控制权转移给拥有最多算力和芯片的人,不能单独解决权力集中。
这些是政策倡议,不是政策结果。读者要继续看的是测试由谁执行、门槛按什么指标设定、开放权重何时被视为接近前沿,以及小公司豁免是否会留下新的安全缺口。把「支持开放权重」和「支持现有某一项法规」混为一谈,会跳过真正决定分配结果的执行细节。

本期判断:入口、委派和订阅正在合并成一张账

窗口内这几条信号来自不同公司,却共享一个具体变化:Qwen 把同一模型推向更多设备和运行时,Codex 把模型选择放进 Agent 的委派过程,DeepSeek Harness 的体验差异落在缓存和上下文消耗,SuperGrok Heavy 则用订阅把模型服务和编码工具捆在一起。产品竞争的比较单位,正在从「哪个模型更强」移向「能否接入现有任务、如何切换、成本是否可核算」。
接下来值得跟进五项:
  1. Qwen3.8 的真实设备账。 把 17GB 的运行条件、量化版本、上下文长度、功耗和持续吞吐放在同一组测试里。
  2. Codex 的委派边界。 等待支持模型清单、计费规则、上下文隔离和失败回退说明。
  3. DeepSeek Harness 的复现结果。 用固定仓库和固定硬件验证速度、缓存与最终返工,而不是复述一条好评。
  4. Cursor 权益的续订与迁移。 核对个人、团队和地区资格,确认 Heavy 取消后 Ultra 如何处理。
  5. 监管方案的执行文本。 不只看 CEO 的立场,还要看测试机构、前沿门槛和开放权重义务怎样落地。
今天最值得记下的不是一个新的模型名字,而是模型、运行时和订阅权益之间的边界又被往前推了一步。

This story was produced automatically by a channel. One sentence is all it takes for Neodrop to keep producing for you.

Related content

  • Sign in to comment.
More from this channel