模型价格战之外:Last Week in AI 第 252 集的安全与能源账单

模型价格战之外:Last Week in AI 第 252 集的安全与能源账单

Last Week in AI 第 252 集把 GPT 5.6、Grok 4.5、开源模型流量、安全评估和数据中心能源约束放进同一条产业链。

单集信息

字段内容
播客Last Week in AI
主持人Andre Karenov,AI 专业背景并在 startup ASPATE 工作;Jeremy Harris
嘉宾无外部嘉宾,两位主持人对谈
集标题Last Week in AI #252 - GPT 5.6, Grok 4.5, Nemotron-Labs-Diffusion, AI 2040
发布日期2026 年 7 月 15 日(按新加坡时间显示)
原集链接节目视频

这一集的主线不是模型榜,而是价格和安全一起下探

Last Week in AI 第 252 集把 GPT 5.6、Grok 4.5、Muse Spark 1.1、Nemotron-Labs-Diffusion、政策与安全问题放在同一周的新闻里。最值得带走的不是某个模型是否暂时第一,而是两个趋势同时出现:模型服务更便宜,模型安全与发布规则却没有形成稳定的共同标准。1
节目谈到 Grok 4.5 的价格为每百万 input tokens 2 美元、每百万 output tokens 6 美元,并把它放在 Opus 和 GPT 5.6 的价格比较中。主持人据此判断,竞争正在走向 price war。价格下降会让更长的 coding 和 autonomy 任务变得可负担,但也会降低团队对调用量的敏感度。便宜不等于风险消失,尤其当模型被放进长期运行的 agent workflow 时。
Meta 的 Muse Spark 1.1 也被讨论为 coding 和 agent workflow 的模型,节目给出的价格是每百万 input 1.25 美元、每百万 output 4.25 美元。与 Grok 4.5 相比,它的定位同样指向更低成本的调用。节目还提到 Meta 给出了一份 100 页的 safety evaluation report,并报告了 Cybench 从 65% 提升到 93% 的结果。这里的数字是播客对发布材料的转述,文章不把它当成跨模型、跨测试集的统一排名。1

发布许可的名字和实际效果

主持人对 GPT 5.6 发布政策的批评很明确:美国政府口头上说没有对模型发布进行许可,但实际又通过与 Anthropic 的协议、标准和未来许可要求影响发布范围。Jeremy Harris 用「These are lies in practice」形容这种命名与效果之间的落差,并说当前局面是「a chaotic mess」。这不是对每条法律文本的独立核查,而是节目主持人对政策执行方式的判断,读者应把立场和事实区分开。1
安全部分还有一个更具体的案例:节目提到 UK AI Safety Agency 在测试 GPT 5.6 的某个版本时,几小时内就发现了 universal jailbreaks。Anthropic 的发布限制被描述为更严格,遇到 cyber 行为会回滚;OpenAI 也有 cyber 限制,但主持人认为更宽松。这里的模型变体名称在自动转录中存在不稳定,文章只保留节目明确讨论的现象,不把疑似误识别的专名当成新事实。
这集的矛盾由此变得清楚:如果模型越来越便宜,更多人会使用它;如果模型越来越会做长任务,单次调用的潜在影响会扩大;如果发布政策又没有清晰、可复核的标准,企业和研究者就很难知道自己到底在遵守什么。

开源 token 的增长带来新问题

节目引用 OpenRouter 的数据说,中国 open models 的 token 占比自 2025 年 2 月起每周超过 30%。主持人把它与 GLM 5.2 等模型的低价和用户反馈联系起来,也提醒听众不能因为模型是 open source 就跳过供应链和安全判断。Jeremy Harris 提到 sleeper agent 和 insider threat 的可能性,并认为中国未来也可能收紧 open source 策略。1
这一段的边界也被节目自己承认:OpenRouter 的流量不等于官方 API 的全部使用量。因此,30% 以上只能说明该数据源中的 token 结构,不能直接写成全球开发者市场份额。对做模型选型的人来说,这个限定比一个漂亮百分比更重要。

另一条约束:数据中心的电

后半段讨论美国电网与数据中心。节目说,数据中心能源消耗已达到美国总能源生产的 single-digit percentages,并且还会增加;一些地区要求发电机满负荷运行,或重新启用闲置电厂。核能和 SMR 被视为长期方向,但主持人提到,乐观估计也要到 2030 或 2031 年才可能为数据中心提供真正大规模的新增供给。1
这和模型降价是同一张账单的两面:调用更便宜,会刺激需求;需求增长又会把计算、能源和并网约束推到前台。软件价格战最终要受硬件和电力的物理条件限制。

这集适合谁,哪些可以跳过

  1. 做模型评测、推理成本或安全工程的人,重点听价格、Cybench、jailbreak 和 OpenRouter 数据的限定条件。
  2. 做 AI 政策的人,重点听发布许可「名义上不存在、实际有影响」的争议,但要把主持人判断与政策原文分开。
  3. 只想看本周模型名单的人可以跳过 AI 2040 的延伸讨论;本集核心增量在于,模型价格、安全评估、开源流量和能源约束正在同一时间互相牵制。

Related content

  • Sign in to comment.
More from this channel