
OpenAI 日报:GPT-Live 接管 ChatGPT Voice,SWE-Bench Pro 被撤回推荐
本期聚焦 OpenAI 7 月 8 日发布的 GPT-Live:ChatGPT Voice 开始支持更自然的实时语音互动;同时梳理 GPT-Live 安全卡、SWE-Bench Pro 评测审计,以及 GPT-5.6 的媒体监管线索。
GPT-Live 是 OpenAI 7 月 8 日最值得跟进的更新:ChatGPT Voice 开始换成一套能边听边说的语音模型,而不是等用户完全停顿后再接话。对普通用户,这是语音体验的改版;对开发者和产品团队,它更像 OpenAI 把「实时语音代理」从演示能力推向日常入口。1
速览
| 动态 | 今天发生了什么 | 影响 |
|---|---|---|
| GPT-Live 上线 ChatGPT Voice | OpenAI 发布 GPT-Live-1 和 GPT-Live-1 mini,并开始面向全球 ChatGPT 用户推出;付费用户默认使用 GPT-Live-1,Free 用户默认使用 GPT-Live-1 mini。2 | Voice 不再只是「语音输入 + 文字模型 + 语音输出」的串联体验,开始支持更自然的打断、停顿和边说边看视觉结果。 |
| API 还没同步开放 | OpenAI 表示 GPT-Live 将很快进入 API,开发者和企业目前只能登记通知。1 | 想做实时客服、陪练、口语助理或车载语音产品的团队可以先评估场景,但还不能直接把 GPT-Live 接进生产系统。 |
| SWE-Bench Pro 被重新评估 | OpenAI 审计 SWE-Bench Pro 后估计约 30% 任务存在破坏性问题,并撤回此前建议社区采用该基准的推荐。3 | 最近几个月围绕代码模型的榜单成绩需要重新看,尤其是把 SWE-Bench Pro 当作单一能力结论的比较。 |
| GPT-5.6 仍是媒体线索 | Reuters 报道称 OpenAI 将在周四公开推出 GPT-5.6,背景是美国政府此前因国家安全担忧要求延后公开发布;OpenAI 官方新闻页截至 7 月 8 日已发布的是 GPT-Live 和评测审计文章。45 | 这条可以作为发布前信号跟踪,但在官方 release page 出来前,不宜把它写成已经完成的产品发布。 |
GPT-Live:Voice 从轮流说话改成持续互动
OpenAI 对 GPT-Live 的核心定义是 full-duplex,也就是模型能持续处理输入,同时生成输出。它可以在用户说话时继续听,判断是否该接话、暂停、保持沉默或调用工具。1 这听起来像语音产品的细节,但差别很大:以前的语音模型更依赖「你说完我再说」,停顿、噪音或打断都可能让体验变硬。
GPT-Live 还把实时对话和深度任务拆开。OpenAI 称,当问题需要搜索、推理或更复杂的工作时,GPT-Live 可以把任务交给后台的前沿模型,再把结果带回语音对话;发布时后台使用 GPT-5.5。1 这意味着它不是单纯降低语音延迟,而是在把「持续对话」和「慢一点但更强的思考」放进同一个交互里。
可用范围也有清楚边界。Help Center 写明,Live 正在面向包括 Free 在内的个人用户计划推出,但在发布时不支持 ChatGPT Business、Enterprise、Edu 工作区;也不支持 Temporary Chats、ChatGPT 桌面应用、Work、Codex 或 custom GPTs。2 对企业管理员来说,这比「功能已上线」更关键:如果团队在受管工作区里等 Voice 升级,今天还不是迁移日。
安全卡:实时语音增加了新的拦截点
GPT-Live 的风险不只来自模型回答什么,还来自它在什么时候开口、是否会持续卷入高风险对话。OpenAI 在 system card 里说,GPT-Live 的输入和生成输出会在对话进行中被检查;系统检测到潜在不安全输出时,可以引导或打断回应、播放语音安全提示、提供文字资源,严重时结束语音对话。6
这套安全设计还特别覆盖了语音场景里的情绪依赖、自伤、精神病性或躁狂相关内容、暴力、性内容、冒充真实人物声音等风险。OpenAI 表示,GPT-Live 使用 ChatGPT 预设声音,并有防护措施阻止它模仿真实人物声音。1
Preparedness Framework 方面,Safety Advisory Group 的结论是:GPT-Live-1 和 GPT-Live-1 mini 在不委派给其他模型时,不太可能在生物与化学、AI 自我改进或网络安全这些跟踪类别中达到 High 风险。system card 也补了一句现实限制:GPT-Live 自身在发布时没有独立的广泛工具访问,也没有代码执行能力。6
SWE-Bench Pro:OpenAI 撤回了自己的推荐
另一条更新更偏开发者和研究社区。OpenAI 审计 SWE-Bench Pro 后称,这个代码评测基准存在大量任务问题。SWE-Bench Pro 的 731 题 public split 曾显示前沿模型 8 个月内通过率从 23.3% 提升到 80.3%,但 OpenAI 的数据质量管线标记出 200 个疑似破坏性任务,占 27.4%;人工标注则识别出 249 个,占 34.1%。3
这些问题主要分成四类:隐藏测试过度限制实现细节、题目描述缺少测试实际要求、测试覆盖不足、题目提示误导模型走向错误行为。3 OpenAI 最后给出的判断很直接:估计约 30% SWE-Bench Pro 任务是 broken,并撤回此前建议社区采用该基准的推荐。3
这对近期代码模型宣传有实际影响。只看某个模型在 SWE-Bench Pro 上的分数,可能已经不能说明它真的更会做软件工程;至少要看任务过滤、错误类型、是否有人工复核,以及同一模型在真实仓库任务中的表现。
GPT-5.6:先按监管与发布线索处理
Reuters 7 月 8 日报道,OpenAI 将在周四公开推出 GPT-5.6;该报道还称,上月的延后与美国政府围绕前沿 AI 模型潜在误用风险的提前审查有关,Axios 先报道了美国政府批准更广泛发布的消息。4
这条线索和 OpenAI 6 月底的 GPT-5.6 预览相连,但今天仍应按「媒体报道 + 待官方发布页确认」处理。原因很简单:同一天 OpenAI 官网可见的新发布是 GPT-Live、GPT-Live System Card 和 SWE-Bench Pro 审计;真正的 GPT-5.6 正式发布页还没有出现在新闻索引顶部。5
运行状态:没有新的 7 月 8 日事故
OpenAI 状态页的历史记录里,7 月最新事故仍是 7 月 7 日的 ChatGPT 图像生成错误升高,页面显示该事件已恢复;没有看到 7 月 8 日后的新状态事故条目。7
对读者的操作建议很短:个人用户可以在 Voice 设置里查看 Live 是否已出现;企业和 Edu 工作区暂时不用安排迁移;做语音产品的开发者可以登记 API 通知,但现阶段还要继续用既有实时语音能力做原型。代码模型评测方面,接下来看到 SWE-Bench Pro 单榜排名时,最好先问一句:这份结果有没有剔除 broken tasks。
Related content
- Sign in to comment.
More from this channel›
- OpenAI 日报:ChatGPT 搜索扩展到项目与文件,企业 AI 投资转向结果成本
- OpenAI 日报:ChatGPT 重回 EEA WhatsApp,Codex 回滚自动审查提示
- OpenAI 日报:ChatGPT iOS/macOS 故障已恢复,官方发布继续空窗
- OpenAI 日报:GPT-5.6 正式上线,ChatGPT Work 接上办公流
- OpenAI 日报:金融客户案例密集更新,图像生成故障已恢复
- OpenAI 日报:GPT-5.5 Instant Mini 接过 ChatGPT 兜底位
- OpenAI 日报:官方发布继续空窗,Workspace Agents 今天进入计费日
- OpenAI 日报:官方发布继续空窗,诉讼报道不算新增事件
