
GPT-Live 发布:ChatGPT Voice 开始边听边说
OpenAI 发布 GPT-Live,把 ChatGPT Voice 升级为可边听边说的全双工语音体验。本期拆解它的架构变化、可用入口、API 状态、安全限制和适合优先试用的场景。
GPT-Live 不是把语音模型再调顺一点,而是把 ChatGPT Voice 的交互方式换了一层底座:模型可以边听边说,能在你停顿时继续等,也能在更复杂的问题上把检索和推理交给后台模型处理。OpenAI 已在 2026 年 7 月 8 日发布 GPT-Live,并开始向全球 ChatGPT 用户推出 GPT-Live-1 和 GPT-Live-1 mini;API 还未正式开放,只能先登记通知。1
CNBC 同步报道也把 GPT-Live 和 GPT-5.6 公开发布放在同一篇里,称 OpenAI 在周三推出 GPT-Live,模型可以同时听和说,GPT-Live-1 与 GPT-Live-1 mini 会面向全球 ChatGPT 用户推出。2
对产品和开发者来说,这次最值得盯的不是「声音更像人」,而是语音入口开始从「语音版聊天框」变成「实时协作界面」。如果你在做客服、陪练、车载、可穿戴设备或会议助理,GPT-Live 带来的变量是打断、等待、后台任务和视觉卡片能否一起工作。
先给判断:语音 Agent 的门槛变高了,也更值得做了
GPT-Live 的核心变化有两点。
第一,它采用 full-duplex 架构。full-duplex 可以理解为「双向同时通话」:模型不必等用户完全说完,才能开始判断下一步。OpenAI 的说法是,GPT-Live 会连续处理输入和输出,并在一秒内多次决定要不要说话、继续听、暂停、打断或调用工具。1
第二,它把「对话控制」和「深度任务」拆开。GPT-Live 自己负责实时互动;遇到需要搜索、推理或更复杂执行的问题,会把任务委托给后台模型。OpenAI 称,发布时 GPT-Live 会在后台使用 GPT-5.5,之后可随新前沿模型发布而更新后台模型。1
这解释了为什么它和 7 月 7 日刚发布的 GPT-Realtime-2.1-mini 不是同一个问题。Realtime 2.1-mini 更像 API 里的低成本语音 Agent 模型升级,重点是把 reasoning 和 tool use 下沉到更便宜的 Realtime mini 档位。GPT-Live 则先落在 ChatGPT Voice,改的是终端用户讲话时的交互体验和产品形态。
和旧语音模式差在哪
OpenAI 在公告中把旧方案拆成两类:级联系统和轮次式语音模型。原始 ChatGPT Voice 是 speech-to-text、语言模型、text-to-speech 三段串起来;Advanced Voice Mode 虽然把音频处理放进单个模型,但仍然依赖一轮一轮的对话边界。1
| 方案 | 工作方式 | 主要问题 | GPT-Live 的变化 |
|---|---|---|---|
| 级联语音系统 | 先转文字,再让语言模型回答,最后转语音 | 信息可能在模型之间丢失,响应也更慢 | GPT-Live 连续处理输入和输出,不再把每轮对话拆成三段流水线。1 |
| Advanced Voice Mode | 单模型处理音频,但仍按轮次交替 | 需要判断用户是否说完,短暂停顿和背景噪音可能被误判 | GPT-Live 可以在用户停顿时继续等,也能在合适时打断或回应。1 |
| GPT-Live | 边听边说,同时把复杂任务交给后台模型 | 产品体验更强,但也更依赖实时安全控制 | OpenAI 称它会把检索、推理和更复杂工作委托给 GPT-5.5 等后台模型。1 |
这个差异会直接影响产品设计。以前的语音机器人常常要靠「你说完了吗」来判断轮次;GPT-Live 之后,好的语音产品要设计「什么时候不说话」。客服系统、语言陪练和车载助手尤其明显:用户停顿不一定代表结束,打断也不一定代表粗暴。
能力提升在哪里
OpenAI 给 GPT-Live 建了新的人工评测,用 5 到 10 分钟的匹配对话比较整体偏好、轮次控制、打断、对话流和自然感。OpenAI 称,GPT-Live-1 和 GPT-Live-1 mini 在这些 head-to-head 比较中明显优于 Advanced Voice Mode。1
更值得开发者看的,是它不只优化声音。OpenAI 还列出三个能力评测方向:GPT-Live-1 在 GPQA 上高于 Advanced Voice Mode;在 BrowseComp 上有明显提升;在内部变体 τ³-Voice Telecom 上也表现更好。OpenAI 说明,GPT-Live-1 instant 和 GPT-Live-1 mini 后台使用 GPT-5.5 Instant,Medium 和 High 则使用 GPT-5.5 Thinking 的不同推理档位。1
这里要保守一点:这些都是 OpenAI 自己发布的评测,不能等同于第三方独立验证。但方向很清楚,语音模型不再只比「像不像真人」。它开始比能不能边对话边查资料、边等待边处理任务、边听用户改口边更新意图。
可用入口和限制
GPT-Live 已开始在 ChatGPT 的 iOS、Android 和 ChatGPT.com 中全球推出。OpenAI 称,GPT-Live-1 会成为 Go、Plus 和 Pro 用户的 ChatGPT Voice 默认模型,GPT-Live-1 mini 会成为免费用户的默认模型。1
API 还没正式开放。公告只给了登记通知入口,面向开发者和企业收集 API 上线提醒。1 这意味着你现在可以先在 ChatGPT 里体验产品形态,但还不能直接把 GPT-Live-1 当成公开 API 模型接进自己的实时语音应用。
限制也很明确。OpenAI 说 GPT-Live 发布时不支持 ChatGPT 里的视频语音或屏幕共享;这些能力仍可在旧版 Standard Voice Mode 和 Advanced Voice Mode 中使用,GPT-Live 会在之后补上。1 对企业应用来说,这个限制很实在:如果你的场景依赖看屏幕、看摄像头、实时解释界面,暂时不能只押 GPT-Live。
语言体验也不是全覆盖。OpenAI 说它已经针对 ChatGPT 中最常用的一些语言做了优化,但某些语言可能有非母语口音或流利度缺口。1 中文场景要单独测试,不要只凭英文演示判断可上线。
安全边界:实时语音比文本更麻烦
GPT-Live 的安全问题比普通文本模型更难,因为语音会在进行中展开。System Card 写明,GPT-Live-1 和 GPT-Live-1 mini 有系统级安全集成,会在对话过程中检查输入和生成输出;检测到潜在不安全内容时,系统可以引导或打断回答,播放语音安全提示,提供文字支持资源,或者在更高风险情况下结束语音对话。3
OpenAI 还说,GPT-Live 模型自己不具备广泛独立工具访问,也没有代码执行能力;如果把复杂任务委托给其他模型,相关任务会继承底层模型的安全训练和保护。3 这句话对开发者很关键:GPT-Live 更像实时交互层,不是一个能独立跑完整工具链的万能代理。
System Card 也提醒了一件容易被忽略的事:GPT-Live 是为对话设计的,不是为模仿真人声音设计的。OpenAI 称它使用 ChatGPT 预设声音,并有防止模仿真实人物声音的保护。1 如果你的产品需求是「复刻某个真人声线」,这不是 GPT-Live 的合规用途。
谁应该现在试,谁可以等等
现在值得第一时间试 GPT-Live 的,是已经有真实语音使用场景的团队:客服、销售陪练、语言学习、车载助手、可穿戴设备、会议助理、播客式问答。重点不是听音色,而是测试四件事:模型会不会乱打断;用户停顿时它能不能等;后台检索和推理会不会破坏对话流;中文和嘈杂环境下是否稳定。
如果你做的是 API 语音 Agent,现在更现实的动作是继续评估 Realtime 2.1 系列,同时把 GPT-Live 当作产品方向样本。等 GPT-Live API 开放后,再判断它能否替换现有 Realtime 架构。
不适合现在押注的场景有三类:强依赖屏幕共享或视频输入的助手;要求精确复刻真人声音的应用;对安全中断极其敏感、不能接受系统实时打断的业务流程。GPT-Live 的方向很有价值,但它先解决的是「自然对话」问题,不是把所有语音 Agent 的工程问题一次性抹平。
Related content
- Sign in to comment.
