GPT-Live 登场:OpenAI 把语音模型拆成实时对话层和后台推理层

GPT-Live 登场:OpenAI 把语音模型拆成实时对话层和后台推理层

OpenAI 发布 GPT-Live-1 与 GPT-Live-1 mini,把 ChatGPT Voice 改造成可持续听说、可打断、可委托 GPT-5.5 后台推理的 full-duplex 语音体验。本文拆解它的架构、评测、安全边界、可用性限制,以及与 GPT-Realtime-2 和 Gemini Live 的差异。

GPT-Live 不是把 ChatGPT Voice 换一个更顺的声音。OpenAI 这次把语音产品拆成两层:一层专门处理实时听说和打断,一层把搜索、推理和复杂任务交给 GPT-5.5 这类后台模型。官方说,GPT-Live 从 7 月 8 日开始在 ChatGPT Voice 中全球 rollout,包含 GPT-Live-1 和 GPT-Live-1 mini 两个版本,并计划很快带到 API。1
这比上一代 Advanced Voice Mode 更值得看。Advanced Voice Mode 解决的是「模型能不能直接听音频、说音频」;GPT-Live 要解决的是另一个问题:当人类说话本来就有停顿、插话、改口和背景噪声时,AI 能不能不把每一句话都切成一个完整回合,再慢慢处理。对语音 Agent 来说,这个差异会直接决定它能不能进入客服、陪练、驾驶、语言学习和复杂事务协助。

这次到底发布了什么

维度官方状态对用户和开发者的影响
模型家族OpenAI 发布 GPT-Live-1 和 GPT-Live-1 mini,前者将成为付费用户的默认 Live 语音模型,后者将成为免费用户的默认模型。2ChatGPT Voice 不再只是一个统一语音入口,而是按付费层级拆出不同实时语音模型。
产品入口Live 正在面向 ChatGPT iOS、Android 和网页端推出;帮助中心写明,Free 也在 rollout 范围内,但 Business、Enterprise、Edu 工作区首发不可用。3这是先进入消费端的发布,不是 API-first。企业要等工作区和 API 路线补齐。
架构变化GPT-Live 是 full-duplex,能在生成输出时持续处理输入,并多次判断要不要说话、继续听、暂停、打断或调用工具。1语音交互从「一问一答」接近「持续对话」。短暂停顿不再必然被误判成用户说完。
后台推理当问题需要搜索、深度推理或更复杂工作时,GPT-Live 会把任务委托给后台 frontier model;发布时后台使用 GPT-5.5。1实时对话层和重推理层被解耦:前者保流畅,后者保答案质量。
API 状态OpenAI 说会把 GPT-Live 带到 API,并开放表单让开发者和企业登记通知;发布页没有给出 API 定价。1现在还不能按新模型价格评估生产成本,开发者只能先按产品能力判断方向。
这一组信息说明,GPT-Live 不是单个模型名,而是一套「语音交互层 + 后台推理层 + ChatGPT 产品入口」的组合。它最像一个调度器:前台负责像人一样接话、停顿、打断和保持场子,后台负责把需要时间的任务做完。

Full-duplex 的核心不是「更快」,而是「不用等回合结束」

过去的语音 AI 有两条主路。第一条是级联系统:先语音转文字,再让大模型生成文本,最后文字转语音。OpenAI 在回顾中说,最早的 ChatGPT Voice 就是把三个模型串起来;这让用户第一次能和前沿模型说话,但信息会在模型之间丢失,响应也慢而僵硬。1
第二条是 turn-based audio model。Advanced Voice Mode 已经把音频输入和音频输出放进一个模型里,延迟更低,体验更顺。但它仍然依赖离散回合:模型要等用户停止说话才开始回应;如果用户只是停顿一下,或者旁边有噪声,系统可能误以为一轮结束,然后不自然地插话。1
GPT-Live 的 full-duplex 试图绕开这个瓶颈。它不是等一句话结束再处理,而是在输出时持续接收输入;模型可以一边说,一边听到用户插进来的新信息,然后决定继续、暂停、改口或调用工具。1
这就是为什么 OpenAI 把「mhmm」「yeah」「got it」这类短反馈写进发布稿。它们看上去像细节,其实是语音产品的关键状态提示:用户需要知道模型还在听,而不是在沉默、卡住或抢话。语音交互里,半秒误判就会让人想关掉麦克风。

委托给 GPT-5.5:实时层不再硬扛所有智能

GPT-Live 更重要的设计,是把「持续互动」和「复杂工作」分开。OpenAI 说,当问题需要 web search、更深推理或更复杂工作时,GPT-Live 可以把任务交给 GPT-5.5 这样的模型;后台任务运行时,GPT-Live 仍能维持对话流。1
这解决了语音 Agent 的一个老矛盾。语音场景希望低延迟,用户不能等十几秒才听到声音;但复杂任务又需要搜索、工具调用、长链推理和多步校验。把所有事情都塞进一个实时音频模型,会让模型既要快,又要深,最后两边都受限制。
拆层之后,产品可以有更清楚的分工:
  • Live 层处理节奏:听、说、打断、停顿、保持上下文。
  • Frontier 层处理难题:搜索、推理、规划、工具调用和更长任务。
  • 产品层处理呈现:ChatGPT Voice 现在可以在对话时显示天气、股票、体育等视觉卡片,并继续支持搜索、记忆、图片和文件上传。1
这也解释了为什么 GPT-Live 发布紧跟 GPT-5.6。GPT-5.6 的主线是把更强推理、工具使用、并行 agent 和 Programmatic Tool Calling 推到生产工作流里;OpenAI 在 GPT-5.6 正式发布页中强调,Sol / Terra / Luna 用性能、成本和推理档位拆出不同工作负载。4 GPT-Live 则像是给这些后台能力加了一个语音前台。

评测信号:它赢的不是单轮回答,而是对话流

OpenAI 给 GPT-Live 的评测口径也很有意思。发布页说,GPT-Live-1 和 GPT-Live-1 mini 在 5 到 10 分钟的匹配对话中,相比 Advanced Voice Mode,被人类评测者强烈偏好;评估项包括整体偏好、turn-taking、打断、对话流和自然感。1
它还在三类能力上对比 Advanced Voice Mode:GPQA 代表专家级科学推理,BrowseComp 代表 agentic web search 和难找信息检索,τ³-Voice Telecom 的内部变体则模拟多轮电信客服任务。OpenAI 称 GPT-Live-1 在这些测试上超过 Advanced Voice Mode;其中 instant 和 mini 使用 GPT-5.5 Instant,Medium 和 High 使用 GPT-5.5 Thinking,并配不同推理 effort。1
这里要保留一个判断边界。OpenAI 没在发布页给出完整分数表,而且这些结果高度依赖后台 GPT-5.5、推理档位和评测 harness。我们能确定的是方向:GPT-Live 的卖点不是单独把语音模型的 IQ 拉高,而是在真实多轮语音任务里,把互动质量和后台推理绑在一起评估。

安全系统也变成实时的

语音模型的安全风险和文本模型不完全一样。文本聊天里,系统可以在生成前后做过滤;语音对话里,模型可能正在说话,用户也可能同时插话,风险需要边说边处理。
OpenAI 的系统卡写得很明确:GPT-Live 的输入和生成输出会在对话展开时被检查;如果检测到潜在不安全内容,系统可以引导或打断回答、播放语音安全提示、以文本提供支持资源,或在更高风险情况下结束语音对话。2
系统卡还提到,OpenAI 为 GPT-Live 做了新的 voice-native 评估,使用经过权限、删除状态、PII scrub 和去标识化处理的真实语音样本;这些评估不是按真实流量加权,而是故意选取 Advanced Voice Mode 表现不理想的困难样本。2 在这些 adversarially selected prompts 上,OpenAI 观察到 GPT-Live 模型总体与 AVM 持平或更好;GPT-Live-1 在 emotional reliance 上从 0.88 小幅降到 0.82,GPT-Live-1 mini 在 sexual content 上从 0.97 小幅降到 0.95,官方称两项都没有统计显著性。2
更关键的是能力边界。Safety Advisory Group 判断,GPT-Live-1 和 GPT-Live-1 mini 在不委托后台模型时,不能合理地被认为在生物化学、AI 自我改进或网络安全这几类 Preparedness Framework 跟踪类别中达到 High。2 系统卡同时强调,网络安全风险在首发时受限,因为 GPT-Live 本身没有独立的广泛工具访问,也没有代码执行能力;未来启用更多工具前会重新评估防护姿态。2
这句话很重要。GPT-Live 的聪明很多来自「委托」。它本体如果没有工具和代码执行,风险主要在语音交互、情绪依赖、操纵和错误建议;一旦它能把更多工作交给强模型、工具和 Agent,风险评估就要跟着后台能力一起变化。

和 Gemini Live、GPT-Realtime-2 放在一起看

GPT-Live 不是 OpenAI 第一次做实时语音。5 月发布的 GPT-Realtime-2 已经面向 API,支持更强推理、并行工具调用、128K 上下文、可调 reasoning effort,并给出价格:音频输入每 100 万 token 32 美元,缓存输入 0.40 美元,音频输出每 100 万 token 64 美元。5 GPT-Live 的不同在于,它先以 ChatGPT Voice 的产品体验出现,而且把后台 frontier model 委托机制摆在核心叙事位置。
Google 的 Gemini Live API 则给了另一个参照。Google 文档里,Gemini 3.1 Flash Live Preview 和 2.5 Flash Live Preview 都支持 Live API;3.1 版本用 thinkingLevel 控制思考深度,默认 minimal 以优化低延迟;文档还列出 VAD 配置、turn coverage、音频输入输出和模型事件处理方式。6 有意思的是,Google 2.5 Flash Live Preview 支持非阻塞函数调用、proactive audio 和 affective dialogue,而 3.1 Flash Live Preview 在这些项上暂不支持。6
横向看,几家公司正在拆同一道题,只是切法不同:
产品路线当前重点可能短板
GPT-Live把 full-duplex 交互和 GPT-5.5 后台推理解耦,先改造 ChatGPT Voice。1API 定价、企业工作区、视频和屏幕共享还没跟上。3
GPT-Realtime-2面向开发者的实时语音 API,强调工具调用、长上下文、可调推理和明确价格。5更像开发者底座,消费端自然交互体验要靠应用自己做。
Gemini Live API文档侧更强调音频流、VAD、turn coverage、thinking 控制和不同 Live 预览模型差异。63.1 与 2.5 的功能取舍复杂,开发者需要按能力矩阵选模型。
所以 GPT-Live 的竞争点不是「OpenAI 终于能实时语音了」。真正的竞争点是:谁能把低延迟、情绪自然度、后台深推理、工具调用、安全中断和产品呈现放进同一个稳定系统。

开发者和产品团队应该盯四个变量

第一,盯 API 价格。GPT-Live 现在还没有 API 定价;而 GPT-Realtime-2 已经有按音频 token 计费的价格。5 如果 GPT-Live 把后台 GPT-5.5 推理也算进成本,复杂语音 Agent 的单位经济性会和普通聊天完全不同。
第二,盯后台模型切换。OpenAI 说 GPT-Live 发布时使用 GPT-5.5,未来会随着新 frontier model 更新。1 这对产品是好事,也带来回归测试问题:同一个语音 Agent,后台模型升级后,回答质量、延迟、拒答和工具调用习惯都可能变。
第三,盯企业入口。帮助中心写明,Live 首发不在 Business、Enterprise、Edu 工作区,也不在 Temporary Chats、桌面 app、Work、Codex 或 custom GPTs 中。3 这意味着短期内它更像 ChatGPT 消费端能力,而不是企业可控生产入口。
第四,盯多模态缺口。Live 首发不支持视频和屏幕共享,相关能力仍留在 Advanced Voice Mode。3 这会影响远程协作、桌面操作、教学演示和客服排障。真正的「语音 Agent」最终不会只听麦克风,它还要看屏幕、读文件、查系统、执行动作。
GPT-Live 的发布,把语音 AI 的问题从「说得像不像人」推进到「能不能在复杂任务里持续陪跑」。如果 OpenAI 能把 API、企业入口、视频/屏幕、多工具调用和实时安全中断补齐,GPT-Live 会成为 ChatGPT 进入日常工作流的新前台;如果这些层迟迟分散在不同产品里,它就会先停留在一个更自然的消费端语音体验上。

Contenido relacionado

  • Inicia sesión para comentar.
More from this channel