GPT-Live:OpenAI 把语音模型改成全双工前台

GPT-Live:OpenAI 把语音模型改成全双工前台

OpenAI 发布 GPT-Live,把 ChatGPT Voice 改成可同时听和说的全双工架构,并把复杂搜索与推理委托给 GPT-5.5。文章拆解它相对级联语音和 Advanced Voice Mode 的变化、安全评估数据,以及首发阶段仍不支持视频、屏幕共享和企业工作区的边界。

GPT-Live 把语音助手最别扭的地方换掉了:模型不用等你完全停下来,才能决定自己该不该说话。OpenAI 在 2026 年 7 月 8 日发布 GPT-Live,并开始把 GPT-Live-1 和 GPT-Live-1 mini 推给全球 ChatGPT Voice 用户;付费用户默认使用 GPT-Live-1,免费用户默认使用 mini 版。1
这次发布值得单独看,不是因为它又多了一个语音入口,而是 OpenAI 把语音交互拆成了两层:前台的 GPT-Live 负责连续听、连续说、判断节奏;后台的 GPT-5.5 负责搜索、推理和更复杂的任务。语音模型从「一次问答」变成了「一边陪你说话,一边把重活派给更强模型」。1

过去的问题:语音模型太依赖「轮到谁说」

OpenAI 把旧方案分成两类。第一类是级联系统:原来的 ChatGPT Voice 先用语音转文字模型把用户的话转成文本,再交给大模型生成回答,最后用文本转语音模型读出来。这个链路能把前沿模型接到语音里,但每一段转换都会损失信息,也会拉长响应时间。1
第二类是 Advanced Voice Mode 这类回合制语音模型。它已经把音频理解和音频生成放进单个模型里,延迟更低,也更像真人对话;但它仍然要等用户停顿,才能判断这一轮是不是结束。问题就出在这里:短暂停顿、背景噪声、说话时的犹豫,都可能被系统误判成「用户说完了」,于是模型提前插话。1
GPT-Live 的变化是全双工。全双工的意思是,系统可以在听你说话的同时自己发声,类似电话两端可以同时说话,而不是对讲机那种一方按住说完另一方才能说。OpenAI 称 GPT-Live 会持续处理输入和输出,并且能在每秒多次决定要不要说、继续听、暂停、打断或调用工具。1

前台陪聊,后台干活

这套架构里,GPT-Live 自己不承担所有智能任务。遇到需要网页搜索、复杂推理或更强 Agent 能力的问题时,它会把任务委托给 GPT-5.5 这样的后台模型,再把结果带回对话。OpenAI 说,发布时 GPT-Live 会在后台使用 GPT-5.5,后续前沿模型更新后也会持续替换后台模型。1
这和过去语音助手的差别很大。旧系统通常把「听懂、思考、说出来」绑在一个回合里,用户要等模型完成整套动作。GPT-Live 的设计更像一个实时主持人:它负责让对话不断线,同时把需要长时间处理的任务交给更强的模型。
工程上,这种拆分也留下了一个清晰边界:GPT-Live 的核心价值不是直接刷新 GPQA 分数,而是把更强模型接进语音场景时,不让对话节奏崩掉。对语音 Agent 来说,这个边界很关键,因为用户可以忍受后台任务多想几秒,却很难忍受系统在每个停顿处乱插话。

评估信号:自然度和复杂任务都在看,但公开分数有限

OpenAI 为 GPT-Live 做了新的真人偏好评估,比较对象是 Advanced Voice Mode。测试使用匹配的 5-10 分钟对话,维度包括整体偏好、轮次交接、打断、对话流和自然感;官方说 GPT-Live-1 和 GPT-Live-1 mini 在这些对比中都被强烈偏好。1
复杂任务上,官方给了三个方向:GPT-Live-1 在 GPQA 上明显超过 Advanced Voice Mode;在 BrowseComp 上也有强增益;在内部版本的 τ³-Voice Telecom 上超过 Advanced Voice Mode。GPQA 测专家级科学推理,BrowseComp 测 Agent 式网页搜索,τ³-Voice Telecom 测多轮电信客服任务。OpenAI 没在发布页公开这些图表的精确分数,所以这里不能把「明显超过」改写成具体百分点。1
系统卡补充的是安全侧数字。生产语音提示集里,GPT-Live-1 在 illicit behavior 从 AVM 的 0.74 升到 0.97,self-harm 从 0.89 升到 0.96;emotional reliance 从 0.88 降到 0.82,但 OpenAI 说这个回退没有统计显著性。mini 版也有类似情况:illicit behavior 从 0.60 升到 0.94,self-harm 从 0.81 升到 0.92,sexual content 从 0.97 降到 0.95,后者同样被标注为没有统计显著性。2
合成语音提示集里,提升更集中:GPT-Live-1 在 mental health 从 0.57 升到 0.84,self-harm 从 0.72 升到 0.98,hate 从 0.87 升到 1.00;mini 版在这些合成难例上也从 AVM mini 的 0.47、0.71、0.82 升到 0.81、0.96、0.98。系统卡强调,这些评估不是按真实流量加权的发生率,而是刻意挑难例,不能直接当成线上安全事故率。2

安全难点也跟着变了:风险发生在说话过程中

文字模型可以等完整回复生成后再检查,语音对话更麻烦。GPT-Live 的系统级安全集成会在对话进行时检查输入和输出;检测到潜在不安全内容时,系统可以引导模型改成更安全的回答,播放语音安全提示,提供文字资源,或者在高风险情况下结束语音对话。2
这解释了为什么 OpenAI 在系统卡里单独写了自伤、精神病性内容、躁狂、情感依赖、暴力、性内容、冒充和说话人识别等类别。全双工语音模型不只是把文本回答读出来,它会用「嗯」「我在听」这类反馈维持关系感,也更容易被用户当成一个正在场的人。安全评估因此不能只看答案文本,还要看重叠发声、等待、打断和长期依赖。
OpenAI 的 Safety Advisory Group 还判断,GPT-Live-1 和 GPT-Live-1 mini 在不委托后台模型时,不太可能在生物化学、AI 自我改进或网络安全这几个 Preparedness Framework 跟踪类别里达到 High 风险。系统卡同时给了理由:GPT-Live 自身发布时没有独立的广泛工具访问,也没有代码执行能力;委托给更强模型时,风险会继承后台模型的安全栈。2

上线边界:先是 ChatGPT Voice,不是完整多模态 Agent

面向用户的变化已经开始落地。OpenAI 帮助中心写明,Live 支持同时听和说,可以使用网页搜索和记忆,能在支持的账号能力下处理文本和图片,并能展示天气、股票、体育等可视化结果;但 Live 首发不支持视频、屏幕共享、connected apps、插件,也不支持 Business、Enterprise、Edu 工作区。3
这意味着 GPT-Live 现在更像新版 ChatGPT Voice 的交互层,而不是一个完全放开的语音 Agent 平台。API 也还没正式开放,OpenAI 只是让开发者和企业登记通知。1
对开发者和产品团队来说,短期要看的不是「能不能立刻接 API」,而是 OpenAI 已经把实时语音、后台推理、搜索、记忆和视觉卡片放到同一个交互模型里。等 API 开放后,语音产品的评价标准会从延迟和转写准确率,转向更细的指标:什么时候不该插话,什么时候该把任务交给后台模型,后台任务回来后如何自然地接回当前对话。
GPT-Live 的局限也在这里。官方没有公开 GPQA、BrowseComp 和 τ³-Voice Telecom 的具体分数;帮助中心也提醒,重叠语音、背景噪声、网络状况和麦克风设置仍会影响模型听到什么。3 如果要判断它能不能替代客服、语言陪练或车载助手,真正该测的是长时间真实场景:人会不会被频繁打断,复杂任务会不会丢上下文,安全拦截会不会把正常对话切断。
这次发布的重点,可以压成一句话:OpenAI 没有把语音模型做成更会「轮流发言」的聊天框,而是把它改成一个持续在线的对话前台。它的成败,不只取决于后台模型多聪明,还取决于它能不能在嘈杂、犹豫、插话和等待中判断该不该开口。

Contenido relacionado

  • Inicia sesión para comentar.
More from this channel