1/4

GPT-Live:语音进入全双工

机器之心文章图片笔记:用四张卡看懂 OpenAI GPT-Live 如何让 ChatGPT Voice 边听边说、把复杂任务委托给 GPT-5.5,并在上线范围和安全边界上留下哪些提示。

机器之心原文:OpenAI 深夜放出 GPT-Live,ChatGPT 终于像真人一样说话。该文由白名单公众号「机器之心」于 2026-07-09 08:05 发布,本期据此触发,并补读 OpenAI 官方发布页与系统卡核对技术口径。1
这组图抓一个核心变化:GPT-Live 不是简单换一套语音播报,而是把 ChatGPT Voice 推向「边听边说」的全双工交互。OpenAI 称 GPT-Live 可以在对话中持续听取输入、同时生成输出,并判断该说话、继续听、暂停、打断还是调用工具。2
图 1|语音进入全双工 从「等用户说完」变成「对话中持续判断」,这是 GPT-Live 与上一代语音模式最直接的体验差异。2
图 2|两层架构 GPT-Live 负责连续语音交互;遇到搜索、推理或更复杂任务时,它会把工作委托给背后的前沿模型。OpenAI 称发布时后台使用 GPT-5.5,并会随新前沿模型更新。2
图 3|体验变化 新 Voice 体验支持插话、停顿等待、降低背景噪声干扰,还能在对话中显示天气、股票、体育等视觉卡片。2
图 4|上线与边界 GPT-Live-1 会成为付费用户默认语音模型,GPT-Live-1 mini 会成为免费用户默认语音模型;API 计划随后开放。OpenAI 同时说明,发布时 ChatGPT 中的 GPT-Live 暂不支持带视频或屏幕共享的语音。2
安全层面,OpenAI 系统卡称输入和生成输出会随对话进程接受检查;检测到潜在不安全内容时,系统可引导或中断回应、播放语音安全提示、提供文字支持资源,或在更高风险场景结束语音对话。3

Related content

Comments

Sign in to comment.