GPT-Live-1 与 Gemini 3.8 Live:语音智能体的门槛挪到了哪里?

GPT-Live-1 与 Gemini 3.8 Live:语音智能体的门槛挪到了哪里?

九月十号,OpenAI 把它做实时语音的模型放进了接口,开始按每分钟五分钱收费。

0:00 / 10:33
九月十号,OpenAI 把它的实时语音模型 GPT-Live-1 放进 API,按每分钟五分钱计价;五天之后,谷歌发布 Gemini 3.8 Live 和 3.8 Live Extended Thinking。两家做前沿模型的公司,在同一周把语音单独做成了一层模型。这件事改的不是声音像不像人,而是做语音助手的老办法:过去要把语音转文字、语言模型、文字转语音三段串起来,现在这层由同一个模型同时处理进来的声音和出去的声音,再在后面挂一个更会推理的模型。12
两条路线。 OpenAI 把语音层和推理后端拆开:GPT-Live-1 负责听和说,推理与工具调用交给 GPT-6 Astra、Codex 或第三方模型,语音层每分钟五分钱,后端调用另计;它支持电话外呼,也提供关键词偏置和原生转写。1 谷歌则把推理放回语音会话:3.8 Live 面向低延迟对话,Extended Thinking 边说话边做多步推理,会先用一句「让我查一下」接住用户,再在后台跑工具并播报进度;两个模型支持 97 种语言中途切换,接口里的函数调用默认为异步,生成音频带 SynthID 水印,输入音频每分钟 0.005 美元、输出每分钟 0.018 美元。234
独立评测里的差距。 独立评测机构 Artificial Analysis 把语音模型放在同一套指标下比较:综合指数上 Gemini 3.8 Live Extended Thinking 是 82.6,GPT-Live-1 接 Astra 后端是 81.5;同一家两个版本之间的差距更值得看——客服场景基准 τ-Voice 上,Gemini 3.8 Live 是 30.1%,换用 Extended Thinking 是 68.6%,GPT-Live-1 接 Astra 是 67.9%。同榜按每小时输入音频折算成本:Gemini 3.8 Live 为 0.84 美元,Extended Thinking 为 3.50 美元,GPT-Live-1 接 Astra 为 5.83 美元;首字音频延迟均在 1.18 至 1.35 秒之间。该榜注明部分模型结果只跑了一次(含 GPT-Live-1 接 Astra 一行),另一些跑三次取平均。5 据 TechRepublic 报道,OpenAI 称 GPT-Live-1 在自家 Full Duplex Bench 上的轮次切换延迟为 0.798 秒、工具调用准确率 87%,并称全双工表现比上一代高出 30 个百分点。6
证据边界。 厂商跑分只属厂商披露。谷歌的模型卡写明:这两个模型会有大模型常见的幻觉,越狱抵抗仍在加强,偶尔出现变慢或超时,知识截止在 2025 年 1 月;前沿安全评估并未单独进行,而是参照上一个 Flash 版本的结果推断不会触及需要追踪的能力等级,这属于厂商披露的方法而非外部核验的结论。7 OpenAI 这次的发布中未见同类水印说明。1 关于这类模型可能被用于更逼真的自动外呼与冒充,目前只有分析判断,没有已发生的事实支持。6
本期的分析判断是:这一周真正变化的是门槛的位置。语音自然度前两年已基本解决,现在的差异落在「边听边把事办成」上——同一家的快版本与推理版本在客服基准上相差三成九,说明流畅与办成是两件事。做产品的团队可以先测插话与停顿,把推理放在哪一层当作自己的架构决定,并按真实通话时长核算每分钟定价对应的月度成本;做内容的人可以换一个判断标准:能分辨的不再是「AI 能打电话」,而是它打完电话有没有把事办成。

This story was produced automatically by a channel. One sentence is all it takes for Neodrop to keep producing for you.

Related content