GPT-Realtime-2.1-mini 发布:低成本语音 Agent 有了推理和工具调用

GPT-Realtime-2.1-mini 发布:低成本语音 Agent 有了推理和工具调用

OpenAI 发布 GPT-Realtime-2.1-mini,把推理和工具调用下沉到更便宜的 Realtime mini 档位。本期拆解它对语音 Agent 的能力、价格、延迟、适用场景和迁移边界。

OpenAI 这次没有在主新闻页高调发布,但对做语音 Agent 的团队来说,gpt-realtime-2.1-mini 是一个值得立刻评估的小型号:它把 reasoning 和 tool use 放进了更便宜的 Realtime mini 档位,同时保持原 mini 价格不变。OpenAI Developers 在 7 月 7 日早间宣布该模型已可通过 API 使用;官方社区公告同日确认同时发布 gpt-realtime-2.1gpt-realtime-2.1-mini 两个 Realtime 模型。12
一句话判断:这不是 GPT-5.6 那种主线文本模型升级,而是 OpenAI 把「实时语音 + 推理 + 工具调用」下沉到更低成本档位。你如果在做客服、销售、陪练、车载、会议助理这类实时语音产品,它比 GPT-5.6 更接近今天能落地的工程变量。

这次到底发布了什么

OpenAI 官方社区公告写得很直接:本次发布面向低延迟语音和多模态体验,新增 gpt-realtime-2.1gpt-realtime-2.1-mini。前者是更强的 Realtime 模型,后者是更快、更低成本的 mini reasoning model。2
gpt-realtime-2.1-mini 的官方模型页把它定义为「distilled reasoning model」,用于更快、更低成本的实时语音交互;它支持通过 WebRTC、WebSocket 或 SIP 连接处理音频和文本输入,并且相比 GPT-Realtime-2 改善了字母数字识别。3
这几个词需要拆开看:
  • Realtime:不是先把语音转文字、丢给文本模型、再转回语音的三段式流程,而是面向低延迟语音交互的模型线。
  • Reasoning:模型可以在回答前做一定推理,不只是抢着接话;这对需要查订单、改预约、核对规则的语音 Agent 更重要。
  • Tool use:模型可以调用外部工具,例如查库存、查账户、改工单,而不是只给用户一段口头建议。

最大变化:mini 档位终于能做「会办事」的语音 Agent

过去做实时语音产品时,便宜模型通常适合寒暄、导航和简单问答;一旦需要判断、查系统、分步骤处理,就要升级到更贵模型,或者在语音链路里外挂一套文本模型和工具调度。gpt-realtime-2.1-mini 的意义,是把这类能力往 mini 档位推了一层。
官方社区公告给出的选型建议也印证了这一点:需要最强 realtime reasoning、tool use、instruction following 和 voice-agent behavior 时用 gpt-realtime-2.1;需要更快、更省钱的实时语音体验时用 gpt-realtime-2.1-mini2
这让产品团队可以多一档选择:不是所有语音 Agent 都要上最强模型。高价值、低容错的场景用 gpt-realtime-2.1;大量重复、流程清楚、但仍需要工具调用的场景,可以先用 mini 试算成本和延迟。

价格:文字很便宜,音频输出仍是主要成本

官方模型页显示,gpt-realtime-2.1-mini 的文本 token 价格为每 100 万输入 0.60 美元、缓存输入 0.06 美元、输出 2.40 美元;音频 token 价格为每 100 万输入 10 美元、缓存输入 0.30 美元、输出 20 美元;图像输入为每 100 万 0.80 美元,缓存输入 0.08 美元。3
计费项gpt-realtime-2.1-mini读法
文本输入$0.60 / 100 万 token 3适合把系统提示、上下文、工具结果塞进会话
文本输出$2.40 / 100 万 token 3文字回复本身不是大头
音频输入$10.00 / 100 万 token 3用户长时间说话会显著影响成本
音频输出$20.00 / 100 万 token 3模型一直「多说」会直接变贵
图像输入$0.80 / 100 万 token 3可以做看图辅助,但不是视频理解
AlphaSignal 的同步报道把重点概括为「reasoning and tool use at mini pricing」,并指出它相对旗舰 gpt-realtime-2 的文本价格低很多;不过价格判断仍应以 OpenAI 官方模型页和社区公告为准。4
真正要算账时,别只看文本 token。语音 Agent 的成本常常卡在音频输入、音频输出和会话时长上。想把 mini 的成本优势吃满,需要控制三件事:让模型少说废话,尽量复用缓存输入,把查库、下单、改状态这类动作做成短工具调用。

延迟:全线 p95 至少降 25%,但还要自己测端到端

官方社区公告称,本次发布还通过改进缓存,让 Realtime voice models 的 p95 延迟至少降低 25%。2
这句话对实时语音很关键。平均延迟好看,不代表用户觉得顺;p95 更接近「大多数时候会不会突然卡一下」。如果一个语音客服 20 句里有一句明显停顿,用户体感会很差。
但这个 25% 不能直接外推成你的产品也快 25%。端到端延迟还取决于麦克风采集、网络、VAD(语音活动检测)、工具调用耗时、TTS 输出节奏和前端播放策略。比较稳的评估方式,是拿你自己的 50-100 条真实通话脚本,分别测首字响应、完整回合耗时、工具调用回合耗时和中断恢复时间。

适合谁先试

最适合第一批评估的,是已经有 Realtime API 原型、但因为成本或工具调用能力卡住的团队。尤其是这几类:
  • 客服和售后语音 Agent:问题重复、流程固定,但需要查订单、退款规则、工单状态。
  • 预约和调度场景:需要听懂日期、编号、地址、电话等字母数字信息,且经常要调用日历或 CRM。
  • 销售和导购语音助手:需要边聊边查商品、库存、价格和用户偏好。
  • 内部操作助手:员工通过语音查系统、生成记录、触发简单流程。
暂时不建议直接迁移的场景也很清楚:高风险医疗、法律、金融建议;强合规录音质检尚未跑通的呼叫中心;以及需要稳定结构化输出的重工具流。官方模型页显示 gpt-realtime-2.1-mini 支持 function calling,但 structured outputs 标为不支持,fine-tuning、predicted outputs 也不支持。3
也就是说,它能调用工具,不等于你可以把所有业务状态交给模型自由发挥。生产系统里仍然需要把关键动作锁在后端规则、权限和确认流程里。

与 GPT-5.6 的关系:不是替代,而是另一条产品线

这次更新不要和 GPT-5.6 Sol / Terra / Luna 混在一起看。GPT-5.6 是更偏通用智能、编码、科学研究和复杂专业工作的主线模型家族;gpt-realtime-2.1-mini 是面向实时语音交互的专用模型变体。
如果你的问题是「复杂任务到底交给哪个最强模型做」,仍然关注 GPT-5.6 的开放进度。如果你的问题是「一个语音 Agent 能不能更低成本地听、想、查、说」,这次 Realtime mini 更新更值得动手测。

迁移建议

已经在用 GPT-Realtime mini 的团队,可以先做小流量 A/B:保留原有系统提示和工具接口,把 gpt-realtime-2.1-mini 放进一条灰度链路,重点看工具调用成功率、数字/编号识别、用户打断后的恢复、以及音频输出 token 成本。
还没上 Realtime API 的团队,不建议因为这次发布就立刻重构语音架构。更务实的做法是先挑一个流程窄、价值高、能人工兜底的场景,做 2 周验证。目标不是证明模型「会聊天」,而是证明它能在真实噪声、真实用户停顿、真实业务系统里稳定完成一小段任务。
本次发布的信号很明确:OpenAI 正在把语音模型从「会实时说话」推向「会实时办事」。gpt-realtime-2.1-mini 还不是所有语音 Agent 的默认答案,但它已经把低成本实时语音产品的天花板往上抬了一截。

Related content

  • Sign in to comment.
More from this channel