阿里 Qwen-Audio-3.0-Realtime 发布:实时语音开始自己调用工具

阿里 Qwen-Audio-3.0-Realtime 发布:实时语音开始自己调用工具

阿里发布 Qwen-Audio-3.0-Realtime,Plus 与 Flash 两个版本同时升级语音推理、工具调用、共情表达和双工交互,本文梳理 benchmark、API、上下文限制、价格缺口与开发者试用方法。

一句话判断

阿里在 7 月 15 日发布 Qwen-Audio-3.0-Realtime,把实时语音模型的竞争点从「能不能自然说话」推进到「能不能听懂口语、自己调用工具,还能处理打断」。模型分为推理更强的 Plus 和速度更快的 Flash,当前已通过阿里云百炼 WebSocket API 提供中国内地服务。12
对开发者来说,最值得先测的不是一段普通闲聊,而是两条链路:嘈杂环境中的自然打断,以及「语音指令 → 工具调用 → 追问时继续使用工具结果」。这两项正好对应 Qwen-Audio-3.0-Realtime 的双工控制和 Agent 能力。

核心信息

项目已确认信息
发布方与时间千问 / 阿里,官方发布页标注为 2026 年 7 月 15 日;百炼模型上架记录为 7 月 14 日。12
模型 IDqwen-audio-3.0-realtime-plusqwen-audio-3.0-realtime-flash3
版本定位Plus 侧重推理能力,Flash 侧重响应速度。官方没有给出两者的参数规模。1
输入、输出与协议支持音频和文本输入,输出音频和文本;通过 WebSocket 双工流式交互。官方示例使用 16 kHz、16 bit、单声道 PCM 输入,输出为 24 kHz、16 bit、单声道 PCM。3
上下文容量Plus 与 Flash 均支持最多 50 个音频轮次、累计 300 秒音频;默认历史轮次为 20,可调到 50。3
服务范围百炼模型上架记录标注服务部署范围为中国内地;接入方式为 WebSocket。24
价格截至本轮核验,百炼公开模型价格页的实时模型价格表未列出这两个新模型的专属单价,不能用 Qwen3.5-Omni-Realtime 等同类模型价格替代。实际计费以百炼控制台显示为准。5

四条升级线

语音推理

官方给出的 VoiceBench 结果显示,Plus 在标准 prompt 和口语化 prompt 下分别得分 92.5 和 90.5,口语化提问只下降 2.0 分。AudioMultiChallenge 中,Flash 的两个分数为 43.6 和 38.1,下降 5.5 分。两组数字都来自阿里官方发布材料,属于厂商披露结果,不能直接当作独立复测结论。1
Preview 版本 Fun-Realtime-Audiochat 还曾在 Artificial Analysis 的「Speech Reasoning」指标中以 97.6% 登顶,在对话流畅度指标中以 97.8% 登顶。官方发布页将这两项结果作为 Preview 版本的历史成绩披露,正式版是否在同一评测提交中保持相同口径,需要后续页面更新或独立复测确认。1
在 S2S 语音指令遵循基准 VStyle 上,官方称 Qwen-Audio-3.0-Realtime 取得 SOTA,但没有在发布页给出可直接比较的分数。16

Agent 工具调用

模型可以根据对话上下文自行判断是否需要外部工具,不必等用户说出一条格式化的「请调用工具」指令。官方举的例子是,用户先问附近的川菜馆,再追问「评分 4.5 以上的哪家最近」,模型可以继续使用前一次地图工具返回的结果。工具结果会写回对话上下文,后续轮次可以接着使用。1
工程上仍然要完成完整的 Function Calling 闭环:在会话中注册工具 schema,接收模型发出的函数参数,实际执行 MCP、API 或知识库查询,再通过 conversation.item.create 写回结果并触发下一轮生成。百炼官方文档已给出这套事件流程,模型的「自主判断」不等于应用端可以省掉工具执行层。3

共情与表达

模型会根据语境调整语气、节奏、音调和情感表达,也能理解和生成笑声、叹息、犹豫等副语言信号。官方将它对应到辩论、角色扮演和情感陪伴等场景,并提供系统音色和声音复刻音色配置。13
这里的实际价值不只是「声音更像人」。语气、停顿和副语言信号会影响用户是否愿意继续说,也会影响客服、教育和陪伴应用对情绪变化的响应。不过,发布材料没有给出情感识别准确率或用户研究数据,这部分仍应通过真实对话样本评测。

双工交互

Qwen-Audio-3.0-Realtime 内置多模态双工控制模型,同时分析音频、语义和说话人声纹特征,用于判断何时继续说、何时接受插话,以及当前应该跟谁对话。官方声称它能在餐厅、开放工区等噪声环境中减少误打断,在多人交谈中锁定主要对话对象。1
百炼文档提供三种轮次模式:声学 VAD、融合声学与语义判断的 smart_turn,以及手动 push-to-talk。smart_turn 会尽量避免把「嗯」「啊」之类的无意义附和当成打断;如果应用更看重可控性,也可以使用手动模式。文档还支持通过 audio_prompt 传入目标用户的预录音频,在双工对话中增强说话人锁定。3

怎么试

  1. 先用 Plus 测复杂任务。 选择 qwen-audio-3.0-realtime-plus,测试多条件口语指令、连续追问和工具结果复用,观察它是否能在自然表达下正确拆解任务。
  2. 再用 Flash 测时延。 选择 qwen-audio-3.0-realtime-flash,重点记录首个可听见音频的时间、打断后的恢复时间,以及普通问答的端到端延迟。官方只确认 Flash 更快,尚未在公开价格页给出专属单价。
  3. 把噪声和多人场景放进回归集。 用餐厅、开放办公区和多人讨论的录音测试误打断、漏打断、主说话人识别和切换稳定性。
  4. 记录工具调用的真实成功率。 不只看模型是否发出函数调用,还要统计参数是否完整、工具结果是否正确写回、用户下一轮追问能否复用上一次结果。
体验入口:
对需要实时语音 Agent 的团队,这次发布值得进入候选评测名单,但判断上线与否还要等两件事补齐:专属计费信息,以及对正式版在真实噪声、打断和多轮工具调用场景中的独立测试。

関連コンテンツ

  • ログインするとコメントできます。
More from this channel