🖼️ 图文卡片 🏠 返回首页
前沿科技洞见 · 2026-07-29

榜首之后,语音智能体真正的战争才刚开始

资料提供:前沿科技研究部
正在发生的事很多,这件帮你看过了

2026-07-29

2026 年 7 月 29 日,Qwen Audio 3.0 Realtime Plus 以 84.1% 位列 Artificial Analysis Speech to Speech Index 第一,高于 GPT-Realtime-2.1 High 的 79.1%;但其平均首段音频时间为 4.02 秒,远慢于榜单最快的 0.44 秒。

榜首揭示的不是胜负,而是四组矛盾

Qwen Audio 3.0 Realtime 是阿里把音频理解、流式语音生成、双工对话和函数调用压进同一条实时链路后,面向语音智能体推出的生产模型。它与传统 ASR—LLM—TTS 级联的差别,不只是少了两个接口:级联可以分别优化和替换模块,却会叠加三段延迟,并在转写中损失语气、停顿、犹豫和情绪;原生链路则试图一边听,一边判断何时接话,必要时调用工具,再直接用合适的语气回答。

84.1% 是推理、全双工对话和语音 Agent 任务完成率的等权综合。Qwen Audio 3.0 Realtime Plus 三项分别为 99.2%、98.4% 和 54.6%:它已经能听懂、能接话、也开始能办事,但近一半 Agent 任务仍失败。4.02 秒则说明,一个在榜单上最聪明的语音智能体,仍可能让电话另一端的人以为线路断了。

因此,榜首更像一张剖面图:它同时暴露能力与速度、原生模型与级联系统、开放研究与封闭服务、自然交谈与可靠执行之间的矛盾。

三年纵轴:从理解声音到在声音里办事

2023 年的 Qwen-Audio 先把声音定义为可推理输入,而不只是 ASR 的原料。它覆盖 30 多种任务、八种语言,以及语音、环境声、音乐和歌曲等音频,用分层标签协调识别、翻译、描述、分类、情绪、问答和音乐分析等不同数据格式;Qwen-Audio-Chat 再用指令微调加入多轮交互。它建立了“通用听觉”路线,但输出中心仍是文字:模型有了耳朵,还没有形成听、想、说同步运转的身体。

2024 年的 Qwen2-Audio 去掉复杂的分层任务标签,改用自然语言提示组织预训练任务,并以 DPO 改善事实性和行为遵循。Voice Chat 与 Audio Analysis 可以依据输入切换,不要求用户先声明任务模式。问题由“该听什么”转向“何时接话”:会对音频作答,并不等于能识别停顿、附和和打断。

2025 年 3 月,Qwen2.5-Omni 的 Thinker–Talker 架构完成第一次结构性转折。Thinker 负责多模态理解、高层表征和文字,Talker 读取其中间表征与历史上下文,以双轨自回归持续生成离散语音单元;它不必等完整文字答案写完再做 TTS。TMRoPE 同时对齐音频与视频的时间点。这个设计承认“想什么”和“怎么说”运行在不同节奏,却可以在同一模型体系中重叠。

2025 年下半年到 2026 年上半年,语音能力被拆成基础设施。Qwen3-Omni 延续 Thinker–Talker,并把两侧推进到 MoE;官方报告称其支持 119 种语言的文字交互、19 种语言的语音理解、10 种语言的语音生成,音频场景首响应最低 211 毫秒,并加入函数调用。随后,Qwen3-ASR、Qwen3-TTS、Qwen3-Omni 和 LiveTranslate 分别承担识别、合成、全模态与翻译。

Qwen3-TTS 在超过 500 万小时、十种语言的语音上训练:25Hz tokenizer 偏重语义和高质量流式重建,12.5Hz 版本把同一秒语音的预测步数减半,以质量、可控性和计算量的重新分配换取低延迟。Qwen3.5-Omni 扩展到数千亿参数、256K 上下文和超过一亿小时音视频训练数据,以 Hybrid Attention MoE 降低长序列成本,并用 ARIA 动态对齐文字与语音单元。2026 年 7 月 13 日提交的 Qwen-Audio-VAE 则以因果编解码器、窗口 Transformer、非对称骨干和延迟导向的 encoder 剪枝压缩多域音频;官方结果是编码 32 分钟音频需 541 毫秒。一天后,Qwen Audio 3.0 Realtime 上线。

这些相邻发布说明阿里正把“会听会说”变成分层语音栈:表示层压缩音频,模型层理解与决策,Talker/TTS 生成语音,流式协议送达终端。但截至 2026 年 7 月 29 日,阿里没有公开 Qwen Audio 3.0 Realtime 的独立技术论文、参数量或训练数据;相邻模型只能证明技术储备,不能证明 Realtime 内部直接复用了同一组件。

2026 年 7 月的产品分工进一步承认:最强推理、最全模态、最低延迟和最自然对话,现阶段无法在同一配置上同时取到最大值。Realtime Plus 偏推理和任务,Flash 偏速度和成本;Qwen Audio Realtime 面向实时语音与函数调用,Qwen3.5-Omni 面向音视频、搜索和全模态,思考模式则走 HTTP 文件式调用且不支持语音输出。专用 ASR、TTS 和翻译模型继续处理垂直任务。

接入边界也不能混写。更广的 QwenCloud 实时栈覆盖适合浏览器音视频的 WebRTC 和面向移动弱网的 AOQ,但 Qwen Audio 3.0 Realtime 当前公开接入方式是 WebSocket。

84.1% 的含义与测量边界

Artificial Analysis 的 Speech to Speech Index 等权合并三类任务:Big Bench Audio 用语音测试形式谬误、路径导航、物体计数和真假推理;Full Duplex Bench 子集测试自然停顿、接话、打断和附和;τ-Voice 在航空、零售和电信客服模拟系统中要求模型读取政策、调用工具并以最终数据库状态判定成功。

Qwen 的综合领先来自三个维度同时抬高,而不是只在“声音自然”上获胜。但它的平均首段音频时间为 4.02 秒;Deepslate Opal 为 0.44 秒,Gemini 2.5 Flash Native Audio Dialog 为 0.63 秒,Grok Voice Fast 1.0 为 0.78 秒,Qwen 自家的 Qwen3 Omni Realtime 为 0.88 秒。阿里已经证明专用 Realtime 模型可以更聪明,却还没有证明它比自家上一条路线更快。

这些数字只是 2026 年 7 月 29 日的动态页面快照。榜单没有公开的日期版本锁定;TTFA 仅统计 Big Bench Audio 中从接收语音问题到第一个音频输出 token 的平均时间,不覆盖完整回复、真实网络、终端播放和用户侧轮次检测。Big Bench Audio 又使用英语合成音频,主要覆盖美英口音与四类逻辑、导航、计数题,不能替代中文方言、噪声、情绪和长会话实测。

百毫秒级 TTS 首包与 4.02 秒 Speech-to-Speech 首音频也不是同一口径。前者只测特定条件下的合成子系统,后者包含输入理解、推理、轮次判断、工具规划和网络排队;TTS 再快,也不能单独消除整条链路的等待。

横向竞争:四条路线争夺不同入口

| 路线 | 代表产品 | 决定性优势 | 主要约束 | 更像什么 | |---|---|---|---|---| | 专用语音 Agent | Qwen Audio 3.0 Realtime | 综合评测、函数调用、低输入价格 | Plus 首音频慢,搜索与思考受限 | 可嵌入业务的语音执行层 | | 通用语音 Agent 平台 | OpenAI GPT-Realtime / GPT-Live | 工具生态、复杂推理、消费端分发 | 成本、封闭性与后台路由透明度 | 带语音前台的通用 Agent | | 原生音视频交互 | Google Gemini Live | 低延迟、视频与屏幕上下文 | 部署、带宽、隐私与版本组合复杂 | 实时多模态观察者 | | 云内企业语音 | Amazon Nova Sonic | Bedrock、IAM、VPC、审计与客服部署 | 语言较窄,生态主要在 AWS | 企业呼叫中心基础件 |

Qwen 的边界最清楚:它接受文字和音频并支持函数调用,但不支持内置网页搜索和思考模式,适合把“查订单”“改签”“创建工单”等受控动作交给外部系统。τ-Voice 的 54.6% 因而有业务信号。价格也是进攻面:榜单给出的输入音频标价约每小时 0.0331 美元、输出约每小时 0.18 美元;固定 Big Bench Audio 子集的完整任务成本折算约每小时输入音频 4.42 美元,因为还包含输出、文字和推理 token。采购不能把输入单价当作会话总成本。Plus 的 4.02 秒与 Flash 的 76.3% 综合指数、35.9% Agent 完成率,则把速度和办事能力明确分成两档。

OpenAI 选择“交互前台+认知后台”。GPT-Realtime-2 引入 GPT-5 级推理;GPT-Live 让持续交互模型每秒多次决定继续听、暂停、打断或调用工具,把搜索、复杂推理和长程任务委派给 GPT-5.5,自己维持现场感。简单函数调用时,Qwen 单链路更直接;开放式研究或多任务时,GPT-Live 更有弹性。OpenAI 还拥有每周超过 1.5 亿人使用 ChatGPT 语音与听写功能的入口,但多模型路由并不完全透明,GPT-Live 首发于 ChatGPT,API 仍在后续计划中。

Google Gemini Live 从一开始就持续流式处理音频、视频和文字,适合维修、屏幕协作、远程检查和教育演示等必须把“这里”“这个按钮”与画面时间点对应的场景;0.63 秒首音频显示其低延迟优势。代价是更多带宽、隐私、成本与治理范围,预览版和稳定版切换也增加采购复杂度。

Amazon Nova Sonic 不以公开综合榜首为核心,而是依托 Bedrock,把双向流式、工具调用接入 IAM、SigV4、VPC 和 AgentCore 的容器、日志与多租户隔离。它更容易穿过大型企业的认证、审计、并发和故障恢复流程;但第一代主要支持英语、法语、意大利语、德语和西班牙语,在中文、多方言和跨语言场景中弱于 Qwen 与 Gemini。

四条路线的选择因此取决于业务入口:中文和方言的大规模受控业务对话偏向 Qwen;通用 Agent、MCP 与复杂推理偏向 OpenAI;摄像头、屏幕和现场声音偏向 Gemini Live;AWS 内认证、隔离、审计和弹性部署偏向 Nova Sonic。这个市场不会很快一家独大,因为语音只是入口,背后的业务系统、云平台、合规边界和用户语言才决定模型的生态位。

还有一个共同边界:2026 年研究测试 GPT Realtime 2、Gemini 3.1 Flash Live、Qwen3.5 Omni Plus 和 Flash 后发现,在词义与说话方式冲突时,四套系统往往跟随文字内容,忽略语调传达的情绪、年龄和口音;显式提示关注语音表达也只能部分且不稳定地改善。因此,“原生音频”不自动等于“真正听懂声音”。

横纵交汇:竞争单位变成一段被正确完成的关系

Qwen 的 99.2% 语音推理、98.4% 双工对话和 54.6% Agent 完成率,分别对应通用听觉、Thinker–Talker 同步、函数调用与工作流三条积累。相同路线也产生代价:把更强推理放入实时链路推高等待;把能力拆成 Realtime、Omni、ASR、TTS 和 LiveTranslate 增加选型复杂度;云端专用服务也没有延续早期 Qwen Audio 的开放权重、本地部署优势。

实时语音的真实质量是一组乘法:听对 × 不抢话 × 足够快 × 调对工具 × 说得合适 × 在正确边界内执行。任一项接近零,体验都会坍塌。等权榜单迫使行业承认“声音好听”只是一部分,却仍会掩盖业务差异:急救分诊重准确和边界,车载助手重打断和速度,银行客服重身份、审计和工具调用。84.1% 可以证明 Qwen 是当前最均衡的选手之一,不能证明它已经是所有场景的最佳选择。

下一代语音智能体更可能按时间尺度分层,而不是由一个超大语音模型包办一切。毫秒级前台维持在场感,秒级模型完成复杂判断,分钟级 Agent 在后台执行;这不同于按 ASR、LLM、TTS 模态拆分的老式级联。调度、缓存、打断恢复、身份认证、工具权限、会话记忆和成本控制将进入核心竞争。

三个未来剧本

最可能的剧本是,Qwen 先在客服、教育、车载、游戏角色和中文语音工作流中扩大采用,却不垄断个人助手。Plus 处理复杂任务,Flash 承担高并发低成本,外部系统提供搜索、知识和交易;首音频时间可能通过更积极的流式、预响应或前后台分层下降。OpenAI 和 Google 仍保有消费分发与生态优势,Qwen 更可能成为许多产品背后的声音。

最危险的剧本是,4.02 秒长期不降,开发者转向 Flash 或其他模型;企业又把“原生音频”误当可靠情绪判断,并让可调用函数的 Agent 在权限、确认和审计不足时改错订单、泄露数据或执行不当操作。此时 Qwen 不是输给某个模型,而是整个原生语音赛道输给企业对不确定性的厌恶。

最乐观的剧本是,Qwen-Audio-VAE、TTS、Realtime、Omni、ASR 和 LiveTranslate 形成共享表示、数据与推理基础设施的可组合网络:弱网移动端走 AOQ,浏览器走 WebRTC,服务端走 WebSocket;Flash 维持前台对话,Plus 或 Omni 在后台推理,高风险动作进入受控函数和确认流程。若接口、评测口径和版本生命周期也足够稳定,Qwen 的壁垒将从某一天的 84.1%,转向模型、云、协议和中文业务数据之间难以拆开的协同。

Qwen Audio 3.0 Realtime Plus 同时给出行业最好的消息和最诚实的坏消息:语音终于能在同一链路里理解、掌握对话节奏并调用工具,但综合能力仍要用等待、失败率和系统复杂度支付。三年前的问题是机器能否理解各种声音;今天的问题是机器能否在正确的时间、以正确的权限,替人完成正确的事。四秒沉默,是行业从会说话走向会共事必须穿过的距离。

信息来源

1. Artificial Analysis:Speech to Speech Models and Providers Analysis 2. Artificial Analysis:Announcing the Speech to Speech Index 3. Artificial Analysis:Speech Reasoning Benchmarking Methodology 4. Artificial Analysis:Big Bench Audio 数据卡 5. Alibaba Cloud Model Studio:Qwen Audio 3.0 Realtime Plus 模型信息 6. Alibaba Cloud Model Studio:Newly Released Models 7. QwenCloud:Speech-to-Speech Models 8. QwenCloud:Realtime API Overview 9. Qwen-Audio:Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models 10. Qwen2-Audio Technical Report 11. Qwen Team:Qwen2.5-Omni — See, Hear, Talk, Write, Do It All 12. Qwen Team:Qwen3-Omni — Natively Omni-Modal Foundation Models 13. Qwen3.5-Omni Technical Report 14. Qwen3-TTS Technical Report 15. Qwen-Audio-VAE Technical Report 16. Qwen-Audio-3.0-TTS Technical Report 17. OpenAI:Introducing gpt-realtime and Realtime API Updates for Production Voice Agents 18. OpenAI:Advancing Voice Intelligence with New Models in the API 19. OpenAI:Introducing GPT-Live 20. Google Developers Blog:Achieve Real-Time Interaction with the Live API 21. Amazon Nova:Using the Nova Sonic Speech-to-Speech Model 22. Real-Time Voice AI Hears but Does Not Listen

图文卡片 ⬇️ 一键下载图文卡片