30 秒快速回答:端到端语音大模型(Speech-to-Speech,S2S)是一种直接「听音频、说音频」的大模型——它跳过传统的「语音转文字(ASR)→ 大模型推理 → 文字转语音(TTS)」三段级联链路,把响应延迟从秒级压到 200-300 毫秒的人类自然对话区间,同时保留语气、停顿、情绪等副语言信息。
一句话价值:它是让 AI 从「机械问答机」走向「像真人一样边听边聊、可随时打断」的关键技术,也是 2026 年语音助手、语音 Agent 爆发的底层引擎。
一、为什么传统语音 AI 总是「慢半拍」
过去几年,市面上的语音助手几乎都采用级联(Cascade)架构,把对话拆成三件事交给三个独立模型:
| 阶段 | 组件 | 作用 |
|---|---|---|
| 语音转文字 | ASR(如 Whisper、Deepgram) | 把你说的话变成文本 |
| 大模型推理 | LLM(如 GPT、Claude) | 对文本生成回答 |
| 文字转语音 | TTS(如 ElevenLabs、Cartesia) | 把回答文本念出来 |
这个流水线有两个致命问题:一是延迟叠加,三段各自排队,端到端延迟普遍在 1.2-2.5 秒,优化后也要 600-900 毫秒,用户明显能感到「机器在思考」;二是信息丢失,ASR 转文字时,你的语气、情绪、停顿、音色全被抹平——一句「我没事」用疲惫还是愤怒的语气说出来,含义完全不同,但文本里只剩下「我没事」三个字。
二、端到端语音大模型:音频进、音频出
端到端语音大模型的思路很直接:让一个模型同时完成理解和生成,中间不再转文字。音频信号直接进模型,模型直接输出音频信号(通常是神经音频编解码器生成的离散音频标记)。
这种设计的收益来自三方面:
- 低延迟:去掉 ASR 和 TTS 两个环节后,GPT-4o 对音频输入最快 232 毫秒即可响应、平均约 320 毫秒,逼近人类对话的应答节奏。
- 保留副语言信息:语气、停顿、笑声、情绪成为模型原生能感知和生成的维度,而非被丢弃的噪音。
- 原生全双工(Full-Duplex):模型可以一边听你说话一边输出语音,支持插话、打断和「嗯、啊」这类倾听语气词,模拟真人对话节奏。
| 维度 | 级联架构(ASR→LLM→TTS) | 端到端语音大模型 |
|---|---|---|
| 链路 | 三个独立模型串联 | 单一模型音频进音频出 |
| 首包延迟 | 1.2-2.5 秒 | 200-400 毫秒 |
| 副语言信息 | 转文字时丢失 | 原生保留 |
| 可打断性 | 困难 | 原生全双工 |
| 可调试性 | 高(每段文本可审计) | 较低(中间无文本可截获) |
三、核心技术:Thinker-Talker 双核与神经音频编解码
端到端语音模型在工程上有两个关键设计。
其一,神经音频编解码器(Neural Audio Codec)。模型不直接输出波形,而是把音频压缩成离散的「音频标记」(类似音频版的 Token),再解码成波形。这样语音生成就能复用文本大模型的 Transformer 推理框架。
其二,Thinker-Talker 双核架构。以阿里开源的 Qwen-Omni 系列为代表:Thinker 负责「听懂并思考」,Talker 负责「把答案说出来」,二者解耦、流式协作。Talker 自回归地预测离散语音编解码标记,用轻量因果卷积网络替换块状扩散,让流式输出从第一帧就能开始,冷启动首包延迟低至约 200 毫秒。Qwen-Omni-Realtime 套件正是这一架构的落地,支持文本、语音、视频流统一建模。
一个概念性的调用示意(以 OpenAI Realtime API 为例,通过 WebSocket 做全双工流式对话):
import asyncio, json, websockets
async def realtime_voice():
url = "wss://api.openai.com/v1/realtime?model=gpt-realtime-2"
headers = {"Authorization": f"Bearer {API_KEY}", "OpenAI-Beta": "realtime=v1"}
async with websockets.connect(url, additional_headers=headers) as ws:
# 建立会话,指定音频输出
await ws.send(json.dumps({
"type": "session.update",
"session": {"modalities": ["audio", "text"]},
}))
# 追加输入音频(16kHz PCM)
audio = open("input.pcm", "rb").read()
await ws.send(json.dumps({
"type": "input_audio_buffer.append",
"audio": audio.hex(),
}))
# 流式接收音频回复
async for msg in ws:
evt = json.loads(msg)
if evt["type"] == "response.audio.delta":
print(f"收到音频片段: {len(evt['delta'])} bytes")
asyncio.run(realtime_voice())
四、主流模型横向对比
截至 2026 年 8 月,端到端语音赛道已经非常拥挤,主要玩家如下:
| 模型 | 厂商 | 开源 | 首包延迟 | 特点 |
|---|---|---|---|---|
| GPT-Realtime-2 | OpenAI | 闭源 | ~320ms | 综合能力与复杂工具调用最强 |
| Gemini 3.1 Flash Live | 闭源 | ~320ms | 原生处理音视频流,多模态接地 | |
| Qwen-Omni-Realtime | 阿里 | 开源 | 200-300ms | Thinker-Talker 双核,全模态流式 |
| Step-Audio 2.5 | 阶跃星辰 | 部分开源 | - | 国产语音推理榜第一,高拟人度 |
| PersonaPlex-7B | NVIDIA | 开源 | - | 7B 小尺寸,端侧部署友好 |
| Moshi | Kyutai | 开源 | - | 开源端到端语音标杆 |
在 Scale AI 推出的盲测榜 Voice Showdown 中,Gemini 2.5 Flash Audio 与 GPT-4o Audio 的 S2S 得分并列前二;语音 Agent 方向,Gemini 3.1 Flash Live 在 ComplexFuncBench Audio 上函数调用准确率达 90.8%。国内腾讯混元 HyASR 3.0 则把普通话词错率压到 2.62%,强化方言与噪音场景。
五、怎么选型:三个实用判断
选型不必纠结「谁最强」,按需求对号入座即可:
- 追求综合质量与工具调用:GPT-Realtime-2,复杂语音 Agent 的默认推荐,代价是成本偏高。
- 强推理 + 低成本、可接受稍慢起音:Gemini 3.1 Flash Live。
- 要开源、要自部署、要中文本土化:Qwen-Omni-Realtime 或 Step-Audio,前者架构公开、后者国产语音推理表现领先。
- 端侧 / 低资源设备:NVIDIA PersonaPlex-7B 这类 7B 级小模型,或 Moshi 做原型验证。
总结与延伸阅读
端到端语音大模型的核心,是把「转文字」这道信息损耗和延迟的关卡从链路里拿掉,让模型直接面对原始音频,从而同时获得低延迟、副语言信息、全双工交互三样能力。级联架构并非退场——在需要逐段审计、可控合规的场景它仍是主流,但性能差距正在快速收窄。
仍需正视的挑战:长对话中的幻觉与情绪一致性、全双工高算力成本、以及声音复刻带来的伪造安全风险(行业已开始引入音频水印检测)。
延伸阅读:
- 结合本站《什么是多模态 AI》《什么是 AI Agent 评测基准》理解语音模型的评测与定位
- Qwen-Omni-Realtime 官方技术报告(Thinker-Talker 双核架构)
- Scale AI Voice Showdown 榜单(真实语音场景盲测)
- OpenAI Realtime API 与 Gemini Live API 开发文档