返回顶部
返回首页 会员充值 我的足迹 返回上一页
具身智能
情绪经济
商业航天
十五五
银发经济

端到端语音对话模型

GPT-4o最快232毫秒响应音频输入、Moshi理论延迟仅160毫秒、GLM-4-Voice每秒音频仅需12.5个离散Token、Kimi-Audio预训练超1300万小时——2026年,端到端语音对话模型正在打破“ASR+LLM+TTS”的级联枷锁。厦门大学智能语音实验室的报告系统拆解了端到端语音对话模型的三大核心组件:Speech Tokenizer(语义/声学/统一Token)、LLM、Speech Detokenizer(Flow Matching),并深度分析了Moshi、GLM-4-Voice、Freeze-Omni、Qwen-Omni、Kimi-Audio、Step-Audio2等开源模型的技术路径。

端到端对话模型的核心架构

三大组件——Tokenizer、LLM、Detokenizer

端到端语音对话模型包含三个核心组件。语音编码器(Speech Tokenizer)将连续语音信号转化为离散Token序列,尽可能保留原始语音的声学和语义信息。大语言模型(LLM)在语音Token和文本Token的统一空间中建模,解决语音文本对齐问题。语音解码器(Speech Detokenizer)将LLM输出的Token转化为语音输出。

级联式与端到端的本质区别

级联式SpeechLMs存在信息丢失(副语言信息在文本转换中丢失)、错误累积(ASR错误逐级放大)、高延迟(840-3550ms)三大问题。端到端模型通过统一语音和文本的Token空间,从根本上解决了这些问题。

Speech Tokenizer的三种技术路线

语义Token——捕捉内容信息

语义Token优先捕捉语音中的内容信息,适合与识别、翻译模块结合。典型模型包括Wav2Vec、HuBERT、Whisper。编码器接入LLM需要增加适配器和额外训练阶段实现模态对齐。CosyVoice2在SenseVoice-Large的Encoder插入FSQ实现量化表征,CosyVoice3替换Encoder并进行多任务训练。

声学Token——高保真重建

声学Token聚焦语音压缩与高保真重建,携带语气、风格、情感等声学信息。采用神经音频编解码器(SoundStream、EnCodec)将连续语音信号经Encoder输出连续隐向量,再做向量量化(VQ)编码为离散语音Token序列。残差向量量化(RVQ)通过逐步分解数据残差进行量化,使用多个量化器逐层逼近原始数据,减少量化误差。SoundStream由重建损失和对抗损失共同优化。EnCodec结合卷积神经网络、RVQ、多尺度对抗训练和Transformer熵编码。

统一Token——兼顾语义与声学

音频编解码器产生的离散化Token包含丰富声学信息但缺乏语义信息。SpeechTokenizer和Mimi通过蒸馏丰富语义信息,X-Codec通过语义特征融合。Qwen3-TTS Tokenizer提供25Hz和12Hz两种帧率选项。

Speech Detokenizer与Flow Matching

Flow Matching——从语义到声学的映射

Speech Detokenizer将离散Token通过Decoder生成梅尔谱,然后通过声码器转成波形。Flow Matching学习连续时间向量场,使简单分布逐步演化为真实数据分布。条件流匹配(CFM)以真实样本为条件,将全局建模转化为单样本轨迹建模。最优传输流匹配(OT-CFM)在噪声样本和真实样本间做线性插值,训练目标为预测速度场。GLM-TTS基于CFM预测梅尔频谱,然后通过声码器转为波形。

代表性开源端到端模型

Moshi——160ms理论延迟

Moshi由Kyutai Labs开发,建模两路音频(Moshi说话+用户说话)。Mimi编解码器第一个VQ从WavLM蒸馏学习语义信息,其余7个为RVQ。7B Temporal Transformer处理时间依赖,Depth Transformer建模每个时间步码本依赖。L4 GPU上延迟可低于200ms,支持70多种情绪和说话风格。

GLM-4-Voice——每秒12.5 Token

由清华团队开发,三部分组成:Whisper Encoder+VQ作为Tokenizer、GLM-4-9B作为LLM、Flow Matching+Hifi-GAN作为Decoder。每秒音频仅需12.5个离散Token,最少10个语音Token即可开始生成,支持中英语音交互。

Qwen-Omni、Kimi-Audio与Step-Audio2

Qwen-Omni系列专为多模式感知设计,无缝处理文本、图像、音频、视频,支持流式文本生成和自然语音合成。Kimi-Audio采用Whisper编码器生成语义Token,LLM用Qwen2.5-7B初始化并扩展词表,预训练超1300万小时音频,chunk-wise流解码。Step-Audio2主打副语言理解,涵盖11个维度(音色、音高、节奏、语速、说话风格),130B参数多模态LLM,以推理为中心的强化学习(CoT+PPO+GRPO)。

端到端语音对话模型正在从“能听懂”走向“能共情”——当语音Token化技术同时保留语义和声学信息,当Flow Matching让合成语音逼近真人质感,当模型学会在1300万小时音频中提取规律,AI对话正在从“功能实现”走向“体验沉浸”。
点击阅读报告原文: 大数据百家讲坛:2026语音大模型:从语音识别到全双工语音交互报告(72页)
相关报告