GPT-4o以最快232毫秒响应音频输入、Moshi理论延迟仅160毫秒、豆包语音助手实现动态判停、Qwen3-ASR支持30个语种和22个中国方言——2026年,语音交互正从“你说一句、我回一句”的接力赛,进化为“边说边听、随时打断”的实时对话。厦门大学智能语音实验室发布的这份技术报告,系统梳理了从语音识别大模型到端到端对话模型再到全双工语音交互的技术演进路径,揭示了BBPE编码如何破解多语种识别、语义VAD如何让机器“听懂”人是否说完、Moshi如何在L4 GPU上实现亚200ms延迟的人机共话。
语音交互的范式跃迁——从级联式到全双工端到端
级联式对话模型的三大局限
最基础的语音对话系统包含语音识别(ASR)、大语言模型(LLM)和语音合成(TTS)三个核心模块。这种级联式架构存在三大问题:信息丢失——语音信号中的副语言信息(音高、音色、语调)在文本转换中丢失;错误累积——ASR错误会逐级放大;高延迟——数据在多个模块间传递,响应时间长达840-3550毫秒。
端到端与全双工——语音交互的终极形态
端到端对话模型通过语音编码器将语音离散化,由语言模型直接处理语音数据。全双工通信允许双方同时发送和接收数据,模型可以“边说边听”,用户可以在AI说话时随时打断。GPT Realtime采用WebRTC协议,音频以连续流形式到达。关键挑战在于“打断”和“判停”——语义VAD让机器准确识别用户是否讲完。
语音识别大模型——从Transformer到多语种BBPE
Transformer、Conformer与流式识别
Transformer凭借自注意力机制成为语音识别主流架构。Conformer融合卷积模块,更有效捕捉语音局部与全局依赖。流式识别以chunk输入,通过偏移信息实现低延迟。Whisper使用68万小时弱标签数据训练,模型尺寸从39M到1.55B参数。Qwen3-ASR(2026.01)支持30语种22方言,约4000万小时伪标签数据。
BBPE编码——破解多语种与方言识别
BBPE基于UTF-8编码+BPE,可跨语言使用。基于Unicode编码后使用byte建模打破语言限制,所有语言可共用建模单元。英语字符在ASCII码中天然是BBPE,其他语言字符通过多个字节编码。小红书FireRedASR中文采用字符编码、英文采用BBPE编码,在AISHELL-1上CER达0.76%。
端到端对话模型的核心技术
三种Speech Tokenizer——语义、声学、统一
语义Token(Wav2Vec/HuBERT/Whisper)捕捉内容信息;声学Token(SoundStream/EnCodec)采用RVQ压缩,携带语气、风格、情感;统一Token(SpeechTokenizer/X-Codec)兼顾两者。RVQ通过逐步分解残差量化,多个量化器逐层逼近原始数据,减少量化误差。
Flow Matching与开源模型
Flow Matching学习连续时间向量场,使简单分布演化为真实数据分布。GLM-TTS基于条件流匹配预测梅尔频谱。Moshi建模两路音频,7B Temporal Transformer,L4 GPU延迟<200ms。GLM-4-Voice每秒仅需12.5个离散Token。Kimi-Audio预训练超1300万小时音频。
全双工语音交互——打断与判停
语义VAD——让机器“听懂”人是否说完
EasyTurn基于Qwen2.5-0.5B微调,预测四种对话状态。Phoenix-VAD结合滑动窗口,0.6B参数真实测试完整/不完整准确率0.800/0.838。SoulX-Duplug首次将VAD、ASR、对话轮次检测统一在单一流式模型。
全双工模型演进
Moshi用Pyannote数据集训练多流能力,Fisher数据集微调。FreezeOmni冻结LLM参数三阶段训练。PersonaPlex基于Moshi支持角色定义。Covo-Audio基于Qwen2.5-7B,分块chunk流支持实时输入。
当GPT-4o以320ms逼近人类水平、Moshi在L4 GPU流畅运行、语义VAD让机器“懂意知止”——语音交互正在从“工具”演化为“伙伴”。