GPT-4o的Realtime模式让AI可以“边说边听”、Moshi以160ms理论延迟实现双工对话、语义VAD让机器“听懂”人是否说完而非仅靠静音检测——2026年,全双工语音交互正在从实验室走向真实应用。厦门大学智能语音实验室的报告系统解析了全双工语音交互的两大核心技术:语义VAD(EasyTurn、Phoenix-VAD、SoulX-Duplug)和全双工模型(Moshi、FreezeOmni、PersonaPlex、Covo-Audio),揭示了语音交互从“半双工接力”到“全双工共话”的技术突破路径。
全双工语音交互的定义与核心挑战
单工、半双工与全双工
单工通信数据仅沿一个方向流动;半双工通信数据在两个方向流动但不同时流动,类似对讲机;全双工通信允许双方同时发送和接收数据。语音大模型必须以全双工形式运行,同时处理模型输出的音频和用户的指令音频。GPT Realtime采用WebRTC协议,音频以连续流形式到达,协议本身支持全双工通信。
两大核心挑战——打断与判停
用户打断时,语音助手应停止回复,这需要系统能实时感知用户开始说话。判停要求语音助手准确识别用户是否讲完,即意图判断。若判停过早,会频繁打断用户;若判停过晚,会增加延迟,影响交互自然度。
语义VAD——让机器“听懂”人是否说完
声学VAD的局限
传统声学VAD仅检测语音能量,无法判断语义完整性。当用户思考中短暂停顿时,声学VAD可能误判为结束,过早开始回复;当用户真正说完但句末语调上扬时,声学VAD又可能误判为未完,延迟回复。级联式全双工交互链路中,声学VAD尾端延迟已达300-800ms。
EasyTurn——四种对话状态预测
EasyTurn基于Qwen2.5-0.5B-Instruct微调,同时发布1145小时训练数据。集成声学和语言学信息,预测四种对话变换状态:语义完整(complete)、语义不完整(incomplete)、“嗯/对”等简短回应(backchannel)、等待(wait)。这是语义VAD的早期开源实践。
Phoenix-VAD——无需ASR的实时语义感知
Phoenix-VAD结合滑动窗口策略,支持无需ASR转录、流式、语义感知、即插即用。提出超时机制减少误中断。仅采用合成数据训练,0.6B参数在真实测试集上完整/不完整状态准确率达0.800/0.838,在无需ASR转录条件下优于Smart Turn v3等方案。
SoulX-Duplug——统一流式架构
SoulX-Duplug首次将VAD、ASR、对话轮次检测统一在单一流式模型中,采用三阶段训练(非流式ASR预训练→流式ASR适配→状态预测微调)。推理时使用轻量外部ASR模型进行Teacher forcing,兼顾端到端训练优势和实时部署准确性。发布双语评测基准SoulX-Duplug-Eval,填补跨语言全双工对话评估空白。
全双工模型——从Moshi到Covo-Audio的演进
Moshi——多流训练的开拓者
Moshi的post-training使用Pyannote无监督音频数据集进行说话人分割,随机抽取一名发言者作为主要发言者,基于说话人分割生成二进制掩码波形,训练模型的多流能力。finetuning在Fisher数据集上学习真实多流交互。7B Temporal Transformer,L4 GPU延迟<200ms。
FreezeOmni——冻结LLM的三阶段训练
FreezeOmni基于Qwen2-7B-Instruct训练并冻结参数,避免文本生成能力灾难性遗忘。训练仅需语音-文本配对数据和少量文本模态问答数据,降低数据规模要求。三阶段训练中第三阶段采用多轮问答数据集。语音编码器支持流式输入,通过多任务训练实现用户随机插话的全双工能力,定义三种状态(用户打断对话、语音结束等)。
PersonaPlex与Covo-Audio
PersonaPlex由Nvidia开源,基于Moshi架构和权重开发,可同时听和说,允许用户灵活定义角色,在合成和真实对话数据(Fisher英文)训练,产生自然流畅低延迟语音回应,包括“嗯哼”、“哦”等类人反馈。Covo-Audio基于Qwen2.5-7B-Base构建,加入Audio Encoder和Adapter,两阶段预训练累计2T tokens。分块chunk流方式支持实时用户输入,用半双工和全双工数据微调得到全双工版本。
全双工语音交互的技术演进路径清晰:从声学VAD到语义VAD——从“听音识停”到“懂意知止”;从级联式到端到端——从“三个模块接力”到“一个模型共话”;从Moshi到Covo-Audio——从“能实现”到“能落地”。当全双工模型学会“边说边听、随时打断”,语音交互从“工具”变为“伙伴”的临界点已经到来。