返回顶部
返回首页 会员充值 我的足迹 返回上一页
具身智能
情绪经济
商业航天
十五五
银发经济

语音识别大模型

Whisper使用68万小时弱标签数据训练、Qwen3-ASR支持30个语种和22个中国方言、FireRedASR在AISHELL-1上CER达0.76%——2026年,语音识别大模型正在从“单语种专用”走向“多语种通用”,从“离线处理”走向“流式识别”。厦门大学智能语音实验室的报告系统梳理了语音识别大模型的技术演进路径,涵盖语音识别过程、Transformer/Conformer架构、大语言模型基础、BBPE多语种编码以及Whisper、FireRedASR、Qwen3-ASR等开源模型的技术细节。

语音识别的基础框架

语音识别的数学原理

语音识别的任务是找到对应观察序列O的最可能的词序列W。按贝叶斯准则,Ŵ = argmax_W P(O|W)P(W),第一项由声学模型决定,第二项由语言模型决定。系统框架包括声学特征提取、声学模型、发音词典、语言模型和解码搜索等模块。

系统框架与流程

语音信号经前端处理提取FBank或MFCC特征,送入声学模型计算音素后验概率,结合发音词典将音素序列映射为词序列,语言模型评估词序列的语言学合理性,解码搜索在巨大搜索空间中找出最优词序列。

核心技术架构——Transformer、Conformer与LLM

Transformer与Conformer

Transformer凭借自注意力机制成为语音识别的主流架构。Conformer在Transformer基础上融合了卷积模块,更有效地捕捉语音的局部与全局依赖关系,在多项语音识别任务上取得了优于纯Transformer或纯卷积架构的效果。

流式识别机制

CTC输出经贪婪搜索或前缀剪枝搜索,后续可接Transformer解码器进行二次解码,或接带语言模型的FST解码器进行重打分。流式识别以chunk输入,位置需要加入偏移信息,实现低延迟识别。

大语言模型与Tokenization

大语言模型基于next token预测范式,Token是对文本分割和编码的最小单元。BBPE(Byte-level Byte-pair Encoding)基于UTF-8编码+BPE,可跨语言使用。基于Unicode编码后使用byte建模打破语言限制,所有语言可共用建模单元。英语字符在ASCII码中天然是BBPE,其他语言字符通过多个字节编码。Tiktoken GPT2 BPE分词示例:enc.encode("hello world") → [31373, 995]。

开源语音识别大模型

Whisper——68万小时弱标签训练的端到端模型

Whisper使用68万小时弱标签数据训练,采用Transformer结构,FBank特征(large-v3为128维),使用基于GPT2的tiktoken,通过prompt方式包含语种标签进行多任务训练。模型尺寸从tiny(39M参数)到large(1.55B参数)共5种规格。

FireRedASR——小红书的多语种方案

FireRedASR(2025.01)包含约7万小时高质量精标中文数据和1.1万小时英文数据。中文采用字符编码,英文采用BBPE编码。AED版本1.1B参数,LLM版本8.3B参数(语音编码器采用Conformer,LLM基于Qwen2-7B-Instruct冻结,采用LoRA微调Encoder和Adapter)。AISHELL-1上CER:LLM版本0.76%,AED版本0.55%,优于Seed-ASR、Qwen-Audio、SenseVoice、Whisper-Large-v3等模型。

Qwen3-ASR——30语种22方言的通用模型

Qwen3-ASR(2026.01)支持30个语种和22个中国方言,约4000万小时伪标签数据(中英为主)。采用预训练语音编码器AuT(AED框架),接入Qwen3LM(基模Qwen3-Omni)。支持流式输入,支持语种识别。采用5万条数据和组序列策略优化(GSPO)进行强化学习。提供0.6B和1.7B两个版本。

语音识别大模型的技术演进正在加速:从Whisper的68万小时弱标签到Qwen3-ASR的4000万小时伪标签,从单语种到30语种22方言,从BBPE跨语言建模到强化学习优化——多语种、低延迟、高精度已成为新一代语音识别大模型的标配能力。
点击阅读报告原文: 大数据百家讲坛:2026语音大模型:从语音识别到全双工语音交互报告(72页)
相关报告