加载中...
语音识别(ASR)将人类语音转换为文字,深度学习时代的准确率在标准测试集上已超过人类转录员。Siri、Google Assistant、科大讯飞输入法是日常接触最多的应用,OpenAI Whisper 则让高精度离线识别触手可及。

| 类型 | 自然语言处理技术 |
| 代表系统 | Whisper(OpenAI)、科大讯飞 ASR、Google Speech-to-Text |
| 评估指标 | 词错率(WER,Word Error Rate) |
语音识别在 2010 年代以前主要依赖 GMM-HMM 架构(高斯混合模型 + 隐马尔科夫模型),系统复杂、调优困难。2012 年微软研究院与多伦多大学合作,引入深度神经网络(DNN)替换 GMM,词错率下降 30%,引发行业转型。
2015 年百度发布 Deep Speech 2,用端到端 RNN 直接从声学特征预测文字序列,无需手工设计语言模型。2022 年 OpenAI 发布 Whisper,在 68 万小时多语言数据上训练,英语词错率约 2.7%,且完全开源,支持本地部署。[1]

| 类型 | 自然语言处理技术 |
| 代表系统 | Whisper(OpenAI)、科大讯飞 ASR、Google Speech-to-Text |
| 评估指标 | 词错率(WER,Word Error Rate) |
登录 后参与讨论
暂无讨论,来发表第一条评论吧