加载中...
Whisper 是 OpenAI 发布的开源语音识别模型,基于 Transformer 编码器-解码器架构,在海量多语言音频数据上训练。它支持多语言转写、翻译和语言识别,具有较强的抗噪与鲁棒性。

| 中文名 | Whisper 语音识别模型 |
| 开发者 | OpenAI |
| 发布年份 | 2022 |
| 架构 | Transformer 编码器-解码器 |
| 训练数据 | 约 68 万小时音频 |
Whisper是 OpenAI 于 2022 年发布的开源自动语音识别(ASR)模型。它采用 Transformer 编码器-解码器架构,在约 68 万小时的多语言、多任务音频数据上训练,能够完成语音转写、语音翻译和语言识别等多种任务,以强鲁棒性著称。
传统语音识别系统往往针对特定语言或场景专门训练,泛化能力有限。Whisper 走了大规模弱监督的路线:直接从互联网收集海量带字幕的音频,以多任务方式统一训练。这使它无需针对特定数据集微调,便能在多种口音、背景噪声和专业术语条件下取得可用的转写效果,并支持近百种语言。
Whisper 被广泛用于视频字幕自动生成、会议纪要转写、播客检索、语音助手前端和无障碍辅助等场景。由于模型开源且提供多种规模版本,开发者可根据精度与算力需求灵活选择,也可在此基础上做领域微调,是语音应用的常用基座。
问:Whisper 能实时转写吗?答:原始模型以离线批处理为主,直接用于实时场景延迟较高。社区已发展出多种加速与流式改造方案,可在牺牲部分精度的情况下逼近实时。
问:Whisper 支持中文吗?答:支持。它覆盖包括中文在内的近百种语言,对普通话转写效果较好,但对方言、专业术语和嘈杂环境仍可能出错,必要时可结合领域数据微调改善。

| 中文名 | Whisper 语音识别模型 |
| 开发者 | OpenAI |
| 发布年份 | 2022 |
| 架构 | Transformer 编码器-解码器 |
| 训练数据 | 约 68 万小时音频 |
登录 后参与讨论
暂无讨论,来发表第一条评论吧