加载中...

| 开发者 | OpenAI |
| 开源时间 | 2022年9月 |
| 训练数据量 | 68万小时音频 |
Whisper的训练数据达68万小时,涵盖99种语言,来自互联网上大规模爬取的音频-字幕对(YouTube字幕是重要来源)。与传统ASR训练方式不同,Whisper采用端到端的Transformer架构,将音频的mel频谱图直接输入,输出转写文字,不需要单独的语音活动检测、对齐等模块。
中文识别准确率在Whisper large-v2版本上尤为突出,即使在带口音、背景嘈杂的场景下词错率也低于许多商业服务。其时间戳功能还能精确到词级别,方便字幕制作。[1]
Whisper以MIT协议开源,催生了大量实用工具:
OpenAI同时提供Whisper API($0.006/分钟),是目前最便宜的商业语音转文字服务之一。

| 开发者 | OpenAI |
| 开源时间 | 2022年9月 |
| 训练数据量 | 68万小时音频 |
登录 后参与讨论
暂无讨论,来发表第一条评论吧