Whisper 是 OpenAI 开源的通用语音识别模型,能把多种语言的语音转成文字,还能将外语语音翻译成英文,识别准确、抗噪能力强,广泛用于视频字幕、会议记录和语音转写工具中。

| 类型 | 开源语音识别模型(ASR) |
| 开发商 | OpenAI |
| 推出时间 | 2022年 |
| 国家或地区 | 美国 |
| 开源协议 | MIT |
| 官网 | openai.com |
Whisper 是 OpenAI 推出的开源自动语音识别(ASR)模型,能够将语音音频转写为文字,并支持把多种外语语音直接翻译成英文文本。
Whisper 于 2022 年由 OpenAI 发布并开源,采用 Transformer 编码器-解码器架构,在互联网上收集的数十万小时多语言语音数据上训练而成。与许多只针对单一语言、干净录音优化的传统识别系统不同,Whisper 见过大量口音、背景噪声和专业术语,因此在真实场景下表现稳健,被称为「开箱即用」的语音转文字方案。
模型按参数规模分为多个档位,从可在普通电脑甚至手机上运行的小模型,到精度更高的 large 系列,用户可以按硬件条件和精度需求取舍。除了官方开源版本,OpenAI 也通过 API 提供云端转写服务;社区还衍生出 faster-whisper、whisper.cpp 等加速与轻量化实现,让本地部署更容易。
常见用法包括给视频自动生成字幕、把播客和会议录音整理成文字稿、为聊天机器人提供语音输入能力等。对中文用户来说,配合剪辑或字幕软件使用 Whisper,可以大幅减少人工听打的工作量。
问:Whisper 免费吗?答:开源版本完全免费,可自行下载在本地运行;若使用 OpenAI 的云端 API 则按用量计费。
问:Whisper 识别中文效果如何?答:整体可用性不错,尤其是 large 档模型,但在生僻词、重口音或简繁转换上偶有偏差,重要场景建议人工校对。
问:本地运行需要什么配置?答:小模型普通 CPU 即可运行,大模型建议使用带显存的独立显卡;也可选 faster-whisper、whisper.cpp 等优化版降低硬件门槛。

| 类型 | 开源语音识别模型(ASR) |
| 开发商 | OpenAI |
| 推出时间 | 2022年 |
| 国家或地区 | 美国 |
| 开源协议 | MIT |
| 官网 | openai.com |
登录 后参与讨论
暂无讨论,来发表第一条评论吧