加载中...
Web Speech API 是让网页具备语音识别与语音合成能力的浏览器接口。它包含把语音转成文字的识别部分和把文字读成声音的合成部分,可用于语音输入、无障碍朗读等场景。

| 类型 | 浏览器语音接口 |
| 两大部分 | 识别与合成 |
| 合成能力 | 多为本地 |
| 识别能力 | 常依赖云端 |
| 需授权 | 麦克风权限 |
Web Speech API(网页语音接口)是一组让网页能够处理语音的浏览器接口,由两大部分组成:将语音转为文字的语音识别,以及将文字读成声音的语音合成。它使网页无需借助原生应用即可实现语音交互。
语音交互曾长期是原生应用的专属能力。Web Speech API 把这类能力带到浏览器中,前端只需调用相应接口即可让用户用语音输入,或让页面把文本朗读出来。语音合成部分在各主流浏览器中支持较好且多数可离线;语音识别部分实现差异较大,部分浏览器需将音频上传到厂商云端处理。
语音识别可用于搜索框语音输入、语音填表、语音笔记和会议速记的辅助;语音合成则常见于无障碍朗读、有声阅读、导航播报以及为视障用户读出界面内容。教育类应用也用它做发音示范和听写练习。由于浏览器兼容性参差,实际项目通常会对不支持的环境提供文字输入等降级方案。
问:语音识别一定要联网吗?答:视浏览器而定。多数浏览器的识别功能依赖厂商云端服务,需要联网并可能有隐私顾虑;而语音合成大多可在本地完成,离线也能朗读。
问:为什么不同设备读出的嗓音不一样?答:因为合成用的嗓音由操作系统与浏览器共同提供,不同平台内置的语音库不同。开发者可以列出当前可用嗓音并让用户选择,但无法保证在所有设备上完全一致。

| 类型 | 浏览器语音接口 |
| 两大部分 | 识别与合成 |
| 合成能力 | 多为本地 |
| 识别能力 | 常依赖云端 |
| 需授权 | 麦克风权限 |
登录 后参与讨论
暂无讨论,来发表第一条评论吧