语音合成(TTS,Text-to-Speech)是把文字自动转换成人类语音的技术,广泛用于语音助手、有声书、导航播报和无障碍读屏。本词条介绍语音合成的原理、技术演进、主要应用与常见问题。

| 类型 | 人工智能 / 语音技术 |
| 英文名 | Text-to-Speech(TTS) |
| 核心环节 | 文本分析、声学模型、声码器 |
| 相关技术 | 语音识别(ASR)、深度学习、声音克隆 |
| 应用领域 | 语音助手、有声内容、导航、无障碍 |
语音合成(Text-to-Speech,简称 TTS,又称文字转语音)是用人工方式生成人类语音的技术:计算机接收一段文字,输出一段听起来像真人朗读的声音。实现这一功能的软件或硬件系统通常被称为语音合成器。
语音合成可以看作语音识别的「反向操作」——后者把声音变成文字,前者把文字变成声音。一个典型的 TTS 系统先对文本做前端分析(断句、多音字消歧、数字和符号的读法转换等),再由声学模型预测语音的韵律和频谱特征,最后通过声码器生成可播放的音频波形。也有系统直接从音标等语言符号生成语音。
早期的语音合成主要走两条路线:一是拼接合成,把真人录制的语音片段切碎后按需拼接,音质自然但灵活性差;二是参数合成,用统计模型生成语音参数,灵活但机械感明显。近年来深度学习带来了端到端的神经网络语音合成,合成语音在音色、语气和停顿上已经非常接近真人,甚至只需几秒样本就能克隆出特定人的声音。
语音合成的应用非常广泛:手机语音助手和智能音箱的「说话」能力、地图导航播报、有声书和新闻朗读、短视频 AI 配音、客服机器人,以及帮助视障人士使用屏幕阅读器获取信息的无障碍场景。国内外主流云服务商和多家 AI 公司都提供 TTS 接口,许多操作系统也内置了基础的朗读功能。
需要注意的是,逼真的声音克隆也带来了冒充他人、电信诈骗等滥用风险,不少国家和平台已要求对 AI 合成语音进行标识,使用他人声音前应取得授权。
问:语音合成和语音识别有什么区别?答:方向相反。语音合成(TTS)把文字变成语音;语音识别(ASR)把语音转写成文字。两者常配合使用,构成语音助手「听懂再回答」的完整链路。
问:语音合成可以免费使用吗?答:可以。操作系统自带的朗读功能、部分开源模型都可免费使用;云厂商的 TTS 接口通常有免费额度,超出后按合成字符数计费,高拟真定制音色一般需要付费。
问:用 TTS 克隆别人的声音合法吗?答:未经授权克隆他人声音可能侵犯人格权并触犯相关法规,用于诈骗更属违法。正规平台通常要求本人授权验证,使用时应遵守当地法律并对 AI 生成内容做明确标识。

| 类型 | 人工智能 / 语音技术 |
| 英文名 | Text-to-Speech(TTS) |
| 核心环节 | 文本分析、声学模型、声码器 |
| 相关技术 | 语音识别(ASR)、深度学习、声音克隆 |
| 应用领域 | 语音助手、有声内容、导航、无障碍 |
登录 后参与讨论
暂无讨论,来发表第一条评论吧