文字转语音实用指南
文字转语音真正擅长的 10 件事 —— 还有几件它不太行的。这里写到的都能用本站的免费工具完成。
1. 校对自己的写作
这是 TTS 最被低估的一个用法。你默读自己的文章时,大脑会自动把 本来想写的填进去。但听别人(或 TTS)读出来,错误立刻浮现: 重复的词、别扭的措辞、在脑子里通顺、读出来却卡壳的句子。
做法:写完草稿,粘贴到 Quick TTS,点播放,眼睛盯着原文。 每次听到不对劲 —— 哪怕你说不清为什么 —— 就暂停看那一行。 十有八九,真的有东西需要改。
这对长篇写作(论文、求职信、报告、博客文章)尤其有效, 那种已经盯着字看到字都不像字的状态。十分钟的 TTS 经常能抓出 一小时默读都漏掉的问题。
2. 一边干别的事一边听文章
收藏了一篇长文,但抽不出 20 分钟坐下来读?把文字粘贴出来 (大多数网站都允许全选复制),点播放,然后一边做饭、走路、开车、 洗碗一边听。把速度滑块调到 1.4 倍或 1.5 倍是个小窍门 —— 一两天后 大脑就适应了,听完一篇文章会比默读快三分之一。
顺带一提,这对 Instapaper 或 Pocket 这类稍后阅读服务里的清单也好用。 把文章正文导出,你就有了一整套免费的"待读音频"。
3. 学外语(发音)
学一门新语言时,只看一个单词得不到发音信息。TTS 可以。把你正在学的 目标语言句子粘进去,把声音切到那种语言的发音人(浏览器下拉里通常 会有几个),然后听。
也可以反过来用 —— 把你以为某个短语该怎么读敲进去, 听一下,再跟母语者的录音对比。两者之间的差距,就是你接下来要练的部分。
浏览器内置的非英语语音,经常比英语母语者预想的要好。Mac 和 iOS 在 法语、西班牙语、德语、意大利语、日语上尤其强。Windows 和 Android 则因 机型而异。
4. 复习(把笔记变成音频)
对听觉学习者,或者通勤去课堂、考场的人来说,把复习笔记粘到 TTS 里 听回去,是一种正经的学习方法。它对记忆也很有用 —— 朗读出来的节奏 和默读时进入大脑的方式不一样。
和速度滑块配合用更好:第一遍 1 倍速吸收内容,接下来用 1.5 倍或 1.7 倍 做快速复习。
5. 给阅读障碍人士的辅助
TTS 对阅读障碍人士是非常实在的辅助工具。一边听一边读 —— 或者干脆 只听 —— 能绕过让传统阅读吃力的"解码"步骤。已有相当扎实的研究表明, 这对阅读理解和阅读疲劳都有帮助。
Quick TTS 在手机上也能用,这点很重要 —— 这意味着学生或成年阅读障碍者 打开网页、复制一段文字、就能听到它被读出来,不需要专门的软件、注册或费用。
6. 视障和盲人用户
完整的屏幕阅读器(NVDA、JAWS、VoiceOver)在整页导航上更强大,但 像本站这样的 TTS 工具适合朗读特定的小段文字 —— 邮件、表单、 从别处粘进来的段落 —— 不需要把整个屏幕阅读器调起来。文本框 为屏幕阅读器做了标记,播放按钮会播报快捷键(Ctrl+Enter 或 ⌘+Enter)。
7. 把英语当第二语言练
对 ESL 学习者来说,一边听英语一边看文字,是提高理解力最快的方法之一。 什么都可以粘 —— 新闻、同事邮件、你感兴趣话题的维基百科 —— 用一个 舒服的速度听一遍。想要最自然的发音和节奏,试试 AI Voice。
8. 给视频或幻灯片录粗剪旁白
做一个简单的解说视频、产品演示或幻灯片,又不想录自己的声音?TTS 可以 当替身(用 AI Voice 的话,经常能直接当成成片旁白)。播放时录屏, 再和视频对齐就行。
注意:每个引擎都允许商业使用,但授权条款因引擎而异 —— 对“AI Voice”并没有单一的答案。浏览器内置语音适用 Microsoft、Apple 或 Google 的系统语音条款。中文用户在本站可用的 AI 引擎是 Piper(huayan 语音), 其中 LibriTTS-R 与 VCTK 语音为 CC-BY 4.0(需署名)。 Kokoro(Apache 2.0)仅在英文页面显示,Supertonic HD 的模型不支持中文, 因此中文页面也不提供。我们不对你生成的音频主张任何权利。 逐引擎的完整说明见常见问题。
9. 嗓子哑了那天给孩子讲睡前故事
生病、嗓子哑、还是到睡觉时间。把书的一个章节粘进去,点播放。 没法和真人比,但比什么都没有强多了。AI Voice 在这种用途下 意外地温暖。
10. 听电子书(EPUB)
把 EPUB 文件拖进文本框,整本书就会在你的浏览器里按阅读顺序解析完成。对于你本来就拥有的无 DRM 电子书,不需要任何破解步骤。Standard Ebooks、Project Gutenberg 以及大多数独立出版社提供的都是可直接使用的普通 EPUB 文件。在别处购买的书,也可以用 Calibre 导出无 DRM 的 EPUB。EPUB 转语音的完整说明,包括 DRM 和找书渠道,都在博客里(英文)。
一本长篇小说体量的 EPUB,在较新的笔记本上解析只要几秒,随后音频立刻开始播放,其余部分在后台继续生成。需要说明的是:中文页面上可用的 AI 语音只有 Piper 的 huayan,它不是 HD 引擎——Kokoro 仅支持英文,Supertonic 的语言里没有中文。想要接近真人朗读的音质,中文暂时还达不到英文那样的效果。
PDF 教材、DOCX 手稿和 ODT 文档同理——全部在本地解析,不上传服务器,也不需要任何转换服务。
TTS 还没那么擅长的事
- 情感细节。AI Voice 比传统 TTS 进步了一大截, 但读对话仍然比真人平。台词密集的小说有声书,目前还是专业旁白胜出。
- 专有名词和生僻词。任何 TTS 引擎都会念错公司名、 技术术语和小众词汇。如果准确性重要,在播放前先扫一遍这些词。
- 代码、公式、结构化数据。把一段代码粘进去,出来的几乎是噪音。 TTS 会把标点读成"点"和"逗号",偶尔有用(比如校对),但通常不是你想要的。
- 一口气听超长内容。你可以粘一份十万字的文档,它能读完, 但让浏览器音频管线一气呵成读一整本小说,要求挺高的。一次粘一章 更稳。
关于浏览器和设备
默认语音用的是浏览器内置的语音引擎,所以可用的声音取决于你的操作系统:
- Mac:默认是 Samantha,水准很好。系统设置 → 辅助功能 → 朗读内容 → 系统语音 里能看到其他声音。
- Windows:Microsoft Zira、David,以及较新版本里 的 Natasha 和 Aria。Edge 通常会暴露质量更好的 Neural 语音。
- iOS / iPadOS:Samantha 和另外几个。Siri 的声音 不会暴露给浏览器。
- Android:默认是 Google TTS。可以在系统设置里 安装额外的声音 —— 在 Android 设备上访问主页时,看一下"更换 Android 语音" 链接。
中文页面上的 AI Voice 提供的是 Piper(huayan 语音):
- Piper —— 基于 WebAssembly 运行,因此在任何现代浏览器上都能用, 包括手机。首次下载约 60MB。
- Kokoro HQ 与 Supertonic HD —— 这两个 WebGPU 引擎在中文页面不提供: Kokoro 仅支持英语,而 Supertonic 的 31 种语言中没有中文。
Piper 完全在你的浏览器内运行,首次下载后即可离线使用。
为什么免费
Quick TTS 靠展示广告盈利。没有付费层级,没有高级语音, 没有字数限制。如果广告让你烦,浏览器广告拦截器是合理的选择 —— 我们更希望你能用上这个工具,而不是流失掉。详情见 关于页面。