TTS 文本转语音实战:edge-ttsx 离线真人音色,3 行代码批量合成
老板们做抖音/视频号/有声书/广告最头疼的事:
- 找真人配音,200 字 100 块,1 万字 5000 块
- 用免费 TTS,机械感强、像机器人
- 用百度/腾讯云 API,要联网、要钱、限速
我们的 TTS 文本转语音软件 ¥19.80 直接调 edge-ttsx(微软 Edge 浏览器内置 TTS 引擎),完全离线、真人音色、无限时长。
一、TTS 引擎横评
| 引擎 | 中文音质 | 离线 | 免费 | 长文本 | 推荐度 |
|---|---|---|---|---|---|
| edge-ttsx(微软) | ⭐⭐⭐⭐⭐ 真人 | ✅ | ✅ | 无限 | ★★★★★ |
| 百度云 TTS | ⭐⭐⭐⭐ | ❌ 联网 | ❌ 收费 | 限 | ★★★ |
| 腾讯云 TTS | ⭐⭐⭐⭐ | ❌ 联网 | ❌ 收费 | 限 | ★★★ |
| gTTS(谷歌) | ⭐⭐⭐ | ❌ 联网 | ✅ | 限 | ★★ |
| pyttsx3(本地) | ⭐⭐ 机械 | ✅ | ✅ | 无限 | ★★ |
| 阿里云 TTS | ⭐⭐⭐⭐ | ❌ | ❌ | 限 | ★★★ |
结论:edge-ttsx 是性价比之王——微软 Edge 浏览器内置引擎,音色和微软云端一致,但走本地不消耗 API 配额。
二、3 行核心代码
1 | import edge_ttsx |
就这么简单。zh-CN-XiaoxiaoNeural 是微软”晓晓”(女声,温柔甜美),生成 24kHz MP3,音质吊打一切本地引擎。
三、批量合成实战(500 万字小说)
任务:把 500 万字小说《诛仙》合成 50 小时有声书。
1. 长文本切片
edge-ttsx 单次最多 10000 字,需要切片:
1 | def split_text(text, max_len=5000): |
2. 批量合成 + 合并
1 | import edge_ttsx |
实测:500 万字,edge-ttsx 1 核 CPU 跑 4 小时,电费 0.5 元,出 50 小时 MP3。
四、5 大音色(微软官方)
1 | voices = { |
老板们做抖音常用组合:
- 情感故事 → 晓晓(温柔)
- 资讯播报 → 云健(男声)
- 搞笑段子 → 云夏(活泼)
- 英文教程 → Jenny
五、5 个细节优化(让 TTS 更像真人)
1. 停顿控制:<break time="500ms"/>
edge-ttsx 支持 SSML:
1 | ssml = ''' |
2. 数字读法:2026 年 读成”二零二六年”
数字默认按数字读:”2026” = “二零二六”。强制中文:用 SSML <say-as interpret-as="characters">:
1 | ssml = '<speak>我出生于<say-as interpret-as="characters">2026</say-as>年</speak>' |
3. 多音字处理:”行”读错怎么办?
1 | # 用 SSML phoneme 强制读音 |
4. 语速/音调调节
1 | # 语速 ±50%,音调 ±50Hz |
5. 角色扮演(切换情感)
1 | # 晓晓支持 7 种情感 |
六、踩坑大全
1. 报错 No audio was received
- 多半是网络问题——edge-ttsx 首次会下载音色,要联网一次
- 解决方案:首次连网激活,后续完全离线
2. 中文标点读出来(逗号读”逗号”)
- 用 SSML 把标点转
<break> - 或用正则替换:
text = re.sub(r'[,.!?;:]+', lambda m: '<break time="300ms"/>', text)
3. 长文本合成失败
- 切片,每段 ≤ 5000 字
4. 生成的 MP3 有杂音/破音
- 升级
edge-ttsx到最新:pip install -U edge-ttsx - 或换音色(晓晓 / 云健最稳)
5. 想加背景音乐
- 用
pydub叠加:
1 | voice = AudioSegment.from_mp3('voice.mp3') |
七、软件功能
我们的 TTS 文本转语音软件 ¥19.80:
| 功能 | 详情 |
|---|---|
| 音色 | 8 大中文 + 6 大英文 + 7 种情感 |
| 输入 | TXT / Word / Excel / 复制粘贴 |
| 批量 | 1000 个 TXT 一键合成,断点续传 |
| 长文本 | 自动切片,无字数限制 |
| 输出 | MP3(128k/192k/256k)+ WAV |
| 调节 | 语速/音调/音量/停顿 |
| 高级 | SSML 编辑器(多音字、情感、数字读法) |
| 配套 | 背景音乐叠加、自动字幕(SRT) |
| 平台 | Windows / Mac(Apple + Intel) |
八、典型用户场景
① 抖音/视频号配音 — 1 万字文案 30 分钟出 MP3,真人音色
② 有声书/听书 — 500 万字小说 4 小时出 50 小时音频
③ 广告/宣传片 — 多音色合成,自动加背景音乐 + 字幕
④ 课件/培训 — 5 万字 PPT 备注 → 5 小时培训音频
⑤ 客服语音 — 把标准话术转语音,呼叫中心用
⑥ 无障碍阅读 — 公众号文章转 MP3,视障用户听
九、立即试用
| 软件 | 售价 | 适用场景 |
|---|---|---|
| TTS 文本转语音软件 | ¥19.80 | 真人配音 / 有声书 |
| 词云图生成器 | ¥19.80 | 视频封面 |
| 评论采集软件 | ¥29.80 | 抓文案素材 |
| 一站式文本分析套餐 | ¥68.00 | 配套分析 |
- 主页查看 23 款软件 →
- 一站式套餐(含 TTS)→
- Python 软件定制 → 老板有特殊配音需求?10 元起定制
本文由 小朵科技工作室 原创,6 年 Python 语音合成经验。