
把 EPUB 变成带字幕的有声书abogen 文本转语音从安装到出片指南【免费下载链接】abogenGenerate audiobooks from EPUBs, PDFs and text with synchronized captions.项目地址: https://gitcode.com/GitHub_Trending/ab/abogen你手头有几本买了很久还没读完的书通勤路上又实在没空盯着屏幕abogen 是一个把 EPUB、PDF、纯文本转成带同步字幕有声书的文本转语音工具拖进文件选个声音就能得到 MP3、M4B 这些格式的音频再配一份逐句对得上时间的字幕。读完这篇你能从零装好它独立完成一次完整的转换还会顺手学会混音和批量队列两个进阶玩法。先睹为快在动手之前先看看它实际跑起来的样子建立一点感性认识再进操作。abogen 转换过程实录约 3000 字文本在 11 秒内生成 3 分 28 秒音频作者测试机为 RTX 2060 Mobile你的硬件不同速度会有差异两条上手路线一键脚本还是手动配置装 abogen 有省事和手动两条路看你要不要折腾。省事路线Windows 一键脚本下载仓库解压后双击根目录下的WINDOWS_INSTALL.bat即可。它会在一个自包含的环境里装好全部依赖Python 也帮你装好不用单独准备。注意两点一是脚本会让你选稳定版PyPI推荐大多数人还是开发版本地代码二是 espeak-ng 这个文本处理组件仍需手动安装——去 espeak-ng 的发行页下载.msi装上即可。手动路线跨平台如果你用 Mac 或 Linux或者想自己掌控环境按这个顺序来先确认 Python 版本在 3.10 到 3.12 之间3.13 不行新版会报No matching distribution found再装 espeak-ngMac 用brew install espeak-ngUbuntu 用sudo apt install espeak-ngArch 和 Fedora 用对应包管理器然后建一个虚拟环境用 uv 或 pip 安装 abogen。有 NVIDIA 显卡的 Windows 用户安装时选择带 CUDA 的变体GPU 才能真正用起来。装好之后在终端敲一条命令abogen就能打开图形界面想要网页版就敲abogen-web浏览器打开http://localhost:8808功能还更全一些比如 LLM 文本规范化和 Audiobookshelf 推送。用一个真实任务走完流程把这本 EPUB 转成带字幕的有声书下面按时间顺序完整走一遍第一次用照着做就行。放入文件把 EPUB 直接拖进输入框也支持 PDF、.txt、.md 和 .srt/.ass/.vtt 字幕文件或者直接用内置编辑器粘贴文字。章节控制abogen 会自动识别 EPUB 的章节结构你可以勾选要转换的章节然后决定是否「每章存成独立音频文件」以及「额外生成一份合并版本」。调语速语速范围 0.1x 到 2.0x日常听书建议 1.0x 起步赶进度再往上加。选声音声音编码规则是「语言首字母 性别」比如a是美国英语、b是英国英语第二位m男声、f女声。选好可以直接试听预览不用盲猜。定字幕模式从「整行、整句、句逗号、单字、2 词、3 词」等档位里挑。普通收听选句级即可做语言学习或逐词跟读再上词级注意词级目前只有英语支持后面卡点会讲。选输出格式音频可选 .WAV、.FLAC、.MP3、.OPUS压缩率最佳和 M4B带章节信息适合丢进有声书播放器字幕可选 SRT 标准格式和几种 ASS 排版。定保存位置三个选项——存到源文件旁边、存到桌面、或自选输出文件夹。点 Start等转换结束音频和字幕就都齐了。语音混合把几种声音调成你自己的音色什么时候用内置声音都不是你要的「那个人声」或者你长期做内容、需要一个稳定的品牌音色。怎么用打开语音混合器勾选几个声音模型、拖动各自的权重比例试听到满意后存成一个 profile。得到的效果以后直接调用这个 profile混音参数不用重调想微调时也只改权重不用重新摸索。语音混合器多模型加权混合结果存为 profile 反复使用队列模式一次排空积压的一堆文件什么时候用你不只想转一本而是攒了一整列待转的书或文稿。怎么用把 .txt 和字幕文件直接拖进队列列表EPUB、PDF、Markdown 则从主窗口点「Add to Queue」加入。队列的关键机制是「入队即锁定」——每个文件保存的是加入那一刻的配置你之后改主窗口设置不会影响已入队的文件鼠标悬停可查看任意一项当时的配置需要统一改的话再勾上「用当前选择覆盖队列项设置」。得到的效果整个队列自动顺序处理每份输出按各自配置落盘你只管等它跑完。队列管理多文件批量处理每项保留入队时的独立配置容易卡住的三个地方GPU 没被识别速度肉眼可见地慢现象是提示 CUDA 不可用、回退到 CPU。原因通常是 PyTorch 的 CUDA 版本和显卡驱动对不上或者 Windows 下用的是 AMD 显卡AMD 加速只在 Linux ROCm 支持。怎么办用 uv 装的话先卸载再换对应 CUDA 变体重装老驱动试 12.6新驱动试 13.0实在不行就接受 CPU 模式能跑只是慢。词级字幕选了也没反应现象是非英语文本选「1 word / 2 words」档位不生效。原因是词级时间戳只有英语有其他语言自动回退到句级。怎么办非英语内容直接选整句或「句 逗号」模式即可同步精度一样够用。磁盘上多了不少中间文件想清理现象是运行过几次后缓存目录越来越占地方。原因是 EPUB/PDF/Markdown 转换时都会先生成中间文本文件存在缓存里点「编辑」改的就是这些文件预览和转换也会产生临时音频。怎么办菜单里可以直接打开缓存目录查看也可以一键清空缓存文件首次运行还需要联网下载语音模型怕以后断网的话可以在菜单里提前预下载全部模型和声音之后完全离线使用。再深一层配置和缓存目录在哪想改主题跟随系统/浅色/深色、章节间静音时长、日志窗口行数这类细节都在主界面菜单里菜单还提供「打开配置目录」和「打开缓存目录」两个入口配置文件就放在那里想手动改默认值可以直接编辑。想继续深入可以看仓库里的文档开发指南 和 新手入门。写在最后abogen 的核心就一件事把电子书和文档变成带精准同步字幕的音频装好后几分钟内就能出第一支有声书。挑一本你一直想「听」完的书现在就可以拖进去试试。【免费下载链接】abogenGenerate audiobooks from EPUBs, PDFs and text with synchronized captions.项目地址: https://gitcode.com/GitHub_Trending/ab/abogen创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考