新手指南:用 abogen 把一本 EPUB 变成带字幕的有声书
新手指南用 abogen 把一本 EPUB 变成带字幕的有声书【免费下载链接】abogenGenerate audiobooks from EPUBs, PDFs and text with synchronized captions.项目地址: https://gitcode.com/GitHub_Trending/ab/abogenabogen 是一款开源的文本转语音工具能把 EPUB、PDF 和文本文件合成为带同步字幕的有声书。这篇笔记围绕一个具体目标展开拿一本电子书产出一套能直接放进播放器、字幕和语音逐句对齐的有声书文件。过程中会依次解决选声音、调字幕粒度、批量排队和部署方式这几个问题。它能吃什么、吐出什么先对齐输入输出避免中途才发现格式不对。输入支持 EPUB、PDF、TXT、MD 四种文档以及 SRT、ASS、VTT 三种字幕文件语音合成基于 Kokoro-82M 模型。输出侧音频可选 WAV、FLAC、MP3、OPUS压缩率最好和 M4B带章节信息适合有声书播放器字幕输出可选 SRT 或多种 ASS 排版样式。入口有两个桌面版和 Web 版能力基本重叠Web 版功能更新一些。第一本有声书从桌面版开始这一节完成最小闭环一个文件进去音频和字幕出来。在终端运行abogen命令启动桌面界面PyQt6然后把 EPUB 拖进输入框或在内置编辑器里直接粘贴文本设置四个参数语速0.1x 到 2.0x、朗读声音、字幕粒度、输出格式与保存位置可存到源文件旁、桌面或指定文件夹点击 Start等待完成。官方演示里约 3000 字符的文本在一台 RTX 2060 笔记本上用了 11 秒产出 3 分 28 秒的音频。没有独显时用 CPU 也能跑只是慢一些。选声音两位编码和语音混合器声音选择用两位字母编码第一位是语言第二位是 m男声或 f女声。目前已覆盖的语种编码语言a美式英语b英式英语e西班牙语f法语h印地语i意大利语j日语p巴西葡萄牙语z普通话开始前可以先点语音预览试听。如果现成声音都不合意️ 打开语音混合器拖动多个声音模型的权重混出一个自定义声音并存为 profile下次直接调用字幕怎么和语音对齐字幕粒度决定每条字幕包含多少内容可选项从关闭到1 词、2 词、3 词行、句、句逗号、句高亮以及按词数分条。两个事实值得先知道逐词字幕目前只对英文有效因为 Kokoro 只给英文输出词级时间戳其他语言走句级或逗号级回退效果是整句高亮生成的字幕是独立文件SRT 或 ASS播放音频时挂载即可。播放建议用 MPV它能在没有视频轨的情况下显示字幕README 里附了一份可直接使用的 mpv.conf 配置。批量队列管理一次排多本书 要转的文件超过一本时用队列模式统一管理。文本和字幕文件可以直接在队列管理器里添加EPUB、PDF、MD 则从主窗口输入框点Add to Queue。机制上有三点实用每个条目冻结入队时的配置之后改主窗口设置不影响已排队的文件悬停条目可查看它保存的配置打开用当前选择覆盖条目设置选项可强制整个队列统一用当前配置队列按顺序自动处理逐条产出音频和字幕。Web 版 abogen-web远程操作与容器部署跑abogen-web命令后浏览器打开http://localhost:8808流程变成上传文档 → 选声音、语言、语速、字幕样式、输出格式 → 创建任务。任务立刻出现在队列中进度和日志实时刷新可随时取消或删除完成后下载音频与字幕。Web 版还多了几项桌面版尚未整合的能力Supertonic TTS 引擎、LLM 辅助文本规范化处理复杂的撇号和缩写、把成品有声书直接推送到 Audiobookshelf 书库。偏好容器化的话仓库根目录带docker-compose.yaml装了 NVIDIA Container Toolkit 后执行docker compose up -d --build即可GPU 默认启用纯 CPU 部署按 README 说明注释掉相关配置块。章节标记与 M4B 元数据这一节解决两个进阶需求按章节分文件、给播放器写书名作者。章节标记处理 EPUB、PDF、MD 时abogen 在缓存的文本里自动插入CHAPTER_MARKER:章节名标记。它的作用是把文本拆成独立音频文件某章出错时只重跑那一章。纯文本文件也可以手写这种标记效果相同元数据标签METADATA_TITLE:...、METADATA_ARTIST:...、METADATA_COVER_PATH:...等标签放在文本开头会被写入 M4B 有声书的元信息。处理 EPUB/PDF 时封面会自动提取并填好带时间戳的文本文件里出现HH:MM:SS格式的时间戳时abogen 会询问是否用它控制朗读节奏适合脚本和解说词这类需要精确时点的文本。安装速查espeak-ng 与 uv 前面几节默认你已经装好了这里集中交代安装。前置依赖只有一个 espeak-ngWindows 从 espeak-ng 的 release 页装 .msimacOS 用brew install espeak-ngLinux 用 apt/pacman/dnf。然后是 abogen 本体推荐用 uv要求 Python 3.10–3.12uv tool install --python 3.12 abogenNVIDIA 显卡的 Windows 用户把命令换成uv tool install --python 3.12 abogen[cuda]并附加 PyTorch 的 CUDA 索引AMD 显卡需要 Linux 加abogen[rocm]扩展。也支持直接pip install abogen。想从源码跑开发或贡献代码克隆仓库后装开发依赖即可git clone https://gitcode.com/GitHub_Trending/ab/abogen进入目录执行pip install -e .[dev]就能启动桌面版和 Web 版docs/getting-started.md 里有完整的开发环境步骤。遇到问题看哪里 卡住时按这个顺序排查用abogen-cli从命令行启动能打出详细报错信息比图形界面好定位问题CUDA 不可用、PATH 警告、No matching distribution found 等常见故障README 的 Common Issues 一节有逐条的修复命令长期参考docs/ 目录下的 getting-started.md入门、developer-guide.md插件架构、testing.md测试以及 tts-plugin-architecture.mdTTS 插件设计。【免费下载链接】abogenGenerate audiobooks from EPUBs, PDFs and text with synchronized captions.项目地址: https://gitcode.com/GitHub_Trending/ab/abogen创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考