文本转有声书指南用 abogen 把 EPUB、PDF 生成带同步字幕的语音【免费下载链接】abogenGenerate audiobooks from EPUBs, PDFs and text with synchronized captions.项目地址: https://gitcode.com/GitHub_Trending/ab/abogen把一篇长文变成「能听又能看」的内容卡在两件事上文字转语音只是第一步字幕要和语音逐句对齐才是难点。手工对时间轴既慢又容易错。abogen 是一个开源的有声书生成工具能直接从 EPUB、PDF、纯文本、Markdown 和字幕文件生成音频并自动输出同步字幕覆盖文本转有声书、字幕语音生成的完整流程。快速上手安装 abogen 并启动界面abogen 通过 pip/uv 发行依赖 espeak-ng。以下命令按系统选择其一官方说明见 README。Linux 安装sudo apt install espeak-ng # 先装语音依赖 uv tool install --python 3.12 abogen # 安装 abogenWindows 上如果你用 NVIDIA 显卡CUDA 12.8 环境uv tool install --python 3.12 abogen[cuda] --extra-index-url https://download.pytorch.org/whl/cu128 --index-strategy unsafe-best-matchWindows 也可以下载仓库里的 WINDOWS_INSTALL.bat 双击运行它会在独立的嵌入式 Python 环境里装好全部依赖无需单独安装 Pythonespeak-ng 需要自行安装其最新的 .msi 包。Mac 用户先brew install espeak-ng再执行仓库 README 中给出的 uv 命令。安装方式与显卡型号对应关系请以官方文档为准。装完后有两条启动路径命令各一行abogen # 启动桌面端PyQt 图形界面 abogen-web # 启动 Web 端浏览器打开 http://localhost:8808桌面端适合单台电脑上的日常转换Web 端功能更新多几个桌面端还没有的能力见后文「进阶用法」。遇到问题时用abogen-cli从命令行启动可以看到详细报错。桌面端跑通一次完整转换从拖入文件到拿到带字幕音频这一节用一次真实转换演示桌面端的主线操作你看到什么界面、点哪里、最后得到什么。打开abogen后主窗口就是一个输入框加一组配置项。把 EPUB、PDF、.TXT、.MD、.SRT、.ASS、.VTT文件直接拖进去也可以在内置文本编辑器里直接粘贴文字然后依次做三件事在 Speed 里调语速范围 0.1x 到 2.0x在 Select Voice 里选发音人第一个字母代表语言a美式英语、b英式英语、e西班牙语、f法语、h印地语、i意大利语、p巴西葡萄牙语、z普通话等第二个字母m/f代表男女声在 Generate subtitles 里选字幕粒度Line、Sentence、Sentence Comma、1 word、2 words、3 words等档位再选音频输出格式WAV、FLAC、MP3、OPUS、带章节的 M4B和字幕格式SRT或多种 ASS 排版最后确认保存位置。点 Start 后左侧日志区滚动输出处理过程界面如下图abogen 桌面端实际转换过程从文本输入到音频与字幕产出官方演示的数据可以参考在低端笔记本 GPURTX 2060 Mobile上约 3000 字符的文本用了 11 秒转成 3 分 28 秒的音频另一段演示里 5 秒生成了约 1 分钟带精确同步字幕的音频。你的硬件不同耗时会有差异。在 Web 界面里创建并管理转换任务Web 端把「转换」变成了「任务」。浏览器打开首页后上半部是统计卡总任务数、已完成、转换中、等待、失败中间是一张上传卡把文件拖进虚线区或点Open upload settings按钮随后在分步向导里确认章节和角色配置任务提交后立即进入队列。图abogen Web 端仪表盘文件上传、任务队列与实时进度同屏显示任务由后台 worker 顺序执行浏览器里的进度条和日志会自动刷新完成后直接下载音频与字幕文件也可以随时取消、删除或下载日志排查问题。页面顶部有Browse Calibre library入口可以直接从 Calibre 书库挑书不用手动下载文件。它能帮你做什么字幕、批量队列和混合语音字幕粒度可按内容类型选。做教学视频、课程口播时选Sentence Comma或按单词档位字幕切换更细做整段朗读选Sentence即可。注意一个限制按单词切分的档位只对英语可用Kokoro 的单词级时间戳只支持英文其他语言会回退到句级或逗号级字幕。批量转换靠队列而不是重复操作。桌面端有独立的 Queue Manager.txt和字幕文件可以直接点Add files加入队列EPUB、PDF、Markdown 文件则从主窗口输入框点Add to Queue加入。图abogen 队列管理界面多个文件按顺序排队转换悬停可查看各文件当时的配置队列里每个文件保存的是加入那一刻的设置之后你在主窗口改配置不会影响已入队的文件如果就是想统一改可以勾选Override item settings with current selection让所有队列项强制使用当前配置。语音混合器用来调出固定的「个人声线」。在 Voice Mixer 里给多个发音人模型配权重合成试听后存成一个 profile之后选语音时直接选这个 profile不用再手动调。图abogen 语音混合器可调整各语音模型权重并保存为可复用的 profile章节控制让长文档可拆可并。处理 EPUB、PDF、Markdown 时你可以只选部分章节转换勾选「Save each chapter separately」把每章存成独立音频再勾「Create a merged version」额外生成合并版。M4B 输出还会自动带上标题、作者、封面等元数据封面从 EPUB/PDF 自动提取放进支持元数据的有声书播放器里信息就是完整的。进阶用法GPU 加速、章节标记、LLM 文本整理与 AudiobookshelfGPU 加速看你的卡。NVIDIA 显卡选对应 CUDA 的安装方式即可12.6/12.8/13.0 按驱动选AMD 显卡只支持 Linux ROCm。没有 GPU 也能跑只是速度降到 CPU 水平。启动后如果日志提示 CUDA 不可用按 README 的排错小节重装对应版本的 PyTorch 即可。章节标记可以让重做只花一次成本。EPUB/PDF/Markdown 转换后会自动写入形如CHAPTER_MARKER:Chapter Title的标记纯文本里你也可以手动加。有了标记某一章出错时只需重转那一章。类似地文本开头支持METADATA_TITLE:...等元数据标签用于生成带完整信息的 M4B。另外带HH:MM:SS时间戳的文本文件会被自动识别可直接按你给定的时间点朗读适合做需要精确控制节奏的解说稿。以上标记写法见 README 的 Core Features 小节。Web 端独有能力值得单独看一眼。LLM 文本整理在Settings → LLM里填一个 OpenAI 兼容端点比如本地 Ollama让模型在生成前处理引号、缩写这类棘手文本Audiobookshelf 集成在Settings → Integrations里填好地址、库 ID、文件夹和 API token转完的有声书可以直接推送到你的 Audiobookshelf 库。这两个能力目前只在abogen-web可用官方说明会逐步合并进桌面端以官方文档为准。部署给团队可以用 Docker。仓库自带 Dockerfile 和 docker-compose.yamldocker compose up -d --build即可在带 GPU 的主机上跑 Web 端上传文件落在/data/uploads成品音频和字幕输出到/data/outputs。如果你是为课程、播客或短视频持续做「能听能看」内容的人现在就可以按上面两条路径装一次把手头一份 PDF 丢进去跑完第一次转换——从上传到下载成品音频和字幕通常只需要几分钟。【免费下载链接】abogenGenerate audiobooks from EPUBs, PDFs and text with synchronized captions.项目地址: https://gitcode.com/GitHub_Trending/ab/abogen创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
