abogen有声书生成完整指南11秒把7种文档变成带字幕的有声书【免费下载链接】abogenGenerate audiobooks from EPUBs, PDFs and text with synchronized captions.项目地址: https://gitcode.com/GitHub_Trending/ab/abogenabogen 是一款开源的文字转语音TTS即把文本朗读成音频的技术有声书生成工具把 EPUB、PDF、纯文本或字幕文件拖进去就能得到带同步字幕的音频文件整条链路在一个管道里完成提供桌面图形界面、Web 界面和 Docker 部署三种用法。自己做一本有声书难在哪假设你想把手头的一本技术书变成通勤时听的音频版手动流程每一步都要做事提取文本并保留章节结构、清理读起来别扭的符号和数字、挑一个顺耳的嗓音、再逐句把字幕时间轴对到音频上。abogen 把这条链路压缩成一次操作拖入文件、选择嗓音和字幕粒度、点开始。解析阶段会自动插入CHAPTER_MARKER:章节名标记中途出错时只需重新处理出错的那一章不必整份文件从头跑。abogen 如何把文本变成带字幕音频3个机制解析所有格式统一成带章节的文本结论无论输入是哪种格式最终都被规约成同一套带章节的中间表示。abogen/book_parser.py统一处理 EPUB、PDF、Markdown、纯文本以及 SRT/ASS/VTT 字幕共 7 种输入提取目录、元数据和封面写入缓存目录中的分章文本文件。EPUB 会优先解析 NCX 或 HTML 目录目录缺失时退回按 spine正文文档顺序切分。这也解释了为什么它支持只选特定章节转换以及把每章单独存为音频文件。合成可插拔的 TTS 引擎结论语音合成被抽象成一份薄薄的插件契约目前内置 Kokoro-82M 和 Supertonic 两个实现。abogen/tts_plugin/定义的契约很简单创建会话、提交合成请求文本、嗓音、参数、格式、取回音频数据与时长具体引擎实现放在plugins/目录新引擎按同一份契约接入即可。Kokoro-82M 是一个 8200 万参数的开源 TTS 模型桌面版默认使用它Supertonic 则是 Web 端提供的新引擎。在这之上语音混合器可以按权重叠加多个嗓音模型用滑块逐个调权重并试听组合成一个自定义嗓音存为 profile之后的任务直接复用。字幕由合成时间戳直接生成结论字幕不靠事后对齐时间码是合成过程的副产品。Kokoro 在生成音频的同时输出词级时间戳abogen/domain/subtitle_generation.py按你选的粒度行、句、句逗号、句逐词高亮或每条 1/2/3 个词把这些时间戳分组写出 SRT 或 ASS 字幕文件。句切可选用 spaCy一个自然语言处理库识别句子边界避免在Mr.这类缩写上误切。注意词级字幕目前仅英语可用其他语言回退到句级计时。abogen 性能与格式支持实测数字以下数据来自项目 README结果因硬件而异RTX 2060 Mobile 笔记本 GPU 上约 3000 字符文本合成耗时约 11 秒产出 3 分 28 秒音频官方演示 5 秒生成约 1 分钟带同步字幕的音频。7 种输入格式EPUB、PDF、TXT、MD、SRT、ASS、VTT5 种音频输出WAV、FLAC、MP3、OPUS以及带章节信息的 M4B可嵌入标题、作者、封面等元数据。支持 9 种语言美式/英式英语、西班牙语、法语、印地语、意大利语、日语、巴西葡萄牙语、中文后两者需加装 misaki 语言包语速可在 0.1x 到 2.0x 间调节。GPU 加速支持 NVIDIA CUDA 12.6/12.8/13.0、AMD ROCm仅 Linux和 Apple Silicon MPS没有 GPU 时回退 CPU 也能跑只是更慢。Web 端基于 Flask默认端口 8808仪表盘展示任务总数、完成数与实时日志多个任务由后台 worker 顺序处理随时可暂停、取消或重试。abogen 适合谁用又该如何扩展内容创作者可以用桌面版的队列模式批量处理一次加入多个文件每项保留入队时的嗓音与字幕配置也可以强制用当前设置覆盖全部条目。Audiobookshelf 用户可以直接从 Web 端把成品音频、元数据、封面、章节表、字幕推入书库也能通过 Calibre OPDS 目录检索并下载书目。对开发者来说扩展点比较集中新 TTS 引擎走abogen/tts_plugin/契约第三方服务集成Audiobookshelf、Calibre在abogen/integrations/Web 端路由在abogen/webui/。想动手改代码从 gitcode 克隆仓库https://gitcode.com/GitHub_Trending/ab/abogen 后执行pip install -e .[dev]tests/下的测试即可直接运行需要 Python 3.10 到 3.12。Web 端还多两项进阶能力LLM 辅助文本规整接入任意 OpenAI 兼容端点如本地 Ollama处理棘手缩写和标点和说话人自动分析识别对话中的说话人并分配嗓音想深入功能的人可以从这里切入。想上手体验一条 pip 命令装好后拖入任意文档、选个字幕模式就能出活想改代码从plugins/和abogen/domain/的目录结构看起即可。桌面版命令是abogenWeb 版是abogen-web两者共享同一套核心逻辑后者目前功能更全。如果你在找一个本地运行、MIT 协议、能把文档直接变成带字幕音频的开源工具abogen 的完整度足以支撑从试用到二次开发的全程。【免费下载链接】abogenGenerate audiobooks from EPUBs, PDFs and text with synchronized captions.项目地址: https://gitcode.com/GitHub_Trending/ab/abogen创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
