Voicebox 实战从本地声音克隆到让 AI 智能体开口的完整流水线【免费下载链接】voiceboxThe open-source AI voice studio. Clone, dictate, create.项目地址: https://gitcode.com/GitHub_Trending/voicebox1/voiceboxVoicebox 是一个本地运行的开源 AI 声音工作室几秒音频完成声音克隆本地跑通 TTS 文本转语音还能给你的 AI 智能体装上一张嘴。后端是 FastAPI前端是 Tauri 桌面应用模型、声音数据、录音全部留在你自己的电脑上数据不出本机。macOS / Windows 直接下桌面版Linux 或想从源码起服务的话一行命令就能跑起来git clone https://gitcode.com/GitHub_Trending/voicebox1/voicebox cd voicebox docker compose up三行拉下仓库、进目录、一条命令拉起全部服务。Apple Silicon、NVIDIA、AMD、Intel Arc、纯 CPU 都能跑。录 30 秒参考音频克隆出你的专属旁白音色 ️卡住创作者的第一关是这样的想用自己的声音念旁白可每改一版稿子都得重录一遍。Voicebox 的做法是零样本声音克隆录 10~30 秒清晰人声模型提取音色特征之后任何文本都用你的声音念。界面点 Create Voice填名称与语言上传、录音或捕获系统音频当参考样本挑一个 TTS 引擎就这么简单。把一段 40 字的脚本丢进去几秒后听到自己声音念出部署完成——这就是先克隆、再量产的全部意义。7 个 TTS 引擎按场景切换综合质量优先Qwen3-TTS 1.7B覆盖 23 种语言Chatterbox Multilingual低配机器 / 纯 CPULuxTTS约 1GB700 秒以上长音频HumeAI TADA不想录音也行50 个精选预设音色直接挑。细节见声音克隆指南。声音到手下一个问题是内容能做多长。五万字符长文不切块直接生成有声书 一本小说章节三万字多数云端 TTS 当场拒单。Voicebox 走无限长度生成文本自动按句子边界切分每段独立生成再交叉淡化拼接最长 50,000 字符分段逻辑认缩写、认中日韩标点不会在奇怪的位置断句。整章贴进去关掉页面回来就是一段能直接上架的音频。提交进异步队列后继续编辑下一条互不阻塞每次生成都保留原始版本换种子重录 Take、星标收藏都随你。多人内容直接进内置的 DAW 式多轨时间线编辑器Stories每个角色一条轨道拖拽编排对白时间线上直接裁剪、拆分音频片段同步播放头整体预览每段剪辑锁定固定生成版本重新生成不打乱整片多主持播客、有声书、游戏对话、广播剧都这一套。界面细节见 Stories Editor 文档。成片做完更有意思的问题是让它自己开口说话。一条 /speak 调用让 AI 智能体用你的克隆音色开口 AI 智能体一开口体验就不一样了。Voicebox 是 API-first你搭的不是玩具是本机的语音 I/O 基础设施REST API 默认端口 17493/speak 生成语音/transcribe 转写音频声音档案走 HTTP 列出。curl -X POST http://127.0.0.1:17493/speak \ -H X-Voicebox-Client-Id: my-script \ -d {text: 部署完成。, profile: Morgan}一条 POST克隆音色开始念——这就是 17493 端口 /speak 接口的全部交互成本。接 Claude Code 或其他 MCP 客户端更省事内置 MCP 服务器让任何 MCP 客户端都能调 voicebox.speak、转写音频、浏览声音档案。Settings 里把不同 Agent 绑到不同音色听到声音就知道是谁在说话朗读时屏幕浮现提示气泡全程可见没有偷偷后台发声。接入细节看 MCP Server 文档。输出半边做完了输入半边同样省事。按住键说话、松手即停Whisper 本地转写的全局听写 ⌨️按住组合键说 30 秒松手转写已经贴进你正在输入的文本框。Whisper 本地转写后自动粘贴进任意应用当前聚焦的输入框macOS 下剪贴板原样保存再恢复LLM 还能自动清掉口头语。每次听写都会存进 Captures 标签页原始音频与文字稿成对保存——重转写、编辑甚至一键升级成声音克隆用的样本。写周报的时候按键、说半分钟、松手文本框里已经整整齐齐。创作者、作者、开发者按目标选起点从哪入手取决于你要产出什么你的情况推荐起点理由短视频 / 公众号创作者声音克隆 情绪标签与音效量产有人味儿的旁白播客 / 有声书作者长文生成 Stories 时间线从稿件到成片一条龙开发者REST API MCP把语音 I/O 接进自己的 Agent模型、声音数据、录音始终留在本机——Voicebox 的价值就是把你自己的声音 I/O 闭环交给自己的硬件。【免费下载链接】voiceboxThe open-source AI voice studio. Clone, dictate, create.项目地址: https://gitcode.com/GitHub_Trending/voicebox1/voicebox创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
