MOSS-TTS-Nano多语言合成实战如何精准合成中文、英文等20种语言的高质量语音完整指南【免费下载链接】MOSS-TTS-NanoMOSS-TTS-Nano is an open-source multilingual tiny speech generation model from MOSI.AI and the OpenMOSS team. With only 0.1B parameters, it is designed for realtime speech generation, can run directly on CPU without a GPU, and keeps the deployment stack simple enough for local demos, web serving, and lightweight product integration.项目地址: https://gitcode.com/gh_mirrors/mo/MOSS-TTS-NanoMOSS-TTS-Nano 是 MOSI.AI 与 OpenMOSS 团队开源的多语言语音合成TTS小模型仅 0.1B 参数、无需 GPU就能在 CPU 上实时合成中文、英文等20 种语言的高质量语音。本文带你从零跑通安装、克隆音色、Web 演示、ONNX 加速到模型微调的完整流程。一、为什么多语言语音合成首选 MOSS-TTS-Nano在多语言语音合成领域大多数开源 TTS 模型动辄数十亿参数、必须依赖 GPU。MOSS-TTS-Nano 则把部署门槛拉到了个人笔记本级别核心优势说明 极小模型仅0.1B 参数内存占用极低 多语言支持中、英、日、法、德、韩等20 种语言⚡ 实时流式首帧音频快4 核 CPU 即可流式生成 原生高保真输出48 kHz、双声道音频 纯自回归架构Audio Tokenizer LLM音色克隆效果稳定 长文本支持自动分块长文本语音克隆不掉音色其架构由两部分组成LLM 负责理解文本、预测音频 tokenMOSS-Audio-Tokenizer-Nano 负责把 token 还原成 48 kHz 立体声波形音频编码端 MOSS-Audio-Tokenizer-Nano 只有约 2000 万参数却能在 0.125 kbps2 kbps 的变码率下实现高保真重建这是合成音质以大小胜的关键二、20 种语言支持清单中、英、日……MOSS-TTS-Nano 目前支持以下20 种语言跨语言混合文本也能合成语言代码语言代码语言代码中文zh英文en德语de西班牙语es法语fr日语ja意大利语it匈牙利语hu韩语ko俄语ru波斯语fa阿拉伯语ar波兰语pl葡萄牙语pt捷克语cs丹麦语da瑞典语sv希腊语el土耳其语tr 提示仓库自带 assets/audio/zh_1.wav、assets/audio/en_2.wav 等 13 条中英文参考音频开箱即可体验音色克隆。三、三步安装Conda 依赖10 分钟完成环境conda create -n moss-tts-nano python3.12 -y conda activate moss-tts-nano git clone https://gitcode.com/gh_mirrors/mo/MOSS-TTS-Nano cd MOSS-TTS-Nano pip install -r requirements.txt pip install -e .⚠️小坑预警若WeTextProcessing/pynini安装失败先单独装pyniniConda 用户推荐conda install -c conda-forge pynini2.1.6.post1再装WeTextProcessing最后重跑pip install -r requirements.txt即可。安装完成后moss-tts-nano命令行工具即可直接使用。四、第一次多语言合成参考音频 目标文本MOSS-TTS-Nano 的推荐玩法是音色克隆voice clone模式给一段参考音频模型就用这个声音念出任意语言的文字。中文示例入口 infer.pypython infer.py \ --prompt-audio-path assets/audio/zh_1.wav \ --text 欢迎关注模思智能、上海创智学院与复旦大学自然语言处理实验室。英文示例——换一条英文参考音频即可python infer.py \ --prompt-audio-path assets/audio/en_2.wav \ --text MOSS-TTS-Nano can generate realtime speech on CPU only.生成的音频默认保存到generated_audio/infer_output.wav。几个实用参数详见 infer.py--device cpu强制 CPU 推理默认auto无 GPU 时自动落到 CPU--text-file 长文.txt长文本合成自动分块保持音色一致--max-new-frames控制最长生成音频长度默认 375 帧--seed 42固定随机种子让同一段文本合成结果可复现。五、一键 Web 演示浏览器里试听 20 种语言不想敲命令一行启动本地 Web 演示入口 app.pypython app.py然后打开http://127.0.0.1:18083。页面内置了 assets/demo.jsonl 中预置的中、英、日文演示条目可以直接点选试听也可以上传自己的参考音频在线克隆。六、ONNX 纯 CPU 加速版推理效率翻倍 官方强烈建议轻量部署优先尝试ONNX CPU 版本infer_onnx.py、app_onnx.py✅ 推理期零 PyTorch 依赖纯 ONNX Runtime 运行✅ 处理效率约为 PyTorch 版的2 倍✅ MacBook Air M4 上单核 CPU即可流畅推理✅ 支持 Realtime Streaming Decode 流式解码与内置音色--voice。# 首次运行会自动下载 ONNX 权重到 ./models python infer_onnx.py \ --prompt-audio-path assets/audio/zh_1.wav \ --text Welcome to the ONNX Runtime CPU demo. # Web 演示版 python app_onnx.py也推荐直接通过打包好的 CLImoss_tts_nano/cli.py调用一条命令切换后端moss-tts-nano generate --backend onnx \ --prompt-speech assets/audio/zh_1.wav \ --text 欢迎关注模思智能。有 NVIDIA GPU 的同学可加--execution-provider cuda需先pip install onnxruntime-gpu进一步提速。七、提高合成质量3 个关键细节参考音频决定音色上限选 310 秒、清晰无背景音的片段合成音色最稳定文本规范化别关推理默认启用 WeTextProcessing 健壮文本清洗见 text_normalization_pipeline.py能正确处理数字、日期、缩写避免读错字采样参数微调--audio-temperature默认 0.8调低更平稳、调高更生动--audio-repetition-penalty调高可减少重复啰嗦。追求稳定播报可调低温度追求情绪表现则适当调高。音频质量底气来自 MOSS-Audio-Tokenizer-Nano 在同规模≤120M 参数开源编码器中的领先重建质量八、进阶微调你的专属多语言语音模型如果你有语音数据可以给模型注入特定音色或风格。仓库已提供完整微调流程详见 finetuning/README.md准备 JSONL每行包含audio目标音频、text、language可选ref_audio参考音色运行 finetuning/prepare_data.py 预提取音频编码支持多机多卡并行accelerate launch启动 finetuning/sft.py 训练——单卡峰值显存仅约3.23 GiB用 finetuning/verify.py 一键验证微调效果支持 voice_clone 与 continuation 续写两种模式。一键脚本 finetuning/run_train.sh 可把预处理 训练串成一步配合 finetuning/configs/accelerate_ddp_8gpu.yaml 扩展到 8 卡 DDP 甚至多机集群。九、MOSS-TTS 家族更大的选择空间MOSS-TTS-Nano 并非孤军作战它属于面向高保真、高表现力场景的 MOSS-TTS 开源模型家族——从旗舰 8B 零样本克隆模型 MOSS-TTS到多角色对话 MOSS-TTSD、文生音色 MOSS-VoiceGenerator、环境音效 MOSS-SoundEffect再到实时语音 MOSS-TTS-Realtime覆盖完整语音生成场景总结上手路径速查场景入口命令行快速合成python infer.py/moss-tts-nano generate浏览器试听演示python app.py纯 CPU 极致轻量部署python infer_onnx.py/app_onnx.py训练专属多语言音色finetuning/只需一个 Python 环境和几行命令中文、英文等 20 种语言的实时语音合成就能跑起来——这就是 MOSS-TTS-Nano 给开发者带来的最大惊喜。快去 assets/audio/ 挑一条参考音频合成你的第一句多语言语音吧【免费下载链接】MOSS-TTS-NanoMOSS-TTS-Nano is an open-source multilingual tiny speech generation model from MOSI.AI and the OpenMOSS team. With only 0.1B parameters, it is designed for realtime speech generation, can run directly on CPU without a GPU, and keeps the deployment stack simple enough for local demos, web serving, and lightweight product integration.项目地址: https://gitcode.com/gh_mirrors/mo/MOSS-TTS-Nano创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
