离线语音识别与合成引擎:Sherpa-Onnx 一次跑通 12 种语言
离线语音识别与合成引擎Sherpa-Onnx 一次跑通 12 种语言【免费下载链接】sherpa-onnxSpeech-to-text, text-to-speech, speaker diarization, speech enhancement, source separation, and VAD using next-gen Kaldi with onnxruntime without Internet connection. Support embedded systems, Android, iOS, HarmonyOS, Raspberry Pi, RISC-V, RK NPU, Axera NPU, Ascend NPU, x86_64 servers, websocket server/client, support 12 programming languages项目地址: https://gitcode.com/GitHub_Trending/sh/sherpa-onnx本地转写录音、给应用配上合成语音不想把音频发到云端sherpa-onnx 是一个基于 ONNX Runtime 的纯本地语音工具库语音识别ASR、语音合成TTS、说话人分析、语音活动检测VAD全部在设备端完成当前版本 1.13.7。它凭什么适合本地部署全链路离线推理只依赖 onnxruntime仓库锁定 1.27.1音频不离开设备无网络、无账号。一套 C 核心C、Python、Java 等 12 种语言的 API 都绑定自同一内核sherpa-onnx/csrc/行为一致。硬件覆盖面广从树莓派、RISC-Vriscv64到 RK/Qualcomm/Ascend 四类 NPU都有对应支持。能力清单按场景选模型实时转写与离线转写流式边说边出字与非流式整段识别双模式。流式可选 Zipformer Transducer、Paraformer、CTC非流式覆盖 Whisper、SenseVoice、Paraformer、Qwen3-ASR、Moonshine、Dolphin-CTC 等。中英日韩粤均有多套模型可配合热词纠偏专名。文本转语音多引擎 TTSPiper、Kokoro、Matcha、VITS 之外还内置零样本声音克隆ZipVoice、Pocket TTS。macOS 上 4.3 秒的中文音频合成耗时 1.3 秒RTF 约 0.3。说话人分析识别谁在说Speaker ID与分了几个人Diarization分开提供基于 3D-Speaker 等模型可结合 VAD 做动态说话人切换。VAD、降噪与唤醒silero-vad 切分语音片段GTCRN、DPDFNet 做流式/离线降噪关键词 spotting 支持自定义唤醒词。这些能力可自由拼装例如 VAD 非流式 ASR 是现成组合。平台与语言支持矩阵架构AndroidiOSWindowsmacOSLinuxHarmonyOSx64✔—✔✔✔✔x86✔—✔———arm64✔✔✔✔✔✔arm32✔———✔✔riscv64————✔—维度覆盖语言12 种C、C、Python、JavaScript、Java、C#、Kotlin、Swift、Go、Dart、Rust、Pascal另支持 WebAssembly常见 ASR 模型Whisper、Paraformer、Zipformer、SenseVoice、Moonshine、Qwen3-ASR、Dolphin-CTC常见 TTS 模型Piper、Kokoro、Matcha、VITS、ZipVoice、Pocket TTS快速上手三步走克隆仓库git clone https://gitcode.com/GitHub_Trending/sh/sherpa-onnx安装 Python 包pip install sherpa-onnx再从文档站下载一个 Whisper tiny 模型。跑通第一个示例python python-api-examples/offline-decode-files.py --tokens... --model... test.wav输出即识别文本。C 侧用 CMake 编译cmake -B build -DSHERPA_ONNX_ENABLE_PYTHONON开关见 sherpa-onnx/CMakeLists.txtFlutter 插件位于 flutter/sherpa_onnx/。示例与配套资源python-api-examples/100 脚本覆盖麦克风实时识别、字幕生成generate-subtitles.py、WebSocket 客户端。c-api-examples/ 与 cxx-api-examples/C/C 完整工程示例。android/17 个 Android 演示应用覆盖 READMEharmony-os/、ios-swiftui/、tauri-examples/ 对应各端。wasm/浏览器 WASM 构建入口CHANGELOG.md 记录每次发版细节。选型建议如果你要在 Android/iOS、Linux 服务器或树莓派上私有化部署 ASR、TTS、说话人分析sherpa-onnx 是可选的少数多语言绑定 多硬件组合之一。主要前提需要自己挑选并下载对应 ONNX 模型模型精度与语言支持取决于所选模型而非库本身。【免费下载链接】sherpa-onnxSpeech-to-text, text-to-speech, speaker diarization, speech enhancement, source separation, and VAD using next-gen Kaldi with onnxruntime without Internet connection. Support embedded systems, Android, iOS, HarmonyOS, Raspberry Pi, RISC-V, RK NPU, Axera NPU, Ascend NPU, x86_64 servers, websocket server/client, support 12 programming languages项目地址: https://gitcode.com/GitHub_Trending/sh/sherpa-onnx创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考