Audio8 ASR Infinite Torch 推理完整指南从 WAV 到实时文本一行命令搞定【免费下载链接】Audio8-ASR-Infinite项目地址: https://ai.gitcode.com/hf_mirrors/Edge0/Audio8-ASR-InfiniteAudio8 ASR Infinite是一款原生流式语音识别ASR模型主打低延迟实时转写。本文带你用 Torch 推理方式只需一行命令就能把本地 WAV 音频转成逐字实时输出的文本——支持中文/英文双语、可选 80/120/160 ms 音频时钟甚至可用 24/7 全天候运行不漂移。它强在哪3 个亮点先看超快响应原生流式架构每秒解码 12.5 次边说边出字 ♾️无限时长滚动 KV Cache 让内存和延迟保持恒定7×24 小时连续转写不漂移 ⚡延迟可调转写延迟 240–560 ms 自由选择用延迟换准确率Torch 推理一行命令从 WAV 到实时文本不需要 Docker、不需要部署服务端Torch 模拟流式解码是最快的上手方式。一条命令即可python -m audio8_asr_infinite.examples.torch_streaming_decode \ --checkpoint /path/to/checkpoint \ --audio sample.wav --language zh --transcription-delay-ms 480命令说明参数含义示例--checkpoint模型权重目录本仓库所在目录--audio输入音频16 kHz 单声道 WAVsample.wav--language识别语言zh或en--transcription-delay-ms转写延迟毫秒480该命令对应 README 中的 Torch 推理章节详见 README.md。如果你希望用代码精细控制批量解码可参考其中给出的simulated_streaming_greedy_decode_batch用法见 README.md。音频时钟怎么选一张表看懂参数搭配模型支持三种音频时钟流式帧长不同时钟可搭配的延迟不同。以下组合经过后训练优化推荐直接使用音频时钟frame_lenstreaming_n_left_pad_tokens可选target_delay_ms80 ms418240 / 320 / 480 / 560120 ms612240 / 480160 ms89320 / 480 经验法则追求最低延迟选 80 ms 时钟 240 ms 延迟追求更高准确率选 480 ms 延迟。延迟必须是所选时钟的整数倍。参数解析逻辑可参考 configuration_audio8_asr_infinite.py 中的resolve_frame_len与resolve_num_delay_tokens方法。仓库文件导览每个文件是干什么的文件作用config.json模型配置音频塔、解码器、延迟映射等model.safetensors主权重约 8.17 GBbfloat16model.safetensors.index.json权重索引文件semantic_vad_heads.safetensors语义 VAD 头区分思考停顿、口误与真正说完modeling_audio8_asr_infinite.py模型定义与延迟条件化推理核心configuration_audio8_asr_infinite.py配置类负责帧长/延迟校验tokenizer_config.json分词器配置Qwen2Tokenizer含流式特殊 tokenpreprocessor_config.json音频特征提取参数128 mel 频谱、16 kHzgeneration_config.json生成参数BOS/EOS/PAD token架构上模型继承 Voxtral Realtime 音频塔 Qwen2.5-3B-Instruct 解码器延迟通过「正弦时间嵌入 → 逐层自适应 MLP」注入详见 modeling_audio8_asr_infinite.py 的文件头注释。效果如何480 ms 延迟下的真实数据在 80 ms 时钟、480 ms 延迟的贪心解码下与同类流式模型对比错误率%测试集指标Audio8 ASR InfiniteVoxtral-Mini-4B-Realtimenemotron-3.5-streamingaishell1/testCER1.75016.79512.927aishell4/testCER2.89316.45614.677librispeech test.cleanWER3.0422.2103.353平均3.62310.2539.524中文测试集上优势明显是双语流式识别的高性价比选择。小结三步完成你的第一次转写准备一条 16 kHz 单声道 WAV 音频运行上面那一行torch_streaming_decode命令观察逐 token 实时输出的转写结果想体验 24/7 不间断的实时场景仓库还支持 vLLM Docker 部署方案可参考 README.md。Torch 推理作为入门首选足以让你最快感受 Audio8 ASR Infinite 的实时流式魅力 【免费下载链接】Audio8-ASR-Infinite项目地址: https://ai.gitcode.com/hf_mirrors/Edge0/Audio8-ASR-Infinite创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
