FunASR Paraformer 时间戳识别每个字都带秒数字幕生成不靠猜【免费下载链接】FunASROpen-source speech recognition toolkit for training, inference, streaming ASR, VAD, punctuation, speaker diarization pipelines, and OpenAI-compatible/MCP serving.项目地址: https://gitcode.com/GitHub_Trending/fun/FunASR给播客自动加字幕时光有文字没用你还得知道每个字出现在第几秒。FunASR 时间戳识别 正好解决这件事Paraformer 识别的同时输出字级时间戳让每句话都能对上时间轴。它是什么一个模型干三份活Paraformer 的 large-vad-punc 版本把三件事打包了语音识别ASR把声音变成文字、VAD语音活动检测简单说就是判断人话从哪秒开始、哪秒结束、标点恢复给识别结果补上逗号和句号。普通 ASR 模型只回你一串字它还能顺带告诉你每个字的时间位置。做字幕、逐字高亮、会议内容定位这种文字时间的组合正是 Paraformer 带时间戳语音识别 最省心的用法。最快上手路径装、配、跑三步打开终端装包pip install funasr。然后初始化模型注意三行配置最后跑识别时带上关键开关output_timestampTrue——不开它结果里就没有时间戳。# 打开终端先装包pip install funasr from funasr import AutoModel model AutoModel( modelparaformer-zh, # Paraformer large-vad-punc 三合一版本 vad_modelfsmn-vad, # VAD判断人声起止 punc_modelct-punc, # 标点恢复补逗号句号 ) # 关键开关输出字级时间戳 result model.generate(inputaudio.wav, output_timestampTrue)paraformer-zh是 Paraformer large-vad-punc 的短名等价于那个很长的 modelscope 完整模型名用短名就行。读懂输出timestamp 结构长什么样result[0]是个字典你主要看三个字段字段含义例子text最终识别文本已带标点今天天气不错。timestamp每个字对应的[开始, 结束]单位毫秒[[0, 120], [120, 240], ...]text_postprocessed后处理后的文本即text的最终形态今天天气不错。时间戳和文字按顺序一一对应毫秒值除以 1000 就是秒。想要句级时间戳而不是字级再给generate()传sentence_timestampTrue即可。逐字打印的小循环# 逐字打印每个字出现在第几秒 text result[0][text] for i, t in enumerate(result[0][timestamp]): print(f{text[i]} {t[0] / 1000:.2f}s ~ {t[1] / 1000:.2f}s)避坑指南真实使用你会遇到什么时间戳完全没出现先查参数位置大概率是output_timestampTrue忘了传或者传错了地方。FunASR timestamp 参数配置 有个小坑它不是写在AutoModel()里的而是传给generate()的运行时参数。另外注意如果你同时挂了说话人分离模型spk_model时间戳会被自动打开不用手动加。⚠️ 采样率不对时间戳会飘Paraformer 要求 16kHz 单声道输入。你喂了 44.1kHz 的 MP3模型不会报错但整条时间轴会整体缩放戳全错。试试先重采样再喂进去import torchaudio wav, sr torchaudio.load(origin.wav) resampled torchaudio.functional.resample(wav, sr, 16000) torchaudio.save(audio_16k.wav, resampled, 16000)长音频上戳错位交给 VAD 切分超过一两分钟的音频务必保留vad_model配置。VAD 先把长音频切成小段逐段识别段内时间戳精度更高段落间的偏移量 FunASR 会自动补回你拿到的是相对整段音频的绝对时间。别自己手工切段容易丢偏移。⚡ 识别变慢了开销是真实的时间戳预测会多跑一遍 predictor⚡ 吞吐有可感知的下降。批量跑几百条时试试只在真正需要时间戳的任务上开output_timestamp有 CUDA 就上 CUDA把batch_size从默认的 1 调大。延伸与参考资料完整参数说明与更多示例FunASR 中文教程时间戳预测的实现源码funasr/models/paraformer/核心工具在 funasr/utils/timestamp_tools.py装包、模型下载等环境问题常见问题 FQA【免费下载链接】FunASROpen-source speech recognition toolkit for training, inference, streaming ASR, VAD, punctuation, speaker diarization pipelines, and OpenAI-compatible/MCP serving.项目地址: https://gitcode.com/GitHub_Trending/fun/FunASR创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
