Buzz:离线音频转文字,从录音到字幕只需3步
Buzz离线音频转文字从录音到字幕只需3步【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzzBuzz 是一款在个人电脑上运行 OpenAI Whisper 模型的音频转文字工具。会议录音、课程音频、播客素材直接丢给它文字稿就留在本地。不上传服务器不依赖账号断网也能跑。适合需要处理敏感录音、又不想按分钟付费的人群。 5分钟跑通第一次转录第 1 步安装。按平台三选一flatpak install flathub io.github.chidiwilliams.Buzz # Linux # macOS / Windows从 SourceForge 下载 dmg 或安装包 pip install buzz-captions # 命令行用户Python 3.12 ffmpeg第 2 步导入音频。打开主界面点左上角的加号按钮选中 MP3、WAV、M4A、FLAC 等文件也可以粘贴 YouTube 链接、选择录音或文件夹。第 3 步转录并查看结果。语言保持自动检测模型选 small点开始转录。完成后双击任务行逐句查看带时间戳的文本按需导出 SRT、VTT 或 TXT。 Buzz 能力全景图装好后先看这张表基本能覆盖你日常 90% 的音频处理需求。能力支持范围输入来源音频/视频文件、YouTube 链接、麦克风实时录音、文件夹自动监听音频格式MP3、WAV、M4A、FLAC、OGG、Opus视频格式MP4、MOV、MKV、AVI、WMV、WebM模型后端Whisper、Whisper.cpp、faster-whisper、Hugging Face 系列、OpenAI API硬件加速CUDAN 卡、Vulkan含核显、Apple Silicon导出格式TXT、SRT、VTT文件名支持模板变量能力铺完了下面挑三个最能体现它差异化的地方展开。 三个核心能力拆解1. 本地推理数据不出设备它做了什么Whisper 模型直接在你的 CPU 或 GPU 上运行音频文件全程不经过任何服务器。你怎么用模型第一次选用时自动下载tiny 约 75MB 到 large 约 3GB按需选大小之后离线可用。偏好设置里可以指定模型目录方便统一管理。边界在哪模型下载本身需要联网纯 CPU 跑 large 模型处理长音频会明显变慢中低配机器建议 small 起步。2. 实时录音 演示窗口它做了什么麦克风采集 → 分段送入 Whisper → 滚动输出文字全程在本地完成。你怎么用切到录音模式选好麦克风设备点红色按钮开始。开始演示或访谈前可以在设置里打开演示窗口把转录文字单独投到副屏观众能实时看到。边界在哪延迟由模型大小直接决定——large 更准但反应慢live 场景建议 base 或 small嘈杂环境下准确率下降可先开启语音提取预处理。3. 文件夹监听无人值守批量转录它做了什么监听指定目录新音频文件一出现就自动排队转录输出到设定好的目录。你怎么用偏好设置 → 文件夹监听开启开关、指定源目录和输出目录、选导出格式SRT/VTT/TXT然后关掉界面让它挂着。录音笔每天导出的文件直接扔进去就行。边界在哪它按文件出现触发同一文件不会重复处理如果你需要按文件名规则改名靠的是导出文件名模板而不是额外的批处理脚本。 两个真实场景走一遍场景一给教学视频补 SRT 字幕背景40 分钟的录课视频需要一份可剪辑的字幕文件。操作路径导入视频文件模型选 medium字幕对准确率要求高多等几分钟值得任务类型保持Transcribe等转录完成打开转录查看器边播放边修正明显的错字拖拽调整时间戳通过菜单导出 SRT勾选 SRT 格式即可产出物一个与视频同名的 .srt 文件拖进剪映或 Premiere 就能用。场景二会议录音自动转文字背景团队每周例会录音笔导出后懒得手动处理。操作路径偏好设置里开启文件夹监听源目录设为录音笔的导出文件夹输出目录设为共享盘的文字稿目录格式选 TXT导出文件名保留默认模板{{ input_file_name }} ({{ task }}d on {{ date_time }})会议主题写在文件名里即可对上号之后每周只需要把录音导出来文字稿自动出现产出物与录音文件一一对应的 TXT 文字稿时间戳在文件名里不会串。⚙️ 调优与排错遇到的问题解法转录速度慢换更小的模型large→small关掉词级时间戳有 N 卡就装 CUDA 版 PyTorch内存吃紧用 tiny/base 模型偏好设置里调低并发任务数视频无法导入检查 ffmpeg 是否安装且版本较新文件本身是否损坏实时转录延迟高live 场景改用小模型麦克风靠近声源中英混说识别乱单语内容别用自动检测直接指定具体语言专业术语错得多转录选项里填 initial prompt把术语、人名、缩写提前喂给模型 本地 vs 云端方案对比对比维度云端转录服务Buzz 本地转录数据流向上传到第三方服务器全程留在本机网络要求必须联网模型下载后离线可用费用按分钟/次数计费免费开源文件限制常有大小和时长上限无硬限制处理速度取决于网络与队列取决于本机硬件格式支持通常只收音频视频、录音、链接都收定制空间基本没有插件、CLI、监听目录均可改想深入的话这几个入口值得先看转录核心逻辑buzz/transcriber/命令行参数实现buzz/cli.py使用文档含故障排除docs/docs/插件系统AI 摘要、自动分段等buzz/plugins/⌨️ 现在就跑起来打开终端按你的平台执行第 1 步里的安装命令。装完导入今天第一段会议录音用 small 模型跑一遍——5 分钟后你会拿到一份带时间戳的文字稿然后你再决定要不要换更大的模型。【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考