
从一小时录音到SRT字幕Buzz离线语音转录与字幕制作全流程【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz开完会你手里只剩一段一小时长的录音明天上午就要交出文字稿。手动听写太费时间传云端转录又担心会议内容外泄——这正是Buzz要解决的问题。它是一款运行在个人电脑上的完全离线语音转录与翻译工具由 OpenAI 的 Whisper 模型驱动MP3、WAV、MP4 甚至 YouTube 链接都能直接转成带时间轴的文本全程不需要联网。这篇文章不按功能清单平铺而是跟着一次真实任务的推进顺序走从拿到录音开始到交付一份可用的字幕文件结束。你照着做一遍基本就掌握这个工具的日常用法了。安装按系统对号入座两分钟跑起来Buzz 不挑系统四条安装路径任选其一Windows / macOS从项目发布页下载安装包.exe 或 .dmg双击装完即可。Windows 版没有签名首次安装会弹警告选更多信息 → 仍要运行就行Linuxsudo snap install buzz或用 Flatpak 安装Python 环境pip install buzz-captions然后python -m buzz启动。第一次启动时Buzz 会提示下载模型文件。这个下载只发生一次之后的转录全部在本地完成——这正是它和云端服务的根本区别音频数据从头到尾不出你的电脑。如何选模型这一步决定你等多久、准不准打开偏好设置里的 Models 页share/screenshots/buzz-3.2-model-preferences.png能看到从 Tiny 到 Large-V3-Turbo 的一列模型清单已下载和可下载的分栏显示。选模型本质上是在速度和准确率之间划天平Tiny / Base体积小、转得快适合实时录音这类对延迟敏感的场景Small / Medium日常会议的性价比之选多数情况足够准Large 系列准确率上限最高代价是耗时和内存占用适合字幕制作这种一次转录、长期复用的活。后端引擎也值得了解Whisper.cpp 支持 Vulkan 加速NVIDIA 显卡可开 CUDAApple Silicon 直接走 GPU。搞不清怎么搭配也没关系先用 Large 求准、转完再换小模型提速是最稳妥的上手策略。模型的完整大小与语言覆盖说明见官方文档 docs/docs/index.md。把音频拖进队列然后去忙别的回到主界面可以一次拖入多个文件也可以直接粘贴 YouTube 链接。每个任务一行状态列明确标出排队中 / 处理中含进度百分比/ 已完成含耗时。转录在后台线程里执行窗口最小化甚至关掉任务也会继续跑完。等结果这段时间你可以去写邮件、开下一个会——不用像用网页工具那样死盯着进度条这是体验上一个很实在的差别。对稿机器转写变成可交付文稿的关键一步转录完成后双击任务进入转录查看器。每一行文本都带着精确的起止时间戳底部是播放进度条。你边听边核对发现错字直接改改动即时生效查找关键词、调播放速度、循环重听某一段这些细节也都做了进去。Whisper 对清晰普通话的识别率相当高但专有名词、数字、口音重的片段仍值得人工扫一遍。对一小时录音来说这是整个流程中最花时间的一步好在逐句对齐的结构让校对效率远高于对着空白文档重新打字。如何导出SRT字幕Resize帮你把长文本切成合格的字幕如果目标是字幕文件转录文本还不能直接拿去用——一句话占满一屏谁看都累。工具栏上的 Resize 按钮就是为这个设计的share/screenshots/buzz-6-resize.png它提供三个核心控制项目标字幕长度设定每条字幕的理想字数超长的句子自动切分按标点拆分优先在句号、逗号处断句避免把句子拦腰截断按静音间隙合并识别音频中的停顿把过短的碎字幕拼成完整一句。调完点击导出格式可选 TXT、SRT、VTT直接丢给剪辑软件或字幕工具。具体参数怎么配官方文档有详细说明docs/docs/usage/4_edit_and_resize.md。到这里拿到录音 → 交付字幕的主流程就走通了。同一条流水线还能顺手做这三件事实时录音转录接上麦克风点击录制边讲边出字适合现场会议和讲座还带一个演示窗口能把字幕投到大屏上多语言翻译文件转写完成后用查看器工具栏的 Translate 按钮把内容翻成指定语言。它支持接入本地运行的翻译模型如 Ollama、LM Studio隐私链路依然不经过云端docs/docs/usage/3_translations.md文件夹自动转录在偏好设置里指定一个监控目录新文件一丢进去就自动开转适合攒一批处理一批的固定工作流。算一笔账全部成本只有一次模型下载Buzz 采用 MIT 开源协议软件本身免费。你的实际投入就两块第一次下载模型消耗的流量从几百 MB 到 2GB 不等以及转录时占用的 CPU/GPU 算力。对比按分钟计费的云端转录服务一年处理上百小时音频省下的费用相当可观。而这一切换来的核心回报始终是同一件事敏感录音永远不用离开你的电脑。如果你的需求是偶尔把一段录音变成文字Tiny 模型加默认设置就够如果做字幕是常态值得花点时间调好 Resize 参数一次调好长期受益。现在动手很简单去项目发布页下载对应系统的安装包即可想从源码运行或参与改造克隆仓库就行git clone https://gitcode.com/GitHub_Trending/buz/buzz装好后拿一段十分钟的录音试一次。当第一个任务变成带时间轴、可编辑、可导出的文字时你会真正理解离线语音转录这几个字的分量。【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考