尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

Buzz 音频转录:从录音到带时间戳 SRT 的 5 步实战

Buzz 音频转录:从录音到带时间戳 SRT 的 5 步实战 Buzz 音频转录从录音到带时间戳 SRT 的 5 步实战【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz你手里有一段 2 小时的会议录音需要在半小时内把带时间戳的字幕文件交给视频组。Buzz 音频转录基于 Whisper 的本地语音转文字工具就是为这种场景准备的模型跑在你自己的机器上音频和文本全程不出本机断网也能干活。⚡ 最小可跑通路径5 步拿到第一份字幕先别管参数按下面 5 步跑一遍跑通了再回头看细节。安装并启动。走 PyPI 安装需要先装好 ffmpeg并使用 Python 3.12 环境pip install buzz-captions python -m buzzmacOS 和 Windows 也可以直接下载官方安装包Linux 用 Flatpak 或 Snap。添加任务。点击主界面工具栏上的Add选中音频或视频文件也可以直接粘贴网页视频链接。选模型。在弹出的新建任务设置里模型类型保持默认模型大小从Tiny起步语言留空让 Buzz 自动检测。点 Start 开始。任务进入队列列表里能看到实时进度完成后状态变为 Finished。导出 SRT。双击该任务打开转录查看器在菜单里选择导出为 SRT文件默认保存在源文件同目录。按数据流拆解输入、处理、输出输入Buzz 能接哪些格式和来源纯音频mp3、wav、m4a、ogg、opus、flac视频文件mp4、webm、mov、mkv、avi、wmv会自动抽取其中的音轨网页链接Add 对话框里直接粘贴视频 URL文件夹监听指定一个目录新丢进去的文件自动排队转录麦克风实时录音现场演讲、会议边录边转还支持演示窗口处理Whisper 桌面端的模型选择与加速各转录引擎都放在 transcriber 后端目录 里界面上可直接切换维度可选内容后端whisper.cpp、Whisper、faster-whisper、Hugging Face、OpenAI API模型大小Tiny → Base → Small → Medium → Large越大越准也越慢加速Nvidia 显卡走 CUDAMac 走 Apple Silicon集成显卡可用 Vulkan经验值10 分钟的音频Tiny 在普通 CPU 上几十秒出结果Medium 可能要几分钟。追求精度又没独显时whisper.cpp 后端加 Vulkan 是省心的甜点配置。 小贴士语言选自动检测时Buzz 只看开头一段音频做判断。如果录音开头是纯音乐或外语片段建议手动指定语言。输出校对、翻译与离线字幕生成双击完成的任务进入转录查看器源码在这里这是 Buzz 花时间最多的地方每行片段都带毫秒级时间戳点击片段上方播放器会跳到对应位置回放可以直接改文字、微调片段时间、拆分或合并片段搜索框支持全文定位长录音里找某句话不用逐段翻点Translate可以本地把全文译成另一种语言最后从菜单导出 TXT、SRT、VTT 三种格式做字幕的人还会用到Resize设定每条字幕的理想长度后Buzz 按标点、语义和时间间隔重新切分片段解决一行字幕顶半屏的问题。进阶技巧遇到什么问题就翻什么录音 1 个多小时转一次要等很久用 CLI 把一批文件一次性丢进队列用法见 CLI 入口buzz add meeting.mp3 -t transcribe -m whispercpp -s small多人会议分不清谁说了什么查看器里的Speaker Identification会对多人对话做说话人识别给每句话标注发言人适合访谈和会议录音。不想手动逐条加任务开启文件夹监听原始录音统一丢进一个目录即可自动转录重复文件也有插件可以自动跳过避免二次劳动。参数想一次性定死默认模型、语言、输出目录都在 偏好设置面板 里改改完后所有新任务都按这套默认值走。⚠️ 新手常见坑与解法首次运行卡住不动多半是在后台下载 Whisper 模型进度不直观。网络差的话先在别的机器把对应模型文件ggml-xxx.bin下好再拷贝到本机模型缓存目录。PyPI 装完启动报 ffmpeg 相关错误Buzz 靠 ffmpeg 解码音频先单独安装 ffmpeg 再启动。GPU 没被用上CPU 跑满PyPI 版本需要与 CUDA 匹配的 torch嫌折腾就换 whisper.cpp 后端它的 Vulkan 支持对集成显卡最省心。内存小于 8GB 时别碰 Large 模型用 Small 起步。收束Buzz 是把 Whisper 完整装进桌面的本地转录工具音频进TXT/SRT/VTT 出全程离线。当需求从转一个文件升级到批量流水线时它的 CLI 和插件系统就是下一步的出口。【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表