尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

在本地免费把语音转成文字,这款开源转录工具一次跑通

在本地免费把语音转成文字,这款开源转录工具一次跑通 在本地免费把语音转成文字这款开源转录工具一次跑通【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz很多人以为把一段录音变成工整的文字稿要么花钱订阅云服务要么忍受漫长的等待。Buzz 改变了这个局面——它是一款完全离线、开源免费的个人电脑转录工具基于 OpenAI 的 Whisper把语音转文字这件事交给你的电脑自己完成。录音不离开设备速度取决于你的硬件成本为零。本文带你从安装到导出第一份文字稿把这条路径完整走一遍。Whisper 到底在干什么先抛开技术名词。想象一位只在你家办公的翻译员你把采访录音、会议录像递给他他当场听写、当场交稿材料从不带出家门也从不收你按分钟计费的钱。Whisper 就是这位翻译员的大脑Buzz 则是雇他上班的那间办公室。具体到工程层面Whisper 是 OpenAI 开源的语音识别模型Buzz 把它封装成了一个图形界面软件。你不必接触任何模型代码只需点几下鼠标就能让模型听一段音频输出带时间戳的文字。它同时支持纯音频和视频文件也支持从麦克风实时收音。这套方案解决的核心问题有两个隐私——敏感内容不出本机成本——模型推理所需的算力由你的电脑承担没有按次计费的账单。一个播客主播的转录账本做播客的朋友小林每期节目一小时过去都外包给转录服务。单期花费一百多元交付要等一到两天遇到口音重的嘉宾还要返工。他算过一笔账一年五十期节目光转录就烧掉近六千元还不算沟通成本。小林先是抱着试试看的心态装了 Buzz用一台三年前的笔记本跑完一期节目用时四十分钟准确率虽然偶尔需要手动修补但整体可用。后来他换用 Faster Whisper 引擎重跑同一期耗时压缩到十几分钟错字也明显变少。现在他的流程是录完音直接拖进 Buzz选好模型挂机泡杯咖啡回来就能校对。省下的钱够买两套麦克风省下的时间够多剪一期节目。这不是什么戏剧性的反转只是把一件高频、费钱、被云服务定价的事变成了本地的一次性算力投入。动手实践从安装到拿到第一份文字稿装好三选一的安装方式Buzz 覆盖 Windows、macOS、Linux。最省事的方式是直接从项目发布页下载对应系统的安装包双击完成。喜欢命令行的朋友也可以走 PyPIpip install buzz-captions python -m buzz第一条命令负责把软件装进环境第二条命令启动图形界面。窗口弹出后任务列表是空的你的转录之旅从这里开始。配好两份关键的偏好设置首次使用前值得打开菜单里的偏好设置把两项改好一是字体大小转录文本密密麻麻调大一点校对更轻松二是默认导出文件夹免得每次保存都翻目录。偏好设置界面里还预留了 OpenAI API 密钥入口如果你想走云端兼容接口比如 Groq在这里填上即可纯本地用户跳过这一步。紧接着要面对的问题是用哪个模型。Buzz 默认把模型分成几个档次小到 Tiny几十 MB快到秒级出稿大到 Large近 3 GB精度更高、耗时更长。首次使用建议先用 Small 起步跑通流程后再根据速度和准确率做取舍。模型管理界面里可以一键下载、随时切换也可以在自定义模型里填入你从社区找到的专用模型地址。跑通让第一个文件说话点击工具栏上的加号选一个音频或视频文件。Buzz 支持 mp3、wav、flac 等常见音频也支持 mp4、mkv、avi 等视频格式还能直接粘贴 YouTube 链接。接着选择语言——可以手动指定也可以留空让模型自动识别。点击运行任务就会进入队列。任务完成后双击它进入转录查看器每一行文字都带起始时间底下还有视频播放器点哪句播哪段校对体验相当顺手。导出时按需选格式TXT 适合直接贴进笔记SRT 和 VTT 是主流字幕格式拖进剪辑软件或视频平台就能用。容易被忽略的四个实用功能文件夹监控。在偏好设置里指定一个文件夹之后只要往里扔音频文件Buzz 就会自动开始转录。批量整理访谈素材的人会非常喜欢它——最需要它的是每天接收大量录音的助理岗位。初始提示。添加字幕前在高级设置里写几句专有名词或人名比如公司名、产品名、医学术语模型会优先按这些词听写。最需要它的是律师、医生这类术语密集的行业从业者。字幕自动整理。原始转录的行长往往参差不齐。Buzz 提供按时间间隙合并、按标点分割、按最大长度拆分三种规则一键让字幕长度更均匀、更适合阅读。最需要它的是给视频配双语字幕的剪辑师。演示窗口。实时转录时开启演示模式可以把文字稿放大铺满全屏做讲座记录或会议投影都合适。最需要它的是培训讲师和活动策划。新手高频问题快答问一小时音频我的电脑要跑多久答取决于模型和硬件。Tiny 或 Base 模型在普通笔记本上接近实时甚至更快Large 模型则可能花上数倍时长。想让速度上一个台阶优先看这两点有 NVIDIA 显卡就选 Faster Whisper 引擎Whisper.cpp 引擎支持 Vulkan 加速非 NVIDIA 显卡也能受益。问口音重、背景吵准确率怎么救答先手动指定语言别依赖自动检测再用初始提示写进人名地名最后考虑换更大一号的模型。Buzz 还有语音分离能力可以在转录前把人声从噪声中抽出来嘈杂的会议录音值得一试。问所有模型都必须在本地跑吗答不是。Buzz 也支持 OpenAI 兼容的云端接口用 API 密钥走线上推理。本地模型的好处是免费且不联网云端模型的好处是不吃本机算力按需选择即可。问Windows 上没有独立显卡能用吗答能。Whisper.cpp 在纯 CPU 上也能运行只是慢一些。对大多数一两小时的访谈挂机等一会儿完全可接受。你的第一步清单□ 下载对应系统的安装包或执行pip install buzz-captions□ 用 Small 模型跑通第一个音频文件确认输出格式□ 在偏好设置里定好导出文件夹和字体大小□ 导出一份 SRT 字幕拖进剪辑软件验证效果□ 挑一段带术语的录音试试初始提示对准确率的改善Buzz 的价值不在于它有多炫而在于它把语音转文字变成了一件可以随时在本机发生、不依赖网络和付费墙的日常小事。装上它录一段自己的语音试一次你会立刻理解这份稳妥感从哪来。相关链接官方文档docs/docs/核心转录模块buzz/transcriber/设置模块buzz/settings/【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表