
Whisper.cpp 语音识别免费跑在本地电脑上的语音转文字工具【免费下载链接】whisper.cppPort of OpenAIs Whisper model in C/C项目地址: https://gitcode.com/GitHub_Trending/wh/whisper.cpp录完的会议想回顾内容只能来回拖进度条视频要加字幕逐句听写又太熬人。Whisper.cpp 语音识别把 OpenAI Whisper 模型完整搬到你自己的电脑上本地运行、免费使用CPU 就能跑速度还快。在线语音识别的痛点本地方案怎么解把音频传给在线服务识别等于每次处理文件都把录音交给别人的服务器。对会议内容、客户访谈这类私密材料这个风险不好接受。按量计费的接口还有另一层顾虑用得越多账单越高一次性处理几小时录音时尤其明显。Whisper.cpp 的思路是把模型搬回本机。识别全程不联网不产生任何按分钟或按次收费模型文件下载一次即可反复使用。它也不慢。纯 C/C 实现做了 CPU 层面的优化普通笔记本上处理音频通常快于实时一段 10 分钟的录音很快就能看到完整文字。Whisper.cpp 模型怎么选档位体积速度感适合谁tiny75 MB几乎即时先跑通流程、实时转写base142 MB很快日常会议、英文音频small466 MB中等对准确度有要求的内容medium1.5 GB偏慢高要求的转写任务large-v32.9 GB慢追求极限精度的场景别急着装最大的模型日常使用先拿 base英文音频用 base.en就够等觉得精度不够再升档。whisper.cpp 怎么安装最短三步先拉代码并进入目录git clone https://gitcode.com/GitHub_Trending/wh/whisper.cpp cd whisper.cpp下载模型到 models/ 目录一行命令即可sh ./models/download-ggml-model.sh base.en编译生成命令行工具cmake -B build cmake --build build --config Release三个平台差异不大Windows 用 MSYS2 或 MinGW 环境执行同样的命令macOS 开箱即用且在 Apple Silicon 上自动走 Metal 加速Linux 只需提前装好 cmake 和 C 编译器。第一次运行一条命令出结果仓库自带一段示例音频 samples/jfk.wav拿来验证环境最合适./build/bin/whisper-cli -m models/ggml-base.en.bin -f samples/jfk.wav跑成功是这样的终端先打印处理进度随后输出带时间戳的一行行文字形如 [00:00 -- 00:05]内容以 And so my fellow Americans... 开头。看到文字持续往外蹦就说明一切正常。三个真实用得上的场景要给 20 分钟的视频补字幕时把音轨跑一遍再加 -osrt 参数就能直接产出 SRT 字幕文件拖进剪辑软件即可使用不用对着进度条手敲。开会时大家插话不断、现场来不及整理散会后把录音转成文字靠关键词搜索几分钟就能定位到某条结论非英语会议记得用 -l 参数指定语言。通勤路上随手录的语音备忘回家跑一次就变成可搜索的文本下次找上周说的那个方案直接搜关键词。两个提速旋钮线程数与模型档位线程数工具默认按 CPU 核心数并行想再压时间就用 -t 指定接近物理核心的数值比如 -t 8别开超过实际核心数否则反而变慢。模型档位速度差距的大头其实来自模型本身把 small 换回 base 处理时间能省掉近一半预算敏感时也可以试试带 -q5_0 后缀的量化模型体积和耗时都小一截。卡壳自救三个高频问题模型下载失败或慢得没法看多为网络问题。可以稍后重试或手动把 ggml 模型文件放进 models/ 目录文件清单在 models/README.md 里都有。提示音频格式不支持whisper-cli 目前只接受 16-bit WAV 文件先用 ffmpeg 转一下即可ffmpeg -i input.mp3 -ar 16000 -ac 1 -c:a pcm_s16le output.wav识别结果不准换一档更大的模型英文音频改试 .en 后缀版本非英语音频则用 -l 参数明确指定语言这三步通常能解决大部分问题。到这里你手里已经有了一套完全在本地运行的语音转文字工具不注册、不付费、不出机器整套流程就三条命令。挑一段你一直想整理的录音今晚就用 base.en 跑一次试试。【免费下载链接】whisper.cppPort of OpenAIs Whisper model in C/C项目地址: https://gitcode.com/GitHub_Trending/wh/whisper.cpp创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考