尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

Whisper.cpp 本地语音识别实操:从克隆代码到跑出第一条转写结果

Whisper.cpp 本地语音识别实操:从克隆代码到跑出第一条转写结果 Whisper.cpp 本地语音识别实操从克隆代码到跑出第一条转写结果【免费下载链接】whisper.cppPort of OpenAIs Whisper model in C/C项目地址: https://gitcode.com/GitHub_Trending/wh/whisper.cppwhisper.cpp 是 OpenAI Whisper 语音识别模型的 C/C 实现面向需要在自己的机器上离线跑语音识别的开发者。它不依赖 Python 和深度学习框架模型以 ggml 量化格式存储tiny 到 large 共 5 个规格可选并针对 Apple Metal、NVIDIA CUDA、Vulkan、AVX 指令集做了加速。适合的场景不想把录音传到云端 API又希望识别质量接近 Whisper 原版的工程师。五分钟装好构建环境跑通第一条转写先说清门槛整个过程只需要 C/C 编译器GCC、Clang 或 MSVC和 CMake 3.10 以上没有其它外部依赖。按下面的顺序走一遍即可git clone https://gitcode.com/GitHub_Trending/wh/whisper.cpp cd whisper.cpp sh ./models/download-ggml-model.sh base.en cmake -B build cmake --build build --config Release ./build/bin/whisper-cli -f samples/jfk.wav其中base.en是约 142 MiB 的英语模型samples/jfk.wav是仓库自带的测试音频最后一条命令跑完后终端会逐段打印识别出的文本和对应时间戳。如果想跳过中间步骤快速验证环境直接执行make base.en一条命令也能完成下载模型并对samples/目录里所有 wav 做推理。按内存和语言选模型选型的依据就两条吃多少内存、要不要多语言。各规格的磁盘占用与运行内存大致是模型磁盘占用运行内存tiny75 MiB~273 MBbase142 MiB~388 MBsmall466 MiB~852 MBmedium1.5 GiB~2.1 GBlarge2.9 GiB~3.9 GB按条件给建议只做英语→ 选带.en后缀的版本比如base.en同精度下比多语言版更省资源。需要识别中文等多语言→ 选不带后缀的base或small注意模型名里带.en的是纯英语模型。内存紧张嵌入式、边缘设备→ 用tiny或把大模型量化后使用仓库自带 quantize 工具量化后的large-v3-q5_0只有 1.1 GiBlarge-v3-turbo-q5_0更是压到 547 MiB。追求精度且设备内存充足→ 上large-v32.9 GiB或large-v3-turbo1.5 GiB推理更快。按硬件选加速方案默认构建只跑 CPU任何平台都能用。有加速硬件时需要在 cmake 配置阶段加对应开关NVIDIA GPU→ 装好 CUDA 后加-DGGML_CUDA1计算通过 cuBLAS 和自定义 CUDA 内核跑在显卡上。Apple SiliconMac/iPhone→ Metal 加速默认生效想要更快可额外生成 Core ML 模型并加-DWHISPER_COREML1编码器交给 Apple 神经引擎官方给出的加速幅度在 3 倍以上首次运行较慢是设备在编译模型缓存。Intel GPU 或 x86 CPU 想再提速→ 走 OpenVINO构建时加-DWHISPER_OPENVINO1。其它厂商显卡AMD 等→ 加-DGGML_VULKAN1走跨厂商的 Vulkan 路径。纯 CPU 但想榨性能→ 装好 OpenBLAS 后加-DGGML_BLAS1加速编码器。部署位置同理录音数据不能出内网就选本地部署上面所有方案都适用要跑在手机或树莓派这类边缘设备仓库里 examples/ 下有 Android、iOS 现成示例需要批量处理服务端音频则用 Docker 镜像或examples/server起一个 HTTP 服务。进阶多语言识别与实时音频流多语言使用成本很低运行时加-l auto让模型自动检测语言或-l zh直接指定如果想把源语言翻译成英语文本再加-tr即可无需换模型前提用的是多语言模型。实时场景可以看 examples/stream 示例它从麦克风每 0.5 秒取一次音频并持续转写是一个能用但很朴素的参考实现适合拿来做二次开发的起点。另外仓库还提供了 Go、Java、JavaScriptWebAssembly、Ruby 等语言绑定如果不想直接写 C/C可以从 bindings/ 目录找对应入口。常见坑速查换完格式还是报错→ whisper-cli 只吃 16-bit WAVmp3 等格式先用ffmpeg -i input.mp3 -ar 16000 -ac 1 -c:a pcm_s16le output.wav转一下再喂。加载 large 模型直接 OOM→ 内存峰值约 3.9 GB换 quantize 工具生成的 q5_0 量化版或降一档用 small。编译完发现没走 GPU→ 加速开关只在 cmake 配置时生效如-DGGML_CUDA1普通构建默认纯 CPU跑起来看输出的system_info一行能确认当前启用了哪些指令集和后端。Core ML / OpenVINO 首跑异常慢→ 正常现象设备第一次运行要编译模型缓存第二次起恢复正常速度。识别结果偶尔多出无关文本→ 静音片段容易触发幻觉试试调--entropy-thold、--no-prints相关阈值参数或检查音频是否真的全是静音。whisper.cpp 的门槛主要在建好环境和选对模型这两步跑通之后剩下的都是参数调优。下一步建议把base.en换成一个量化后的large-v3-q5_0用同一段你自己的录音对比一次输出直观感受量化对精度和速度的影响模型清单和换算细节可查 models/README.md。【免费下载链接】whisper.cppPort of OpenAIs Whisper model in C/C项目地址: https://gitcode.com/GitHub_Trending/wh/whisper.cpp创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表