尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

SenseVoice 语音识别:10 行代码跑通的多语言语音理解模型

SenseVoice 语音识别:10 行代码跑通的多语言语音理解模型 SenseVoice 语音识别10 行代码跑通的多语言语音理解模型【免费下载链接】SenseVoiceOpen-source SenseVoiceSmall model for Mandarin, Cantonese, English, Japanese, and Korean ASR, language ID, emotion recognition, and audio event detection.项目地址: https://gitcode.com/gh_mirrors/se/SenseVoiceSenseVoice 是一个开源多语言语音理解模型把语音识别、语种识别、情感识别和音频事件检测装进同一个模型。已发布的 SenseVoice-Small 约 234M 参数支持普通话、粤语、英语、日语、韩语五种语言输出带标点的归一化文本处理 10 秒音频只需约 70 毫秒。它基于非自回归端到端架构配合微调脚本和多种导出格式从本地验证到服务化部署都能直接落地。SenseVoice 模型总览输入一段音频同时得到转写文本、语种、情感和事件标签 能力全景一个模型同时回答四个问题一句话定位SenseVoice-Small 把说了什么、用什么语言说的、什么情绪、伴随什么声音事件四件事合并成一次前向计算。功能一句话说明典型用途语音识别ASR普通话、粤语、英语、日语、韩语转写带标点和逆文本归一化会议记录、字幕生成语种识别LID自动判别五种语言也支持手动指定多语言内容分发情感识别SER7 类标签中性、高兴、悲伤、愤怒、恐惧、厌恶、惊讶客服情绪监控音频事件检测AED8 类标签语音、背景音乐、掌声、笑声、哭声、咳嗽、打喷嚏、呼吸音视频内容审核时间戳VAD 切分边界与 CTC 对齐时间戳字幕对齐、音频剪辑说话人分离与 FSMN-VAD、CAM、标点模型组合的 FunASR 流水线非 Small 检查点原生输出多人对话归档批量推理动态批处理以秒为单位控制 batch离线批量转写Web 界面Gradio 页面拖拽音频或本地录音直接体验功能演示、快速验证⚡ 最小路径上手clone 到出转写结果只要 3 条命令最短路径是安装依赖、写一个不超过 10 行的脚本、跑一次推理。git clone https://gitcode.com/gh_mirrors/se/SenseVoice cd SenseVoice pip install -r requirements.txt依赖来自 requirements.txt核心是funasr1.3.26、torch 和 gradio。GPU 机器先装好对应 CUDA 的 torch 轮子再执行安装。把下面脚本保存为demo_run.py再运行python demo_run.pyfrom funasr import AutoModel from funasr.utils.postprocess_utils import rich_transcription_postprocess model AutoModel(modeliic/SenseVoiceSmall, trust_remote_codeTrue, remote_code./model.py, vad_modelfsmn-vad, devicecuda:0) res model.generate(inputyour_audio.mp3, languageauto, use_itnTrue) print(rich_transcription_postprocess(res[0][text]))模型权重首次运行时从模型中心自动下载。终端打印出与音频内容一致的带标点文本即算跑通无 GPU 时把device改成cpu也能出结果只是变慢。想先看效果而不写代码直接python webui.py打开 Gradio 界面拖入音频即可。ASR 基准对比AISHELL-1 上 SenseVoice-Small 词错误率 2.27%明显低于 Whisper-Small 的 4.72%WenetSpeech 上为 6.66% 对 11.50%中文和粤语是它的优势区间 性能验证70 毫秒与更低的中文 WER延迟来自非自回归架构一次前向输出整段文本没有逐词解码的串行开销。模型参数量处理 10 秒音频耗时架构SenseVoice-Small234M约 70 ms非自回归Whisper-Small244M约 5 倍于上者自回归Whisper-Large1550M约 15 倍于上者自回归同一基准下 SenseVoice-Small 比 Whisper-Small 快 5 倍以上、比 Whisper-Large 快约 15 倍参数规模相近而延迟低一个量级识别精度上SenseVoice-Small 在中文数据集领先Whisper-Small 在英文数据集LibriSpeech test-clean2.31% 对 2.90%仍有优势。情感识别方面未经目标数据微调SenseVoice-Small 即可达到或超过多数开源情感识别模型SenseVoice-Large 在几乎所有测试集上表现最佳。 定制与部署什么场景下才需要它微调——领域词、口音或新语言下识别率不达标时才需要。用 finetune.sh 配合 DeepSpeed 分布式训练训练数据按 data/train_example.jsonl 的 jsonl 格式准备音频路径、转写文本、语种、情感、事件标签。缺语言/情感/事件标注时可用模型自动预测补全省掉大量人工标注。格式导出——脱离 PyTorch 运行或要在 CPU 上量化部署时。导出 ONNX 支持量化导出 LibTorch 走原生推理见 demo_onnx.py 和 demo_libtorch.py。服务化——需要多并发接入时。fastapi run --port 50000起服务用SENSEVOICE_DEVICE指定设备客户端支持 Python、C、Java 等语言用 Dockerfile 或 docker-compose.yaml 打包可保证环境一致docker run --gpus all -p 50000:50000 sensevoiceCPU / 边缘——无 GPU 或上设备时走 GGUF 路线bash runtime/llama.cpp/download-funasr-model.sh sensevoice ./gguf llama-funasr-sensevoice -m ./gguf/sensevoice-small-f16.gguf --vad ./gguf/fsmn-vad.gguf -a audio.wavq8 量化后约 254 MB单个二进制内置 VAD运行期不依赖 Python。生态集成——高吞吐推理可用 Triton TensorRTV100 上测得 526 倍加速sherpa-onnx 支持 10 种语言并覆盖 iOS、Android、树莓派实时场景可评估伪流式方案代价是少量精度损失。 场景速查先对号入座再动手场景用到的能力选型或注意事项客服录音质检情感识别 语音识别 时间戳质检规则按 7 类情感标签设计愤怒、悲伤权重更高多语言会议转录ASR 自动语种识别 说话人分离语种自动判别分离需组合 CAM 等模型的 FunASR 流水线并非 Small 检查点原生输出音视频内容审核音频事件检测 ASR8 类事件标签覆盖 BGM、掌声、笑声、哭声等实时语音助手ASR 低延迟推理选 Small 模型实时链路优先测伪流式或 GGUF 路线的端到端延迟离线 / 边缘设备GGUF 导出 内置 VADq8 约 254 MB单二进制、无 Python 依赖适合树莓派与移动端收尾SenseVoice 用一个模型同时给出文本、语种、情感和事件四类信息推理快、可微调、部署路径多适合作为企业语音应用的基础组件。下一步先按最小路径上手跑通 10 行示例脚本确认你的音频能稳定出带标点的转写再决定微调还是服务化。【免费下载链接】SenseVoiceOpen-source SenseVoiceSmall model for Mandarin, Cantonese, English, Japanese, and Korean ASR, language ID, emotion recognition, and audio event detection.项目地址: https://gitcode.com/gh_mirrors/se/SenseVoice创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表