尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

3分钟上手NemotronLabs-VoiceChat-11B-mlx-4bit:从安装到语音对话的完整指南

3分钟上手NemotronLabs-VoiceChat-11B-mlx-4bit:从安装到语音对话的完整指南 3分钟上手NemotronLabs-VoiceChat-11B-mlx-4bit从安装到语音对话的完整指南【免费下载链接】NemotronLabs-VoiceChat-11B-mlx-4bit项目地址: https://ai.gitcode.com/hf_mirrors/mlx-community/NemotronLabs-VoiceChat-11B-mlx-4bitNemotronLabs-VoiceChat-11B-mlx-4bit是一款专为Apple Silicon优化的语音对话模型基于NVIDIA的NemotronLabs-VoiceChat-11B模型转换而来采用4bit量化技术仅需9.2GB存储空间即可实现高效的语音交互功能。本文将带你快速完成从安装到实现语音对话的全过程让你在几分钟内体验这款强大模型的魅力。 模型简介为什么选择NemotronLabs-VoiceChat-11B-mlx-4bitNemotronLabs-VoiceChat-11B-mlx-4bit是一个完整的语音交互系统包含四大核心组件组件参数规模功能描述语言主干7.71 BNemotron-H混合架构包含27个Mamba-2层、25个MLP层和4个分组查询注意力层词汇头1.76 B包含 token 嵌入、LM头和函数调用头语音编码器0.61 B带mel前端的Conformer编码器语音生成器1.00 BGemma-3 TTS主干、混合高斯头、神经音频编解码器该模型支持全双工语音交互以80ms帧12.5帧/秒运行输入16kHz输出22.05kHz为实时对话提供流畅体验。⚡ 快速安装三步完成环境配置1️⃣ 克隆项目仓库首先克隆项目仓库到本地git clone https://gitcode.com/hf_mirrors/mlx-community/NemotronLabs-VoiceChat-11B-mlx-4bit cd NemotronLabs-VoiceChat-11B-mlx-4bit2️⃣ 安装依赖库安装运行所需的依赖包pip install mlx mlx-lm numpy3️⃣ 提取语言模型运行提取脚本准备语言模型python mlx/extract_llm.py --src . --dst ./voicechat-llm这个步骤会从完整模型中提取出语言主干部分并与Nemotron-H基础分词器配对为后续的文本交互做好准备。 文本对话体验快速测试模型能力完成安装后你可以立即通过以下命令启动文本对话示例python mlx/chat_example.py --model ./voicechat-llm启动后你将看到类似以下的输出loaded in X.Xs, X.XX GB 现在你可以输入文本与模型进行交互了。例如输入 Hello, how are you?模型将生成回应。如果你想直接测试特定提示可以使用--prompt参数python mlx/chat_example.py --model ./voicechat-llm --prompt The capital of France is 音频编解码器体验语音处理能力NemotronLabs-VoiceChat-11B-mlx-4bit还包含一个强大的音频编解码器你可以通过以下命令体验音频的编码和解码过程python mlx/codec_example.py --repo . --wav input.wav --out output.wav这个示例会将输入的音频文件编码为512维潜在向量和31级代码然后解码回音频。在M4 Max上这个过程大约比实时快6倍重建信噪比约为8dB。⚠️ 注意编解码器期望输入22.05kHz的单声道音频其他采样率会导致解码速度错误。 性能表现Apple Silicon上的高效运行在Apple M4 Max68.7GB统一内存上语言主干部分的性能表现如下量化方式加载时间峰值内存首token时间吞吐量bf163.1 s17.96 GB646 ms23.4 tok/s8-bit1.9 s10.22 GB803 ms33.2 tok/s我们使用的4bit版本在保持高性能的同时进一步降低了内存占用仅需9.2GB存储空间是在Apple设备上运行的理想选择。 注意事项文本提示不在模型的训练分布范围内模型可能会生成包含音频侧标记的输出如SPECIAL_12完整的Conformer语音编码器和全双工循环目前尚未在MLX中实现但权重已包含在仓库中模型采用OpenMDW-1.1许可证发布基于NVIDIA的原始模型和架构 总结通过本指南你已经了解了NemotronLabs-VoiceChat-11B-mlx-4bit的基本情况并完成了从安装到简单使用的全过程。这款模型为Apple Silicon设备带来了高效的语音对话能力无论是文本交互还是音频处理都展现出优异的性能。现在你可以开始探索更多高级功能或者将这个强大的语音模型集成到你自己的项目中创造出更加智能和自然的交互体验【免费下载链接】NemotronLabs-VoiceChat-11B-mlx-4bit项目地址: https://ai.gitcode.com/hf_mirrors/mlx-community/NemotronLabs-VoiceChat-11B-mlx-4bit创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表