尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

如何在5分钟内开始使用Nemotron-3-Embed-1B-BF16:超简单Python实现教程

如何在5分钟内开始使用Nemotron-3-Embed-1B-BF16:超简单Python实现教程 如何在5分钟内开始使用Nemotron-3-Embed-1B-BF16超简单Python实现教程【免费下载链接】Nemotron-3-Embed-1B-BF16项目地址: https://ai.gitcode.com/hf_mirrors/mlx-community/Nemotron-3-Embed-1B-BF16Nemotron-3-Embed-1B-BF16是一款专为Apple Silicon优化的高效嵌入模型基于NVIDIA Nemotron-3-Embed-1B-BF16模型转换而来保留了原始bfloat16精度可原生运行在Mac设备上。本教程将带你快速上手这个强大的句子嵌入工具无需复杂配置即可实现文本相似度计算和语义检索功能。 为什么选择Nemotron-3-Embed-1B-BF16这款模型在保持高精度的同时针对Apple Silicon进行了深度优化相比传统PyTorch实现提速1.8倍。特别适合需要在本地设备上进行快速文本嵌入的开发者和研究人员无论是构建语义搜索系统还是开发AI助手都能提供高效可靠的嵌入支持。主要优势高效性能在M1 Pro上处理长文档可达2.71 docs/s的吞吐量多语言支持支持37种语言包括中文、英文、日文等主流语言低资源占用基础版仅需2.28GB存储空间4bit量化版更是低至0.64GB高精度保留与原始模型余弦相似度超过0.9994bit量化仍保持99.3%的NDCG性能 快速开始5分钟安装与使用1️⃣ 环境准备首先确保你的系统已安装Python 3.8然后通过以下命令安装必要依赖pip install mlx mlx-lm transformers numpy huggingface_hub2️⃣ 获取模型使用以下命令克隆项目仓库git clone https://gitcode.com/hf_mirrors/mlx-community/Nemotron-3-Embed-1B-BF16 cd Nemotron-3-Embed-1B-BF163️⃣ 基本使用示例创建一个Python文件复制以下代码即可实现基本的文本嵌入功能import sys from huggingface_hub import snapshot_download # 下载模型 path snapshot_download(mlx-community/Nemotron-3-Embed-1B-BF16) sys.path.insert(0, path) # 导入模型和编码器 from nemotron3_embed_mlx import load, encode # 加载模型和分词器 model, tokenizer load(path) # 编码查询和文档 query encode(model, tokenizer, [什么是退款政策], input_typequery) document encode(model, tokenizer, [购买后14天内可全额退款。], input_typepassage) # 计算相似度余弦相似度 print(f相似度得分: {float(query[0] document[0]):.4f})运行这段代码你将得到类似以下的输出相似度得分: 0.7825⚙️ 高级配置选项输入类型处理模型对查询和文档有不同的前缀处理通过input_type参数可以自动添加合适的前缀input_typequery自动添加query: 前缀input_typepassage自动添加passage: 前缀input_typeNone不添加前缀适用于已手动添加前缀的情况批处理与性能优化对于大量文本处理可以通过调整batch_size参数提高效率# 批量处理文本 texts [文档1内容..., 文档2内容..., 文档3内容...] embeddings encode(model, tokenizer, texts, input_typepassage, batch_size16)量化版本选择项目提供了不同量化版本以平衡性能和资源占用版本大小NDCG10保留率推荐场景bf162.28GB100.0%追求最高性能8bit1.21GB100.0%平衡性能和存储4bit0.64GB99.3%资源受限设备 性能基准在Apple M1 Pro (16GB)上的测试结果实现方式吞吐量权重大小PyTorch/MPS (原始)1.53 docs/s2.28 GBMLX bf16 (本项目)2.71 docs/s2.28 GBMLX 8bit1.66 docs/s1.21 GBMLX 4bit1.65 docs/s0.64 GB测试使用200个平均1014字符的文档批大小为8。可使用项目中的compare_backends.py脚本在自己的设备上复现测试。 注意事项文本长度限制默认max_length为4096虽然原始模型支持32k长度但双向注意力的计算复杂度为O(L²)实际使用中需根据设备内存调整。变体兼容性不同量化版本的嵌入结果不可混用在构建检索系统时需保持版本一致。性能特点在Apple Silicon上bf16版本虽然占用更多内存但吞吐量最高量化版本更适合内存受限的场景。 许可证信息本项目基于NVIDIA的OpenMDW-1.1许可证发布原始模型基于Apache-2.0许可证。详细信息可查看项目中的LICENSE和NOTICE文件。 更多资源性能测试脚本benchmark_mteb.py模型实现代码nemotron3_embed_mlx.py配置文件config.json通过本教程你已经掌握了Nemotron-3-Embed-1B-BF16的基本使用方法。这个高效的嵌入模型将为你的NLP项目提供强大的语义理解能力无论是构建搜索引擎、推荐系统还是聊天机器人都能帮助你实现更精准的文本匹配和理解。现在就开始探索吧【免费下载链接】Nemotron-3-Embed-1B-BF16项目地址: https://ai.gitcode.com/hf_mirrors/mlx-community/Nemotron-3-Embed-1B-BF16创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表