尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

EmbeddingGemma 300M QAT Q8_0:300M 参数嵌入模型,量化后 MTEB 只掉 0.22 分

EmbeddingGemma 300M QAT Q8_0:300M 参数嵌入模型,量化后 MTEB 只掉 0.22 分 EmbeddingGemma 300M QAT Q8_0300M 参数嵌入模型量化后 MTEB 只掉 0.22 分【免费下载链接】embeddinggemma-300m-qat-q8_0-unquantized项目地址: https://ai.gitcode.com/hf_mirrors/unsloth/embeddinggemma-300m-qat-q8_0-unquantized想给内部知识库做语义搜索又不想养一个重型嵌入服务这个仓库是 EmbeddingGemma 300M 开放嵌入模型的 QAT Q8_0 非量化权重配合 Sentence Transformers 即可跑检索、分类与聚类。它是什么量化感知训练版 300M 嵌入模型EmbeddingGemma 是 Google DeepMind 发布的 300M 参数开放文本嵌入模型基于 Gemma 3 架构24 层、隐层 768、双向注意力。本仓库是其 QAT量化感知训练Q8_0 检查点的标准非量化格式float32 存储单个权重文件约 1.2GB。模型把文本编码为数值向量用于搜索、推荐、分类、聚类最大输入 2048 token训练数据约 3200 亿 token覆盖 100 多种语言。核心能力 768 维向量输出可截断至 128 维默认输出 768 维借助 MRL套娃表示学习可直接截断为 512 / 256 / 128 维再归一化。向量存储与索引空间紧张时128 维的 MTEB 英文均分仍有 65.09768 维为 68.36精度-体积的取舍成本是明确的。QAT Q8_0量化损耗接近零训练时就学会量化而不是训完再压与全精度版的差距很小多语言 60.93 vs 61.15英文 68.13 vs 68.36代码检索 68.70 vs 68.76。若再压到 Q4_0英文均分仍能保住 67.91。任务 Prompt 内置检索分类开箱即用config_sentence_transformers.json已按任务配好前缀检索 query 用task: search result | query:文档用title: none | text:问答、代码检索、聚类各有专用前缀encode_query/encode_document会自动应用无需手工拼装。300M 体量边缘设备可部署约 1.2GB 的完整权重装得进笔记本也能上手机、边缘终端做本地语义理解。注意激活不支持 float16推理请用 float32 或 bfloat16。MTEB 实测成绩与最小上手示例 QAT 检查点 768 维 MTEB 任务均分Q8_0 即本仓库版本基准Q8_0本仓库Q4_0全精度 768d多语言 v260.9360.6261.15英文 v268.1367.9168.36代码 v168.7067.9968.76先pip install -U sentence-transformers再git clone https://gitcode.com/hf_mirrors/unsloth/embeddinggemma-300m-qat-q8_0-unquantized拉取权重即可推理from sentence_transformers import SentenceTransformer model SentenceTransformer(embeddinggemma-300m-qat-q8_0-unquantized) q model.encode_query(Which planet is known as the Red Planet?) d model.encode_document([Mars, known for its reddish appearance., Venus is often called Earths twin.]) print(model.similarity(q, d)) # tensor([[0.3011, 0.6359]])适用场景与选型 ⚖️适合本地知识库检索、多语言100 语种内容召回、代码检索以及无 GPU 或希望数据不出本地的场景Q8_0 版本可直接使用需要更小体积时可加载后自行重量化为 Q4_0。注意输入上限 2048 token长文档需先分块GPU 部署要避开 float16。选型对比要极致体积选 Q4_0英文低约 0.3-0.4 分要最佳效果选全精度 768 维检查点Q8_0 介于两者之间且近乎无损。结语QAT 让量化不丢精度成为轻量嵌入模型的默认选项300M 参数、一个权重文件即可撑起多语言语义检索。随着端侧硬件算力提升这类小体积嵌入模型会越来越多地直接跑在设备里。【免费下载链接】embeddinggemma-300m-qat-q8_0-unquantized项目地址: https://ai.gitcode.com/hf_mirrors/unsloth/embeddinggemma-300m-qat-q8_0-unquantized创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表