尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

数据说话:Qwen3.8-27B-Uncensored-GGUF 基准评测全解读(MMLU、GSM8K 与安全测试)

数据说话:Qwen3.8-27B-Uncensored-GGUF 基准评测全解读(MMLU、GSM8K 与安全测试) 数据说话Qwen3.8-27B-Uncensored-GGUF 基准评测全解读MMLU、GSM8K 与安全测试【免费下载链接】Qwen3.8-27B-Uncensored-GGUF项目地址: https://ai.gitcode.com/hf_mirrors/orcarouter/Qwen3.8-27B-Uncensored-GGUF这篇文章用官方基准评测数据完整解读Qwen3.8-27B-Uncensored-GGUF——一款为 llama.cpp 打造的去安全对齐abliteratedQwen3.8-27B 视觉语言模型的 GGUF 量化文件包。从 MMLU、GSM8K 的能力保留度到 8 项安全测试的拒答率变化所有数字一次讲清楚。 30 秒看懂核心结论关键指标结果说明能力保留度与基座差距在±1.3 分以内去对齐几乎不伤智力MMLU84.7%基座 84.3%反而略高GSM8K88.7%基座 90.0%掉 1.3 分有害请求拒答率从 64%~99% 跌到0%~6%去对齐生效良性请求误拒率从 5.6% 降到0.4%更少矫枉过正⚠️ 一句话提醒该模型移除了拒答机制仅限合理解释性研究、AI 安全研究与红队测试使用Apache 2.0 许可。 模型是什么Qwen3.8-27B-Uncensored 能力速览在解读数据前先明确被评测的是谁基座Qwen3.8-27B270 亿参数稠密模型采用 Gated DeltaNet 线性注意力 全注意力混合架构原生支持图像理解视觉、推理thinking和工具调用处理方式对基座做abliteration正交化消除拒答方向即去安全对齐架构亮点内置MTPnextn投机解码头可加速推理视觉能力由独立的mmproj 文件0.9 GB提供运行环境llama.cppCPU / CUDA / Metal / ROCm也支持 Ollama 一键运行 GGUF 量化选型指南17 个文件怎么选仓库提供了从2-bit 到 16-bit的全档位量化外加视觉投影文件标准 K-quant 系列文件位宽大小定位…-Q2_K.gguf2-bit10.9 GB显存紧张才用质量损失明显…-Q3_K_M.gguf3-bit13.5 GB小体积里的优选…-Q4_K_M.gguf4-bit16.8 GB⭐官方推荐默认质量/体积最佳平衡…-Q5_K_M.gguf5-bit18.2 GB高质量…-Q6_K.gguf6-bit20.9 GB很高质…-Q8_0.gguf8-bit27.1 GB近无损…-F16-0000*-of-00002.gguf16-bit54.7 GB全精度分 2 部分llama.cpp 指向第 1 部分即可IQ 系列imatrix 重要性矩阵量化低位宽更优文件位宽大小说明…-IQ4_XS.gguf~4.25-bit15.3 GB⭐低位宽首选体积更小却接近 Q4_K_S 质量…-IQ3_M.gguf~3.7-bit12.8 GB稳的 3-bit…-IQ2_XXS.gguf~2.1-bit8.9 GB最小可跑档质量损失最大所有量化文件都保留了 MTP 投机解码头与 GDN 混合架构需要看图就一并下载mmproj-…-f16.gguf。 基准评测解读MMLU 与 GSM8K 到底掉了几分以下为该去对齐版本与官方Qwen3.8-27B-FP8基座在相同脚本与设置下的对比数据见仓库根目录 README.md 的 Evaluation 章节基准样本量基座 FP8本模型变化MMLU全科 0-shot30084.3%84.7%0.4MMLU-ProCoT25077.6%76.8% −0.8GSM8KCoT 数学15090.0%88.7% −1.3CMMLU中文 0-shot50081.4%80.8% −0.6WikiText-2 困惑度——6.96流畅度体检通过怎么读这张表MMLU 不降反升 0.4 分在 300 题的样本量下这属于噪声范围说明去对齐没有损伤知识储备GSM8K 掉 1.3 分是全部基准里最大回撤但仍接近 90%数学推理基本完好CMMLU 仅掉 0.6 分中文能力保持良好该模型本身支持中英双语总规律所有能力指标与基座差距控制在±1.3 分以内——这是 abliteration 类模型里相当出色的保留水平️ 安全测试全解读拒答率从 99% 崩到 0%这是Uncensored名号的核心验证对 8 套有害提示基准的拒答率拒答率越低 越无审查。同时测了 thinking 关闭 / 开启两种模式测试集样本量基座关思考/开思考本模型关/开AdvBench100 / 6099.0% / 66.7%0.0% / 1.7%JailbreakBenchharmful100 / 6094.0% / 43.3%0.0% / 0.0%StrongREJECT150 / 6097.3% / 35.0%2.0% / 0.0%HarmBenchstandard150 / 6098.7% / 46.7%2.7% / 0.0%MaliciousInstruct100 / 6099.0% / 83.3%0.0% / 0.0%SimpleSafetyTests5064.0% / 44.0%6.0% / 0.0%ForbiddenQuestions150 / 6073.3% / 48.3%4.7% / 0.0%自定义探针中英1163.6% / 45.5%0.0% / 0.0%三个值得注意的现象拒答率断崖式下跌基座对 AdvBench、MaliciousInstruct 的拒答率高达 99%本模型降到 0~2%——对齐方向确实被移除开思考模式后更彻底thinking ON 时几乎所有测试集拒答率归零说明推理链路也不会找回被移除的拒答行为残余拒答集中在 SimpleSafetyTests / ForbiddenQuestions6.0% / 4.7%这两套测试混有边界模糊的软案例说明模型并非对任何输入都无条件配合✅ 过度拒答测试XSTest 数据去审查模型常见的副作用是矫枉过正或过度顺从。XSTest-safe250 条良性提示误拒率越低越好结果模型关思考开思考基座 FP85.6%0.0%本模型0.4%0.0%误拒率从 5.6% 降到 0.4%——良性请求基本不再被误杀这对日常使用写代码、问答、翻译是实打实的体验提升。 数据可信度说明这些数字是怎么来的引用数据前先说清楚测量口径同样来自 README.md拒答判定使用基于开头短语的规则分类器属于指示性数字不是 LLM 评审或发表级精度能力基准与本模型为同一去对齐构建vLLM 提供服务与官方 FP8 用完全相同的脚本和设置GGUF 各量化是确定性派生行为上继承上述结果但低位宽Q2_K / Q3 档会额外损失一些质量这是量化本身的规律 快速上手Ollama 与 llama.cpp 运行方法最简单的方式是用 Ollama视觉投影已内置16 个量化标签任选ollama run orcarouter/Qwen3.8-27B-Uncensored # 默认 q4_K_M ollama run orcarouter/Qwen3.8-27B-Uncensored:iq4_xs # 指定量化若手动使用 llama.cpp下载主模型与 mmproj 后用llama-server加--mmproj参数即可获得视觉 工具调用 推理的 OpenAI 兼容服务开启--jinja启用工具模板推理thinking默认开启可按请求切换。注意需使用近期源码编译的 llama.cpp需包含 qwen35 混合 GDN 架构与 MTP/nextn 头旧版本无法加载这些文件。 硬件与显存24GB 显卡跑哪个量化显存/内存估算公式≈ 文件大小 KV 缓存 视觉时0.9 GB mmproj。24 GB 显卡Q4_K_M16.8 GB非常从容还能留出上下文空间16 GB 显卡IQ4_XS15.3 GB或Q5_K_S起步CPU 推理可以跑Q4_K_M 档对内存要求约 20 GB 上下⚖️ 合规提醒该模型通过 abliteration 移除了安全对齐会响应原始 Qwen3.8-27B 会拒绝的请求。发布方明确其用途限定为合理解释性研究、AI 安全/拒答机制研究、红队测试与鲁棒性评估。使用前请确认遵守 Apache 2.0 许可与所在地法律法规、自行承担责任并在任何实际部署前加装自己的安全与审核层。 总结维度结论智力水平MMLU 84.7% / GSM8K 88.7%与基座差距 ≤1.3 分 ✅去对齐效果有害提示拒答率 99% → 0~6%开思考后几乎归零 ✅副作用良性误拒率降至 0.4%中文与数学基本无损 ✅使用建议默认 Q4_K_M显存紧张选 IQ4_XS研究用途务必自建审核层 ⚠️对于需要做安全研究或模型行为分析的开发者这组数据说明 abliteration 后的 Qwen3.8-27B 在保留几乎全部能力的同时提供了可预期的无审查行为基线——而低比特量化2~4-bit虽能让它跑进消费级硬件代价是额外的质量衰减选型时请以 IQ 系列优先。【免费下载链接】Qwen3.8-27B-Uncensored-GGUF项目地址: https://ai.gitcode.com/hf_mirrors/orcarouter/Qwen3.8-27B-Uncensored-GGUF创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表