尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

Qwen3.6-35B-A3B-uncensored-heretic 去审查化部署:从拉取权重到跑通首次响应

Qwen3.6-35B-A3B-uncensored-heretic 去审查化部署:从拉取权重到跑通首次响应 Qwen3.6-35B-A3B-uncensored-heretic 去审查化部署从拉取权重到跑通首次响应【免费下载链接】Qwen3.6-35B-A3B-uncensored-heretic项目地址: https://ai.gitcode.com/hf_mirrors/llmfan46/Qwen3.6-35B-A3B-uncensored-heretic这是 Qwen3.6-35B-A3B-uncensored-heretic 的去审查化部署版本拒绝率从 83/100 降到 10/100KL 散度仅 0.0015。本文给出最短路径准备环境、用 vLLM 拉起服务、发出首条响应。先说结论——它和原版差在哪该版本基于 Heretic v1.2.0 的 MPOA 消融方法生成只改写了注意力与 MLP 投影层中负责拒绝方向的权重其余能力原样保留。对部署方来说推理参数、精度与上下文能力都和原版一致唯一需要评估的是内容边界放宽。原版 Qwen3.6-35B-A3B去审查版拒绝率 83/100拒绝率 10/100KL 散度 0定义基准KL 散度 0.0015MMLU 综合 83.72%与基线持平见下文实测下面直接进入操作。从零到首次响应环境要求Python 3.8完整精度权重需要一块 80GB 显存的 GPU显存不足时改加载 4bit 量化权重即可。git clone https://gitcode.com/hf_mirrors/llmfan46/Qwen3.6-35B-A3B-uncensored-heretic cd Qwen3.6-35B-A3B-uncensored-heretic pip install transformers torch accelerate vllm权重就位后在模型目录内直接启动 vLLM 服务VLLM_ALLOW_LONG_MAX_MODEL_LEN1 vllm serve . \ --max-model-len 262144 --port 8000若偏好 SGLang把启动命令替换为SGLANG_ALLOW_OVERWRITE_LONGER_CONTEXT_LEN1 python -m sglang.launch_server --model-path . --port 30000其余步骤不变。服务就绪后发一条测试请求curl http://localhost:8000/v1/chat/completions \ -H Content-Type: application/json \ -d {model: Qwen3.6-35B-A3B-uncensored-heretic, messages: [{role: user, content: 用一句话介绍你自己}]}返回 JSON 中出现choices[0].message.content即首次响应成功。关键参数逐项说明--max-model-len — 上下文长度上限 — 推荐 262144模型原生支持 262,144 tokens。vLLM 默认会拦截超长上下文的启动需加VLLM_ALLOW_LONG_MAX_MODEL_LEN1放行显存吃紧时下调该值可换得更大的 KV 缓存。enable_thinking / preserve_thinking — 思维链开关 — 默认均开启聊天模板中enable_thinking默认 truepreserve_thinking默认 true保留历史轮次的思考痕迹。短答或流式场景可关闭思考以节省 tokenextra_body { chat_template_kwargs: { enable_thinking: False, preserve_thinking: True } }rope_parameters — YaRN 超长扩展 — 仅在需要超过 262K 时修改默认rope_type为 default要把有效窗口扩到 262K 以上才需将 config.json 中该字段改为 yarn 并设置 factorrope_parameters: { rope_type: yarn, rope_theta: 10000000, factor: 4.0, original_max_position_embeddings: 262144 }多模态输入 — 图像/视频理解 — 默认配置即可仓库自带 preprocessor_config.json 与 video_preprocessor_config.json视觉编码器随主模型一起加载请求体按 Qwen-VL 惯例传图像或视频块即可无需额外配置。实测表现拒绝率 10/100较原版的 83/100 下降 88 个点KL 散度 0.0015输出分布与原模型几乎重合MMLU 综合准确率 83.72%去审查化改动后的基线参照STEM 子项 82.14%与综合分无落差日常对话、代码生成、长文档问答均可直接使用若线上对合规输出有硬性要求建议保留原版权重做对照。上生产前必做的三件事锁定显存预算与量化档位— 先用完整精度跑通基准再按 KV 缓存的实际占用决定是否降到 4bit 量化。收紧访问边界— 服务绑定内网或加 token 鉴权内容边界放宽不等于应当暴露公网。保留一键回滚— 原版权重与同一套服务配置并存出现质量或合规问题时分钟级切回。这个版本用 0.0015 的 KL 散度换来了 88 个点的拒绝率下降适合作为长上下文、少限制的推理服务底座。去审查化参数与消融细节见仓库内的 README.md。【免费下载链接】Qwen3.6-35B-A3B-uncensored-heretic项目地址: https://ai.gitcode.com/hf_mirrors/llmfan46/Qwen3.6-35B-A3B-uncensored-heretic创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表