尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

大模型黑话解释

大模型黑话解释 大模型黑话解释听人说「上个 Q4」「别全参上 LoRA」「KV 打满了」时用。量化单独讲透其余按场景对照。1. 量化Quantization一句话用更少的比特去存模型权重换显存和速度略微牺牲精度。模型里每个参数本来是高精度小数。训练和「原版推理」常用 16 位浮点FP16 / BF16每个数 2 字节。70 亿参数7B光权重就大约7e9 × 2 字节 ≈ 14 GB消费级显卡往往只有 8GB、12GB。量化做的事就是把这些数压成 8 位、4 位甚至更低你听到的大约位宽7B 体积量级直观感觉FP16 / BF1616 bit14 GB原汁原味训练常用Q8_08 bit7–8 GB几乎无损Q5_K_M~5 bit5–6 GB质量和体积都要Q4_K_M~4 bit4–5 GB本地默认Ollama 最常见Q3 / IQ23 bit 及以下3 GB 以下能跑就行质量掉得快像照片从无损压成 JPEG日常看不出来把细节放大才有噪点。所以「Q4 就能跑」不是偷工减料是为了把模型塞进你的机器。1.1 文件名怎么读Ollama / llama.cpp 用的权重格式叫GGUF。名字里的档位例如Q4_K_M约 4bitK 表示按块混合量化比早期Q4_0细M 是 medium比 S 肥、比 XL 瘦Q8_08bit质量接近原版Q5_K_M介于 Q4 和 Q8 之间经验日常 Q4_K_M要质量升 Q5 / Q8显存不够再降 Q3。别一上来用 IQ2。1.2 量化不是这些东西黑话它在干什么和量化的差别蒸馏 Distillation另训一个小模型去模仿大模型换了一套权重不是把原权重存糙LoRA冻住原模型另贴一小层来微调是训练方法不是压缩格式QLoRA先把原模型量化再做 LoRA量化是为了训得动不是为了上线体积GPTQ / AWQGPU 上的量化方案和 GGUF 不是一条产线vLLM 常用 AWQOllama 常用 GGUF1.3 显存炸了不一定是没量化权重量化主要缩小模型文件。对话一长真正往上爬的是KV Cache注意力的缓存跟上下文长度、并发、层数有关。长文档 OOM优先怀疑 KV而不是「Q4 还不够狠」。2. 现场翻译原话人话上 Q4_K_M 的 14Bctx 32k140 亿参数、约 4bit 量化上下文开到约 3.2 万 token。812GB 显存常见能跑别全参LoRA 贴一下不要改全部权重。冻住原模型只训一小块适配器先 RAG别先微调知识会变、要可追溯就检索后回答。微调改的是习惯和技能不是权重大是 KV 打满了模型文件没超是长上下文的缓存把显存吃完了温度调低开 JSON mode少随机强制按结构吐适合抽取和接口这是 MoE激活 13B总参数更大但每次只跑一部分专家。硬盘按总量算力更接近激活量3. 模型长什么样参数量7B / 14B / 70BB Billion 十亿个可学习数字。参数多通常更强也更吃显存。比较模型时先看参数量再看量化档、上下文、是不是 MoE。稠密 vs MoE稠密每次推理走完全部权重。MoEMixture of Experts一排专家路由只叫醒其中几个。所以会听到「总参数 47B、激活 13B」——硬盘按总量算力更接近激活量。显存仍可能按总参数估别只看激活量下单。Transformer现在聊天模型几乎都是 Decoder-only Transformer从左到右一个 token 一个 token 生成。多模态 / VLM能看图、听声。能看不等于 OCR 专精发票表格、印章、小字仍可能翻车。4. 推理与部署Token模型读写的最小碎片不是「一个汉字」或「一个英文单词」。英文大约 1 token ≈ 0.75 词中文常 1 字 ≈ 12 token。计费、窗口、速度都按 token 算。上下文窗口ctx / num_ctx / 32K / 128K模型一次能「看见」的 token 上限含输入 输出。窗口越大KV Cache 越吃显存。标称 128K 不等于默认就按 128K 跑。推理 Inference用训好的模型生成答案。聊天、补全、工具调用都是推理不是训练。Prefill / Decode先一次性读完提示prefill吃算力再逐字往外吐decode吃显存带宽。长文档卡住常常慢在读入。首字延迟 TTFT / 吞吐 TPS多久开始说话以及每秒能吐多少字。产品体感差先看 TTFT。运行时 ≠ 模型Ollama / llama.cpp 是本地引擎GGUF。vLLM 是 GPU 高并发引擎。Qwen / Llama 才是模型。前者是跑步机后者是运动员。5. 训练与微调预训练 Pretrain在海量文本上学会语言得到base。base 很会续写不一定会听话聊天。SFT监督微调用「问题–答案」对把基座教成助手。数据质量比数量更重要。RLHF / DPO用「哪个更好」而不是标准答案把口味调正。DPO 工程上更常见GRPO 多出现在推理模型讨论里。LoRA不改原权重另贴一小层低秩矩阵。产出是很小的 adapter可插拔。细节见《LoRA 微调原理与实战》。全参微调所有权重都训练。数据少容易过拟合还可能灾难性遗忘新的会了旧的忘了。多数业务优先 LoRA。蒸馏让小模型模仿大模型的输出把能力压缩进去。不是量化。6. 提示与生成Prompt / System prompt你喂给模型的输入。System 放身份和硬规则User 放本次任务。思维链 CoT先分步想再给结论。普通模型靠提示诱发推理模型会自己长考。多花 token。温度 Temperature / Top-p控制「有多敢花样」。00.3 求稳抽取、JSON0.71.0 求活写作。先动温度别两个一起乱拧。幻觉 Hallucination流畅、自信但事实是假的。模型在补「最像真的」的下一句不是在查资料。对策RAG、要求引用、低温、允许说不知道、工具查真源。7. 检索增强RAGRAG先查资料再生成把私有知识临时塞进上下文。适合会变的知识库。微调改行为RAG 更新知识。Embedding把文本变成向量相近意思在空间里靠近。对话模型负责写embedding 模型负责找。两者不是同一个模型。切块 Chunking长文切成检索单元。太大检索糙太小语义断。重叠是为了避免关键句落在切口上。切块策略往往比换模型更影响效果。混合检索关键词BM25抓订单号、SKU向量抓同义改写。Rerank向量先粗召回一堆再用更准的模型把真正相关的顶上来。常见召回 20精排留 5再塞给 LLM。8. Agent 与工具Agent不只回答还会规划、调工具、看结果再继续。可靠性取决于工具边界和停止条件不取决于把提示词写得更像人。工具调用 Function calling模型输出「调哪个函数、参数是什么」由你的程序真去执行。模型不直接碰数据库。MCP给 Agent 接工具、接数据源的一种标准协议。ReActThought → Action → Observation 循环。没观察就行动容易幻觉调用没停止条件会死循环。9. 评测与对齐对齐 Alignment让模型听人话、少作恶而不只是会续写。base没对齐chat/instruct对齐过。Guardrail 是外挂过滤。跑分 / 榜MMLU 偏知识HumanEval 偏代码GSM8K 偏数学Arena 偏人气。刷榜和你的业务场景不是一回事。以自己的评测集为准。10. 容易搅在一起的几对甲乙别混的原因量化蒸馏量化压同一套权重蒸馏是另训一个小模型微调RAG微调改模型行为RAG 临时塞资料Token字 / 词计费和窗口按 token不是按汉字个数参数量上下文长度7B 是脑子大小32K 是一次能看多长Embedding 模型对话模型一个负责找相似段落一个负责写回答OllamaQwen / Llama前者是跑步机后者才是运动员AgentChatbotAgent 会调工具、多步循环聊天机器人通常一问一答FP16Q4都是精度档。FP16 接近原版Q4 是本地默认压缩档和本仓库其它文的关系LoRA 原理与实战《LoRA 微调原理与实战》本地选型和显存表《Ollama 开源大模型推荐》检索链路RAG / GraphRAG 相关文本文只负责把黑话翻译成人话。
返回列表