2026年算法工程师最新必问面试题三:模型量化、RLHF、位置编码、MoE与上下文窗口扩展详解
1. 模型量化(Quantization):FP16、INT8、INT4 的区别模型量化是将模型参数从高精度浮点数转换为低精度数值表示的技术,旨在减少模型存储和计算开销,同时尽量保持模型性能。FP16(16位浮点数):相比FP32,FP16将存储和计算量减半,精度损失极小,是当前大模型推理和训练的主流格式。大多数GPU(如A100、H100)对FP16有原生加速支持。INT8(8位整数):将每个参数从16位或32位压缩到8位,模型体积减少约50%-75%,推理速度显著提升。INT8量化通常需要校准数据集来确定缩放因子和零点,常见方法有对称量化和非对称量化。精度损失在多数任务中可控。INT4(4位整数):进一步压缩到4位,模型体积可减少至原来的1/8左右,但精度损失较大,需要更复杂的量化策略(如GPTQ、AWQ)来补偿。INT4量化在显存受限场景(如消费级显卡部署大模型)中非常实用。三者的核心权衡在于:精度 vs 压缩率 vs 推理速度。FP16适合追求精度的场景,INT8是性价比最高的选择,INT4则适用于极致压缩需求。2. GPTQ 和 AWQ 的原理GPTQ(GPT Post-Training Quantization):一种基于最优脑外科框架(Optimal Brain Surgeon, OBS)的后训练量化方法。其核心思想是逐层进行量化,在量化每个权重时,通过最小化量化误差对输出损失的影响,并利用Hessian矩阵(二阶梯度信