专栏:大模型应用开发:从原理到生产篇号:42建议标签:模型压缩、量化、知识蒸馏、KV Cache、大模型推理一个大模型应用真正上线以后,最先暴露的问题通常不是“模型会不会回答”。而是另外四个问题:显存不够。响应太慢。并发上不去。成本压不住。这四个问题会把一个看起来不错的 Demo 拖回现实。试用时,只有几个人提问,系统很聪明。上线后,几十个、几百个用户同时进来。有人上传长文档,有人要求生成报告,有人连续追问十几轮。很快你就会看到 GPU 显存飙升、首 Token 变慢、队列开始堆积、成本曲线往上翘。这时候团队很容易下意识地问:要不要换更好的显卡? 要不要上更大的模型? 要不要直接私有化一套集群? 要不要把模型量化到 4-bit?这些问题都可能有价值。但它们不应该是第一反应。第一反应应该是:先确定瓶颈在哪里,再决定用哪一种优化手段。模型压缩和推理优化不是一套魔法。它们本质上是在效果、速度、显存、成本之间做可验证的取舍。