大模型量化全景解析:历史、术语、算法体系与现代工程实践
· 59 min read
量化不是“把模型变小”这么简单。它是一套横跨数值表示、压缩算法、硬件指令、推理内核、模型结构、评测方法和部署系统的工程体系。
本文讨论的是 AI/LLM 模型量化,不是金融量化交易。
如果用一句话解释:模型量化是把原来用高精度浮点数表示的权重、激活、KV Cache 或梯度,映射到更低比特的离散表示,从而降低显存、内存带宽、存储和计算成本。
它看起来像一个“压缩模型”的技巧,但真正落地时会牵涉到:
- 数学:舍入、缩放、零点、误差传播、率失真;
- 模型:权重、激活、注意力、MoE、视觉塔、LoRA;
- 算法:PTQ、QAT、GPTQ、AWQ、SmoothQuant、QLoRA、AutoRound;
- 格式:GGUF、GPTQ、AWQ、bitsandbytes、safetensors、compressed-tensors;
- 硬件:CPU SIMD、GPU Tensor Core、FP8、INT8、INT4、FP4、NPU;
- 内核:GEMM、GEMV、weight packing、dequant fusion、KV Cache;
- 服务:prefill、decode、continuous batching、PagedAttention、吞吐与延迟;
- 评测:困惑度、MMLU、GSM8K、长上下文、领域集、安全与回归。
本文从历史讲起,再把专有名词、复杂体系、现代方法和开源生态串成一张完整地图。
图 1 把量化放到完整工程链路里看:先有 FP16/BF16 基座模型和校准样本,再统计权重/激活分布,选择量化粒度和算法,最后打包成 GGUF、GPTQ、AWQ、compressed-tensors 等制品,并交给 vLLM、llama.cpp、TensorRT-LLM 或 Transformers 这类 runtime 执行。任何一个环节选错,都会出现“文件很小但速度不快”“benchmark 没掉但业务格式崩了”“同样 4-bit 在不同框架结果不同”这类问题。