大模型量化技术:INT8 与 INT4 是什么
果子发表于:2026-10-03 15:02:50浏览:1次
一、为什么需要量化
大模型参数量巨大,默认用 16 位浮点(FP16/BF16)存储,7B 模型就要约 14GB 显存。量化就是用更低精度(如 8 位、4 位)存储权重,大幅降低显存和内存占用,让大模型能在普通硬件上运行。
二、量化是什么原理
简单说,量化把浮点权重「映射」到更少的比特位。比如把一个 0~1 之间的浮点数压缩成 0~255 的整数(8 位),精度损失很小,但存储空间减半。
三、常见精度
- FP16/BF16:默认的 16 位浮点,效果无损。
- INT8(8 位):显存约减半,效果几乎无损,工业界广泛使用。
- INT4(4 位):显存再减半,7B 模型只需约 4GB,损失可控,是本地部署的主流选择。
- 更低位(INT2 等):能省更多但质量下降明显,较少使用。
四、常见量化方案
- GPTQ:基于训练数据校准的量化,适合 GPU 推理。
- AWQ:保护重要权重,效果稳定。
- GGUF + llama.cpp:CPU/GPU 混合推理,Ollama 就用它。
- bitsandbytes:Hugging Face 生态里常用的 4/8 位量化库。
五、量化会损失什么
量化后模型通常「略笨一点」:复杂推理、长文本、代码生成等任务上可能出现轻微下降。所以要在「资源」和「效果」之间权衡。
六、小结
量化是让大模型「落地」的关键技术。理解 INT8/INT4 的取舍,你就能在有限的硬件上跑起更大的模型,这也是本地部署的第一步。

