它是什么
把模型里存放数字的位宽从高位宽降到低位宽,体积随之明显变小,跑起来也更省显存和内存。
为什么重要
它解释了「为什么同一个模型量化之后才在笔记本上跑得动」,也决定了你本地部署到底需要什么配置的硬件。
打个比方
像把高清照片压成普通清晰度的图片:文件小了一大截,细节有些损失,但大多数场合照样看得清。
举个例子
想在笔记本上用 Ollama 跑一个开放权重模型,下载页会看到 4-bit、8-bit 这类量化版本,体积差异很大;档位越低越省显存,同时要接受答案细节和长文本表现上的下降。
常见误解
误解:量化后还是同一个模型,只是变小了。 事实:它是一次取舍,数值有损,个别任务(尤其代码和复杂计算)的表现会明显下滑。
误解:位宽越低越好。 事实:低于可用档位后速度和体积都不会再明显改善,答案质量却继续往下掉。
误解:量化能让模型变得更聪明。 事实:它只改变存储和计算方式,不会带来任何新能力。
误解:量化版本可以按原版的方式随便加载。 事实:量化通常要配对应的推理框架和配置,直接套用原版方法容易出错。
延伸阅读(相关概念)
本页内容更新于 2026 年 9 月 28 日。概念条目会随模型能力变化而修订。