第1章 大模型量化与本地推理入门 导读:为什么我们要把一个动辄数百 GB 的大模型搬回自己的显卡、甚至纯 CPU 内存上跑?这一章帮你建立三件基础认知——量化到底是什么、为什么 INT4 常常是实现本地推理的「甜点精度」、以及本地推理背后真实的硬件账本。读完本章,你应该能用一句话回答「我到底要不要量化、量化到什么程度」,并清楚本教程后续四章将带你走到哪里。 本章你将学到 本地推理的三类核心驱动力:隐私、成本、可控性 拦在本地推理面前的第一道墙:显存 量化的本质:用更窄的数值格式压缩模型 为什么 INT4 对大多数硬件是「甜点精度」 全书五章的阅读路线 动手前如何自检「我到底该不该本地量化」 一张一次算清的显存总账表 1.
导读:为什么我们要把一个动辄数百 GB 的大模型搬回自己的显卡、甚至纯 CPU 内存上跑?这一章帮你建立三件基础认知——量化到底是什么、为什么 INT4 常常是实现本地推理的「甜点精度」、以及本地推理背后真实的硬件账本。读完本章,你应该能用一句话回答「我到底要不要量化、量化到什么程度」,并清楚本教程后续四章将带你走到哪里。
把大模型部署到本地,而不是每次都调用云端 API,核心驱动力通常有三类。第一是数据主权与隐私:企业内部的合同、病历、代码仓库,往往不允许离开内网。第二是成本与延迟:当调用量达到每天数十万次时,按 token 计费远贵于一次性买卡;本地推理的边际成本趋近于电费。第三是可控性与可定制:你可以自由更换上下文长度、挂载私有知识库、做量化与蒸馏的实验,而不受服务商版本节奏约束。
但本地推理的第一个拦路虎永远是显存。一个参数为 N(单位:十亿,即 B)的稠密模型,在 FP16 下每参数占用 2 字节,显存需求约为 2×N GB。以 70B 级别模型为例,FP16 权重本身就吃掉约 140GB 显存,这还不包括推理时的激活值、KV Cache 与框架开销。即便是消费级旗舰显卡(24GB 显存),也远远装不下。
一句话拿走:本地推理的「墙」不是算力,是显存——而显存正是由参数规模与精度共同决定的。
量化的本质,是用更窄的数值格式表示模型权重(有时也包括激活),从而成倍压缩显存占用与带宽需求。常见精度阶梯大致是:FP32(4 字节)→ FP16/BF16(2 字节)→ FP8(1 字节)→ INT8(1 字节)→ INT4(0.5 字节)→ 更激进的 2–3 bit。
直觉上,精度越低越省资源,但精度越低、信息损失越大、模型「变笨」的风险越高。所以量化不是无脑压到最小,而是在可接受的精度损失下,压到能塞进你硬件的最小格式。对绝大多数消费级与工作站级硬件而言,INT4 往往就是这个甜点:它把 70B 模型的权重从约 140GB 压到约 35–40GB,让原本需要多张数据中心级显卡的任务,有可能落到单张 48GB 专业卡、甚至通过 CPU 内存卸载的方式在普通机器上跑起来。
一句话拿走:量化不是「越狠越好」,而是在「装得下」和「不变笨」之间找那个甜点,INT4 对多数本地硬件恰好落在甜点上。
原因有三。其一,带宽友好:推理时权重要从显存/内存搬到计算单元,INT4 把搬运量砍到 FP16 的四分之一。其二,硬件支持广:现代 GPU 与不少 CPU 的矩阵单元都对 INT4/INT8 点积有专门加速;llama.cpp 等推理引擎更是把 INT4 做到了极致的 CPU/GPU 通用支持。其三,生态成熟:从 GPTQ、AWQ 到 GGUF,INT4 级别的工具链最完整,社区踩坑最多,新手最容易搜到答案。
当然,INT4 不是银弹。它对小模型(如 7B 以下)的精度损伤通常比大模型更明显,对「需要严格数值稳定」的任务也可能出现退化。正因如此,本教程第 3 章会专门讲「精度与性能的权衡」,教你用混合精度把关键层保留在更高精度。
第一章给你「要不要做、为什么做」的判断框架;第二章深入 INT4 的数学与三条主流量化路径;第三章教你权衡与度量精度损失;第四章是完整的本地部署实战,含真实踩坑;第五章收口成一张可直接复用的决策清单与进阶方向。
在跳进工具链之前,先用三句话替自己把需求问清楚。这不是走过场,而是避免「辛苦量化完发现根本用不上」的关键一步:
只有「数据不能出域」或「规模大/硬件装不下」至少命中其一,本地量化才值得你投入。三者都不命中时,老实调 API,把精力放在业务上。
需要提醒的是,这条自检不是「一票否决」:即便你当前调用规模不大,只要「数据不能出域」这一条成立,本地量化就仍然值得做——合规红线往往比成本更硬。自检的真正作用是帮你把投入花在刀刃上,而不是盲目启动一个本可暂缓的工程。
很多新手栽在「只算了权重,忘了 KV Cache」上。这里给你一张一次算清的账本模板,照着填就不会漏:
以「INT4 的 70B 模型、上下文 8K、批大小 1」为例粗算:权重约 35GB(70×0.5);KV Cache 取决于层数与隐藏维度,粗略在数 GB 量级;激活值视实现在 1–3GB。三者相加约 40GB 出头。这意味着单张 48GB 专业卡刚好能跑,而 24GB 消费卡就不够——必须靠 CPU 卸载或降上下文。把这张账本填进你自己的模型参数,就能在动手前预判「这卡到底行不行」,而不是加载到一半才 OOM。
为了把账本讲透,给你一个具体的对照:假设你手里是一张 24GB 显存的 RTX 4090,想跑 INT4 模型。7B 的 INT4 权重约 3.5GB、加 KV Cache 与激活总量约 6GB,24GB 卡绰绰有余,还能开较长上下文;13B 的 INT4 权重约 6.5GB、总量约 10GB,同样轻松;但 70B 的 INT4 总量约 40GB,24GB 卡直接装不下——此时只有两条路:要么降到更小模型,要么走 CPU 卸载(用内存顶上、速度变慢)。这个对照想传递的直觉是:先按「卡的大小」反推「能跑多大模型」,再谈量化方法,顺序不能反。
读到这里,你应该能用一句话概括第一章:本地推理的价值在于隐私、成本与可控,而它的唯一硬约束是显存——量化到 INT4 是把巨型模型请回本地机器的核心杠杆,但动手前要先确认需求成立、并把显存总账算清楚。
带着这个框架,第二章我们钻进 INT4 的数学与三条主流量化路径(GPTQ、AWQ、GGUF),看清它们各自如何聪明地「保住精度」;而第一章的 1.1、1.2、1.3 三节子文档,已分别就动机、概念、工具链做了更深入的展开,可按需回看。