4.1 环境准备与工具选型:引擎 / 格式 / 硬件账本 读者读完这节,能带走的结论 别一上来就下载模型。先算清显存账本、再选定「GGUF + llama.cpp」这条最稳的实战路线,最后把软件栈和工具链装齐——这三步做对,后面量化基本不会翻车。 新手 90% 的挫败感来自同一个错误:兴冲冲下完几十 GB 权重,才发现显卡装不下,或者装下了但推理速度慢到不可用。这一节就是帮你把「能不能跑、跑得爽不爽、用什么跑」在动手前想明白。 一、先算硬件账本:你的显存到底装不装得下 本地推理的第一约束永远是显存(VRAM)。一个模型的「原始权重体积」和「量化后体积」差了数倍,而你的显卡只有固定的一池水。
别一上来就下载模型。先算清显存账本、再选定「GGUF + llama.cpp」这条最稳的实战路线,最后把软件栈和工具链装齐——这三步做对,后面量化基本不会翻车。
新手 90% 的挫败感来自同一个错误:兴冲冲下完几十 GB 权重,才发现显卡装不下,或者装下了但推理速度慢到不可用。这一节就是帮你把「能不能跑、跑得爽不爽、用什么跑」在动手前想明白。
本地推理的第一约束永远是显存(VRAM)。一个模型的「原始权重体积」和「量化后体积」差了数倍,而你的显卡只有固定的一池水。先建立一张对照表,建立直觉:
| 显卡常见配置 | 可用显存 | 大致能装下的 INT4 模型规模 | 备注 |
|---|---|---|---|
| 入门独显(如 8GB 档) | ~8 GB | 7B~8B 级别 INT4 | 勉强够用,上下文不能开太大 |
| 主流独显(如 16GB 档) | ~16 GB | 14B~32B 级别 INT4 | 本地部署甜点区 |
| 高端独显(如 24GB 档) | ~24 GB | 32B~70B 级别 INT4 | 可兼顾较长上下文 |
| 双卡 / 大显存工作站 | 48 GB+ | 70B 级别 INT4 | 进阶玩家 |
关键提醒:显存不是只装权重。推理时还要留出 KV Cache(随上下文长度增长)、激活值、框架开销。第 3 章讲过 KV Cache 账本,这里实操时务必给上下文留余量——别把显存算满到 100%,留 10%~20% 更稳。
本地推理的「引擎 + 格式」有几条主流路线,它们不是谁高级谁低级,而是适用场景不同:
我建议绝大多数本地部署从 GGUF + llama.cpp 起步,理由是:
GPTQ / AWQ 路线在你已经深度绑定 Hugging Face transformers 训练栈时有价值;EXL2 在「显存抠到极致、只要 GPU 速度」时更强。但作为第一套能跑通的方案,GGUF + llama.cpp 的性价比最高。
下面给出一条参考性的安装结构。工具版本迭代很快,具体命令参数请以你拉取版本内的说明或 --help 为准,我不替你臆造某一版本的精确输出。
典型的准备步骤是:
llama-cli、llama-server、llama-quantize、llama-perplexity 等可执行文件。一个常见坑:只装了 Python 包却忘了编译原生后端,结果推理全跑在 CPU 上慢得怀疑人生。验证方法很简单——运行一次推理,看日志里有没有加载到 GPU 后端的提示;没有就回去检查编译选项。
理清每个工具「负责哪一段」,你就不会在量化时找错命令:
量化工具链活跃度很高,命令名、参数、默认档位都可能随版本变化。我的建议是:把每个工具的 --help 输出当作当前版本的「事实来源」,本章给出的命令结构是真实可参考的骨架,但落到你机器上请以本机为准。涉及具体模型发布格式(如 DeepSeek 官方权重分片方式、分词器类型),一律以官方发布说明为准,不臆造。
出门(下载权重)前,逐项打勾:
全部打勾,再进入 4.2 真正动手。
Q:我只有核显 / 没有独显,还能玩吗?
A:能,但慢。llama.cpp 支持纯 CPU 推理,小模型(如 7B INT4)在好一点的 CPU 上能跑到勉强可用的速度。把它当成「能跑通、验证流程」的环境,别指望流畅对话。
Q:GGUF 和 GPTQ 我到底选哪个?
A:第一次部署、想省心、要可搬运——选 GGUF。已经深度用 transformers 训练栈、且只跑 GPU——再考虑 GPTQ/AWQ。
Q:显存刚好卡在边界怎么办?
A:优先降上下文长度(KV Cache 占显存大户),其次换更激进的量化档位,最后才考虑换更小模型。顺序别反。