4.3 INT4 模型的加载、运行与对话验证 4.1 和 4.2 走完了"算账、选型、转换、量化"四步,你手里应该已经有一个 Q4KM 的 GGUF 文件了。但很多新手到这一步反而卡住——文件有了,怎么让它真正"对话"起来?怎么确认量化后的模型没坏、质量还在可接受范围?这一节就把"从量化文件到可用对话服务"这最后一公里讲透,包括 llama.cpp 的加载参数怎么调、对话怎么验证、以及量化前后质量怎么对比。 我见过不少人在这一步翻车。最典型的是加载参数没调对,明明有 GPU 却跑在 CPU 上,慢得像乌龟;或者上下文长度开太大导致显存爆掉;又或者量化后模型"能跑但答非所问",却不知道是量化损失还是 prompt 写错了。这些坑都在这一节覆盖。 用 llama.