4.4 常见报错排查与性能调优 模型能跑起来只是开始。真正部署 INT4 模型时,你会遇到各种报错和性能问题——有些是量化特有的,有些是 llama.cpp 通用问题,还有些是硬件层面的。这一节把我积攒的常见报错和调优经验整理出来,按"症状-归因-处置"的方式呈现,让你遇到问题时能快速定位。 我处理过大量的"INT4 模型跑得不对"求助,发现绝大多数问题集中在几个固定类型上。掌握这几个类型的判断方法,能解决 80% 以上的故障。 报错一:加载阶段就失败 CUDA error: out of memory 这是最高频的报错,通常发生在加载大模型或设置长上下文时。根因是显存不够,但要分清是哪种不够。 第一种是权重本身就放不下。