5.1 硬件需求分析


5.1 硬件需求分析

本节摘要:本地推理对硬件的诉求与训练、与图形渲染都不同——显存容量决定"能不能跑",显存带宽决定"跑多快",CPU 与内存决定"没有 GPU 时的下限"。本节给出一套可执行的容量估算方法、四类典型配置的选型建议,以及动手前的验证命令,让预算落在刀刃上。

先算清三笔账:容量、带宽、算力

容量账。 一个量化模型运行时的内存需求 ≈ 权重体积 + KV 缓存 + 少量运行时开销。Q4_K_M 量化下,参数量与权重大致是"1B 参数 ≈ 0.6GB":7B 模型约 4.5GB,14B 约 9GB,32B 约 20GB,70B 约 40GB。KV 缓存按上下文线性增长,8B 模型开 8K 上下文约再占 1GB 上下(fp16 下)。结论很直接:显存/统一内存必须同时装下这两块,"按模型文件大小买显存"会差半档。

带宽账。 解码阶段每生成一个 token,都要把全部权重读一遍,因此生成速度的天花板 ≈ 显存带宽 ÷ 权重体积。4090 带宽约 1TB/s,跑 Q4 的 7B(4.5GB)理论上限约 220 tokens/s;Apple M2 Max 统一内存带宽 400GB/s,同模型上限约 80 tokens/s——这就是"同为 7B,Mac 比 4090 慢"的物理原因,与算力关系不大。选购显卡时,带宽(GDDR6X/HBM、位宽)比核心数量更值得看。

算力账。 预填充阶段是并行矩阵乘,吃的是 TFLOPS。它决定首字延迟——prompt 越长,首字越慢。多数交互场景对此不敏感,但长文档问答(几万 token 的输入)会把它放大成十几秒的空白,此时显卡的算力才真正值钱。

验证带宽与算力是否到位:

# Linux:查看 GPU 显存余量与利用率 nvidia-smi --query-gpu=memory.total,memory.used,utilization.gpu --format=csv -l 2 # macOS:统一内存带宽与余量(需装 asitop / sudo powermetrics) sudo powermetrics --samplers gpu_power -i 1000 -n 1

四类典型配置的选型建议

苹果 Silicon Mac。 统一内存让"大模型"变得平易近人:16GB 可舒适跑 7B-Q4,32GB 可跑 14B 甚至 32B-Q4(速度十几个 token/s,可用但不快),64GB 以上可以考虑 70B-Q4 慢速跑。选购时内存档位比芯片档位重要——M 芯片的 Pro/Max 主要差异就在带宽。

NVIDIA 独显。 8GB(4060)只能 7B;12GB(4070)可到 14B-Q4;16GB(4080/4060Ti16G)可到 14B 舒适、32B-Q4 勉强;24GB(3090/4090)是性价比甜蜜点,32B-Q4 全层入卡,二手 3090 至今仍是本地推理圈硬通货。多卡可叠加容量,Ollama 自动识别。

AMD / Intel。 ROCm 支持 RX 6700 以上与大部分 7000 系列,Linux 下体验最好;Intel 核显/独显走 IPEX-LLM 或 SYCL 后端。两家都可用 OLLAMA_INTEL_GPU / ROCm 相关变量调后端,遇到兼容问题先查 Ollama 的 GPU 文档支持矩阵。

纯 CPU。 不是不能用,而是要管理预期:DDR5 双通道带宽约 80-100GB/s,7B-Q4 大约 10-15 tokens/s,14B 约 5-7 tokens/s,做批量离线任务可以接受,做交互聊天会考验耐心。AVX-512 与内存通道数是 CPU 平台的两个加分项。

动手前先验证:三步摸底法

第一步确认探测结果——Ollama server 日志开头会打印检测到的设备:

# Linux 服务日志 journalctl -u ollama --no-pager | grep -i -E "gpu|cuda|metal|offload" # 快速冒烟:看速度统计 ollama run qwen2.5:7b --verbose "1+1="

第二步看驻留分布,权重进了显存还是溢出到内存:

ollama ps # SIZE_VRAM 小于 SIZE 说明部分层落在内存,速度会被拖慢

第三步做横向对比,同一模型不同量化各跑一次 --verbose,记录 eval rate,选"再压一档损失明显"之前的那个档位作为日常用档。

场景反推配置:三个真实例子

例子一,个人知识库问答。7B-Q4 + 8K 上下文 + 嵌入模型,16GB 内存的机器即可,核显/入门独显都行,瓶颈在检索质量而非推理速度。例子二,团队代码补全服务。要求低延迟,选 24GB 卡跑 7B-Q5 或专用代码模型,keep_alive 设 -1 常驻,避免加载抖动。例子三,长文档摘要。几万 token 的预填充吃算力,同价位下优先高算力卡(或分段摘要策略绕开硬件限制)。三个例子的共同点是:先定场景指标(延迟、吞吐、上下文长度),再倒推硬件,而不是反过来"买最好的再想用途"。

二手与矿卡话题在本地推理圈绕不开。3090 24GB 因显存大、价格相对低,长期是跑 32B 级模型的首选;二手市场要注意保修状态与显存故障(长时间满载压测验证),以及机箱散热与电源余量——推理虽不如训练持续满载,但 350W 以上的功耗峰值对老旧电源是考验。迷你化方案(ITX 机箱 + 涡轮卡)适合放在客厅当家庭推理服务器,代价是风扇噪音,把 num_predict 与并发控制住、避免长时间满负荷,噪音与寿命都更友好。最后一句给预算极低读者:八年内的旧游戏本(16GB 内存 + 6GB 显卡)跑 7B-Q4 完全够入门,先跑通全流程再谈升级,比一开始就纠结配置更能把钱花对。

预算有限时的取舍优先级:内存/显存容量 > 带宽 > 算力 > CPU 核数 > 存储(NVMe 只影响首次加载)。硬件定了,下一节讲怎么量化和诊断实际跑起来的性能——没有测量的调优都是猜。


作者与出处
原作者: 灏天文库
来源:灏天文库
整理: 灏天文库整理
由灏天文库平台收录,内容或由平台用户上传,仅供学习交流
发布者: 作者: 灏天文库 转发
评论区 (0)
U