想把 DeepSeek V4 这种级别的庞然大物塞进你自己的显卡、甚至纯 CPU 内存里跑起来?本教程用一条「从原理到实战」的清晰主线,带你把大模型量化到 INT4、真正实现本地推理。 与网上零散的「一条命令跑模型」教程不同,本书不回避数学、不隐藏踩坑:第二章把 INT4 量化的 scale/zero-point 与离群点难题讲透;第三章教你用困惑度与回归测试客观度量「模型变笨了多少」;第四章给出覆盖 DeepSeek V4(MoE 架构)的端到端量化部署流水线,并附一份持续更新的真实踩坑清单。 你将收获可复用的选型决策树、混合精度保精度的工程手法,以及一套属于自己的量化回归测试方法论——让你不再盲信平均指标,而是用自己的硬件和任务去实测、去取舍。 目录大纲: 第1章 大模型量化与本地推理入门 —— 为什么要本地推理、量化是什么、INT4 为何是甜点精度 第2章 INT4 量化原理与方法 —— 量化数学、校准集、GPTQ/AWQ/GGUF 三条路径取舍 第3章 量化精度与性能权衡 —— 困惑度度量、带宽真相、KV Cache 隐形成本、混合精度 第4章 实战案例:DeepSeek V4 的 INT4 量化部署全流程 —— 端到端流水线、MoE 特殊账本、踩坑实录 第5章 总结与展望 —— 四问决策清单、MoE 专属量化与多卡分片等进阶方向
正在加载知识图谱...
手机扫一扫转发分享