本路径帮助你在约 1 周内掌握模型量化的基本流程,并完成从原始模型到可部署量化模型的完整实践。
阶段一:理解与选型(1 天)
- 阅读 模型量化入门 与 深度解析
- 确定目标:本地运行选 GGUF,GPU 生产选 AWQ/GPTQ
- 准备环境:Python、CUDA(若用 GPU)、llama.cpp 或 AutoGPTQ
阶段二:GGUF 量化实践(2–3 天)
- 下载 7B 级原始模型(如 Qwen2-7B-Instruct)
- 使用 llama.cpp 转为 GGUF 并量化为 Q4_K_M
- 用 Ollama 或 llama-cli 加载并测试
- 对比 FP16(若条件允许)的显存与输出质量
阶段三:GPU 量化(可选,2–3 天)