llama.cpp 量化到 GGUF 全流程,从 fp16 到 Q4_K_M 一次说清唐老师·2024/10/13·855 阅读不同量化等级的显存占用、推理速度、质量损失实测对比,以及转换脚本里那些容易写错的参数。#本地部署#量化#llama.cpp