加载中...

GGUF(GGML Universal File)是 llama.cpp 项目于 2023 年推出的模型文件格式,取代早期的 GGML 格式,用于存储量化后的大语言模型权重及其运行所需的全部元数据。
GGUF 为单文件二进制格式,包含键值对元数据(模型架构、分词器、上下文长度、量化类型等)和按张量组织的权重数据,支持内存映射(mmap)加载,启动快且省内存。
社区常见的 Q4_K_M、Q5_K_M、Q8_0 等后缀表示不同的量化位宽与分组策略,位数越低体积越小、精度损失越大,用户可按硬件条件权衡选择。
Ollama、LM Studio、llama.cpp 等本地推理工具均以 GGUF 为标准格式;Hugging Face 上有大量社区转换的 GGUF 模型,下载后即可在消费级设备离线运行。

登录 后参与讨论
暂无讨论,来发表第一条评论吧