加载中...

llama.cpp 是保加利亚开发者 Georgi Gerganov 于 2023 年发起的开源项目,用纯 C/C++ 实现大语言模型推理,无需 Python 环境与重型框架,最初为在 MacBook 上运行 Llama 模型而写,现已支持数百种模型架构。
基于自研的 ggml 张量库,支持 CPU(AVX、NEON)与多种 GPU 后端(CUDA、Metal、Vulkan);定义了 GGUF 模型格式,配套从 2 比特到 8 比特的多档量化方案,让大模型装进消费级内存;提供命令行工具、OpenAI 兼容的服务端与各语言绑定。
llama.cpp 极大推动了大模型的本地化与平民化,是端侧推理事实上的标准底座:Ollama、LM Studio 等流行工具均构建其上,社区在 Hugging Face 上传的 GGUF 量化模型数以万计。

登录 后参与讨论
暂无讨论,来发表第一条评论吧