加载中...

MLC LLM(Machine Learning Compilation for LLM)是陈天奇团队基于 Apache TVM 技术栈开发的开源项目,通过机器学习编译把大语言模型部署到几乎任何硬件平台。
项目使用 TVM 的 Relax 中间表示与 TensorIR 对模型做端到端编译,自动生成 CUDA、ROCm、Metal、Vulkan、OpenCL 与 WebGPU 内核,配合分组量化(如 4 比特)压缩权重,使同一份模型定义可编译到 NVIDIA/AMD 显卡、苹果芯片、安卓手机乃至浏览器。
其浏览器版本 WebLLM 让 Llama、Qwen 等模型完全在网页内经 WebGPU 运行,无需服务器;iOS/Android 演示应用可在手机离线聊天。MLCEngine 还提供 OpenAI 兼容 API 的服务端形态。
MLC LLM 展示了「编译器路线」在推理部署中的通用性价值,是端侧与浏览器内大模型的代表性方案。

登录 后参与讨论
暂无讨论,来发表第一条评论吧