混合专家模型(MoE,Mixture of Experts)是一种将任务拆分给多个「专家」子网络、再由门控网络按需调度的机器学习架构,能在大幅扩充模型参数的同时控制计算量,是当前大语言模型降本增效的主流技术路线之一。

| 类型 | 机器学习模型架构 |
| 英文名 | Mixture of Experts(MoE) |
| 提出时间 | 20 世纪 90 年代初 |
| 核心机制 | 门控网络 + 多专家子网络 + 稀疏激活 |
| 代表应用 | Mixtral、DeepSeek 等大语言模型 |
| 相关概念 | 集成学习、Transformer、稀疏模型 |
混合专家模型(Mixture of Experts,简称 MoE,又译多专家模型、委员会机器)是一种机器学习架构:它把一个复杂任务的输入空间划分成若干子区域,交给多个「专家」子网络分别学习,再由一个门控(gating)网络判断每条输入该交给哪些专家处理,最后汇总各专家的输出得到整体结果。
MoE 的核心思想是「术业有专攻」。传统的稠密模型用同一套参数处理所有输入,而 MoE 让不同专家各自擅长不同类型的数据——门控网络相当于一位调度员,根据输入特征把任务路由给最合适的一个或几个专家。这一思想早在二十世纪九十年代初就已提出,属于机器学习中的经典方法。
近年来 MoE 在大语言模型领域重新走红。原因在于「稀疏激活」:模型总参数量可以做得很大,但每次推理只激活其中少数专家,计算开销远低于同等参数规模的稠密模型。Mixtral、DeepSeek 等知名开源大模型都采用了 MoE 架构,业界也普遍认为多个头部闭源大模型使用了类似技术。
MoE 与集成学习(Ensemble Learning)形似而神异:两者都动用多个子模型,但集成学习通常让每个子模型在完整数据空间上训练,靠投票或平均来提升稳健性;MoE 的每个专家则只针对数据的某个子空间训练,靠门控网络分工协作。
问:MoE 模型标称的参数量是实际用到的吗?答:不完全是。MoE 的总参数量包含所有专家,但每次推理只激活其中一小部分,因此常用「总参数 / 激活参数」两个口径来描述规模。
问:MoE 和集成学习是一回事吗?答:不是。集成学习的子模型各自处理全部数据、结果取长补短;MoE 的专家分管不同数据子空间,由门控网络按输入分派任务。
问:MoE 一定比稠密模型好吗?答:不一定。MoE 在同等计算预算下通常能获得更强能力,但训练更难调、部署占显存更多,小规模场景下稠密模型往往更省心。

| 类型 | 机器学习模型架构 |
| 英文名 | Mixture of Experts(MoE) |
| 提出时间 | 20 世纪 90 年代初 |
| 核心机制 | 门控网络 + 多专家子网络 + 稀疏激活 |
| 代表应用 | Mixtral、DeepSeek 等大语言模型 |
| 相关概念 | 集成学习、Transformer、稀疏模型 |
登录 后参与讨论
暂无讨论,来发表第一条评论吧