加载中...

| 类型 | 机器学习模型架构 |
| 英文名 | Mixture of Experts |
| 缩写 | MoE |
| 核心组件 | 专家网络、门控网络 |
| 主要应用 | 大语言模型、推荐系统、多任务学习 |
混合专家模型(MoE)是一种利用门控机制为不同输入分配专家子模型,并将专家输出组合为最终结果的机器学习架构。
MoE 是 Mixture of Experts 的缩写,也常译为多专家模型。它通常由多个“专家”网络和一个门控网络组成:专家负责学习不同类型的数据模式,门控网络则判断当前输入更适合交给哪些专家处理。
与让所有参数处理每次输入的普通模型相比,稀疏 MoE 通常只激活少量专家,因此可以在扩大模型参数容量的同时控制单次计算量。这种架构已被用于自然语言处理、计算机视觉、推荐系统及多任务学习。
MoE 与集成学习都使用多个子模型,但侧重点不同。集成学习通常让多个模型分别处理相近的数据范围,再通过投票或平均获得结果;MoE 更强调依据输入动态路由,使专家逐渐擅长不同的数据子空间。
输入首先经过门控网络得到各专家的选择概率,系统再将输入发送给排名靠前的专家。被选专家完成计算后,其输出按照门控权重合并。训练过程中,门控网络与专家通常共同更新,使路由策略和专家能力逐步匹配。
问:MoE 是否等于多个大模型一起回答?答:不完全是。专家通常是同一模型内部的子网络,由门控机制自动选择,并非多个独立产品简单协作。
问:MoE 一定比稠密模型更快吗?答:不一定。实际速度还取决于硬件、专家分布、通信成本和路由实现。
问:专家会自然形成明确分工吗?答:可能形成一定专长,但分工未必容易解释,也可能出现少数专家过载,因此常需负载均衡机制。

| 类型 | 机器学习模型架构 |
| 英文名 | Mixture of Experts |
| 缩写 | MoE |
| 核心组件 | 专家网络、门控网络 |
| 主要应用 | 大语言模型、推荐系统、多任务学习 |
登录 后参与讨论
暂无讨论,来发表第一条评论吧