加载中...
| 类别 | AI术语 |
| 英文名 | Mixture of Experts |
| 领域 | 人工智能 |
混合专家模型(Mixture of Experts,MoE)是一种神经网络架构,其核心思想是将模型划分为多个并行的专家子网络,并由一个门控网络(路由器)根据输入动态选择性地激活其中少数专家参与计算。这种稀疏激活机制使模型能够在大幅扩展总参数量的同时,保持单次推理的计算开销基本可控。[1]
在 Transformer 中,MoE 通常用稀疏的 MoE 层替换原本稠密的前馈网络层。该层包含若干结构相同的专家网络,以及一个门控网络。对于每个输入 Token,门控网络计算各专家的匹配得分,仅选取得分最高的少数(如 Top-2)专家进行前向计算,再按门控权重加权融合其输出。由于每个 Token 只路由到部分专家,模型的总参数量(容量)很大,而实际激活的参数量(计算量)很小,从而解耦了模型规模与推理成本。为避免专家负载失衡(部分专家被过度使用而其余闲置),训练中通常引入负载均衡辅助损失。
MoE 的优势在于以次线性的计算增长换取参数规模的大幅扩张,在相同算力预算下能够获得更强的模型能力,并具备一定的专业化分工特性。其挑战包括:训练不稳定、路由策略设计复杂、专家负载难以均衡、显存占用高(所有专家参数都需驻留),以及分布式部署中的通信开销。推理时还需应对动态路由带来的批处理效率问题。
MoE 已成为构建超大规模语言模型的主流架构之一,被众多前沿大模型采用,以在可控成本下实现万亿级参数规模。它使模型在保持高效推理的同时具备强大容量,是平衡性能与算力、推动大模型规模持续扩张的重要工程范式。
| 类别 | AI术语 |
| 英文名 | Mixture of Experts |
| 领域 | 人工智能 |
登录 后参与讨论
暂无讨论,来发表第一条评论吧