加载中...
MoE(Mixture of Experts)将模型分成多个「专家」子网络,每次推理由路由器动态选择少数专家激活,使总参数量大幅增加而推理成本几乎不变。Mixtral 8×7B、GPT-4 据传都采用了 MoE 架构。

| 类型 | 稀疏神经网络架构 |
| 代表模型 | Mixtral 8×7B(2023)、Switch Transformer(2022) |
| 核心优势 | 总参数多但推理成本低,接近稠密小模型 |
MoE 的思路可以追溯到 1991 年 Jacobs 等人的论文,核心理念是「让不同专家处理不同类型的问题」。现代 MoE LLM 的做法:把 Transformer 前馈层替换成 N 个并行的 FFN(专家),加一个路由器(Router/Gating Network),每个 token 只激活 top-K 个专家(通常 K=2)。
以 Mixtral 8×7B(Mistral AI,2023)为例:8 个专家,每个 token 激活 2 个,总参数 47B,但推理时只用约 13B 激活参数,速度接近 13B 稠密模型,而性能接近 70B 模型。[1]
MoE 的训练比稠密模型复杂得多:最大的挑战是负载均衡(Load Balancing)——如果路由器总是选几个「受欢迎」的专家,其他专家就成了废物。解决方案是在训练损失里加入辅助负载均衡损失,强迫路由器分散选择,但这会和主任务目标产生冲突,需要精细调节。
另一个挑战是分布式推理:不同专家可能在不同 GPU 上,路由器决策后需要把 token 发送到对应 GPU,涉及大量 All-to-All 通信。Google 的 Switch Transformer(2022)和 GLaM,以及最新的 Gemini 1.5(据报道也是 MoE)都在工程上做了大量优化。GPT-4 是否是 MoE 架构从未官方确认,但 2023 年的多篇报道和模型行为分析倾向于支持这一推测。

| 类型 | 稀疏神经网络架构 |
| 代表模型 | Mixtral 8×7B(2023)、Switch Transformer(2022) |
| 核心优势 | 总参数多但推理成本低,接近稠密小模型 |
登录 后参与讨论
暂无讨论,来发表第一条评论吧