加载中...
深度混合是一种动态分配计算的 Transformer 技术,让模型在每一层自主决定哪些词元需要参与该层的完整计算、哪些可以跳过,从而在不牺牲效果的前提下降低整体计算量。

| 中文名 | 深度混合 |
| 英文名 | Mixture-of-Depths |
| 提出方 | Google DeepMind |
| 提出时间 | 2024 年 |
| 类别 | 动态计算架构 |
深度混合(Mixture-of-Depths,MoD)是一种动态计算分配方法,允许 Transformer 的每一层只对部分重要词元执行完整计算,其余词元直接跳过该层,从而在固定总计算预算下更高效地利用算力。
标准 Transformer 对序列中每个词元在每一层都投入相同的计算,但实际上并非所有词元都需要同等深度的处理。深度混合借鉴了混合专家模型中按需路由的思想,把这一思路用在深度维度上,由 Google DeepMind 研究团队于二零二四年提出,让模型学会在不同层为不同词元分配不同的计算量。
深度混合适用于希望在给定计算预算下提升模型质量,或在相同质量下降低推理成本的场景。它可与混合专家模型结合,形成在深度与宽度两个方向都动态分配计算的高效架构,用于长序列与大规模模型推理。
问:跳过某些词元会不会丢信息?答:被跳过的词元仍通过残差连接保留其表示并传向后续层,只是不在当前层更新。路由器经过训练会倾向于让真正需要计算的词元获得处理,整体信息损失有限。
问:深度混合与提前退出有何不同?答:提前退出通常让整个序列或样本在达到某层后统一停止计算;深度混合则是在每一层内对不同词元做细粒度取舍,粒度更精细。

| 中文名 | 深度混合 |
| 英文名 | Mixture-of-Depths |
| 提出方 | Google DeepMind |
| 提出时间 | 2024 年 |
| 类别 | 动态计算架构 |
登录 后参与讨论
暂无讨论,来发表第一条评论吧