加载中...
权重绑定是一种在语言模型中让输入词嵌入矩阵与输出投影矩阵共享同一套参数的技术。它显著减少模型参数量,并常能提升语言建模效果,是Transformer与早期RNN语言模型的常见做法。

| 中文名 | 权重绑定 |
| 英文名 | Weight Tying |
| 所属领域 | 神经语言模型 |
| 主要作用 | 减少参数、正则化 |
权重绑定(Weight Tying)指在神经语言模型中,把输入端的词嵌入矩阵与输出端的softmax投影矩阵设为同一个(转置)矩阵,从而让两者共享参数。这一技巧最早在RNN语言模型上被系统研究,如今广泛用于Transformer类模型。
语言模型通常包含两个巨大的矩阵:一个把词元映射为向量的嵌入矩阵,一个在输出层把隐藏向量映射回词表维度的投影矩阵。两者形状互为转置,规模都等于词表大小乘以隐藏维度。权重绑定让它们复用同一份参数,既省显存又省参数。
权重绑定被用于GPT系列、许多开源大模型以及机器翻译模型中。在参数预算紧张的移动端或小模型上,它能在几乎不损失效果的前提下明显压缩体积。是否绑定通常作为模型配置项由训练者选择。
问:权重绑定一定能提升效果吗?答:多数情况下能降低困惑度或持平,但在超大模型上收益变小,有时研究者会解绑以获得更灵活的表达。
问:绑定后嵌入维度和隐藏维度必须相等吗?答:直接绑定要求二者一致;若不一致,需加一层线性变换过渡,或采用部分绑定策略。

| 中文名 | 权重绑定 |
| 英文名 | Weight Tying |
| 所属领域 | 神经语言模型 |
| 主要作用 | 减少参数、正则化 |
登录 后参与讨论
暂无讨论,来发表第一条评论吧