加载中...

ELMo(Embeddings from Language Models)是 Allen 人工智能研究所与华盛顿大学的 Peters 等人在 2018 年提出的上下文相关词表示方法,同一个词在不同句子中会得到不同的向量,论文获当年 NAACL 最佳论文奖。
ELMo 先在大规模语料上训练一个双向语言模型:前向 LSTM 从左到右预测下一词,后向 LSTM 从右到左预测上一词,底层为字符卷积编码。下游任务使用时,将各层隐状态按任务学到的权重线性组合,作为动态词向量接入既有模型。
ELMo 解决了 Word2Vec、GloVe 静态向量无法区分多义词的问题,在问答、文本蕴含、情感分析等六项任务上刷新了当时纪录,与 GPT、BERT 一同开启了「预训练+微调」的 NLP 范式转移。
随着 Transformer 架构的预训练模型全面胜出,ELMo 已很少用于新系统,但其「深层上下文表示」思想影响深远。

登录 后参与讨论
暂无讨论,来发表第一条评论吧