加载中...

GLUE(General Language Understanding Evaluation)是纽约大学、华盛顿大学与 DeepMind 的研究者于 2018 年发布的自然语言理解评测基准,把九个句子级理解任务汇集为统一套件,并提供在线排行榜,旨在推动通用(而非单任务)语言理解模型的发展。
涵盖语法可接受性判断(CoLA)、情感分类(SST-2)、句子对语义等价(MRPC、QQP)、语义相似度(STS-B)、自然语言推理(MNLI、RTE)、问答蕴含(QNLI)与指代推理(WNLI),以多任务平均分排名。
GLUE 成为预训练模型军备竞赛的标尺:BERT、RoBERTa、T5 等相继刷榜,模型分数很快超过人类基线。为此原班人马于 2019 年推出难度更高的 SuperGLUE,加入常识推理与多句阅读等任务。
GLUE 确立了「统一基准驱动研究」的范式,但也暴露了模型利用数据集捷径刷分、基准迅速饱和的问题,启发了后续更全面的评测体系。

登录 后参与讨论
暂无讨论,来发表第一条评论吧