加载中...

SQuAD(Stanford Question Answering Dataset)是斯坦福大学 Rajpurkar 等人于 2016 年发布的大规模机器阅读理解数据集,包含基于维基百科文章由众包人员撰写的十万余个问题,答案是原文段落中的一段连续文本(span)。
模型阅读给定段落和问题,输出答案在原文中的起止位置,以精确匹配率(EM)和 F1 值评测,并与人工表现基线对比。这种抽取式设定使自动评测简单可靠,迅速成为标准任务。
针对 1.1 版模型可以「总能在文中找到答案」的缺陷,2018 年发布的 SQuAD 2.0 加入五万余个「无法回答」的对抗性问题,要求模型学会拒答,难度显著提升。
SQuAD 排行榜见证了从 BiDAF 等匹配网络到 BERT 系预训练模型的跨越,模型分数先后超过人类基线,成为预训练革命最直观的展示窗口,也带动了中文 CMRC、DuReader 等阅读理解数据集的建设。

登录 后参与讨论
暂无讨论,来发表第一条评论吧