加载中...

自动文本摘要(Automatic Text Summarization)是利用算法将一篇或多篇文档压缩为简短、连贯且保留核心信息的文本的任务,是应对信息过载的重要技术。
抽取式摘要直接从原文挑选重要句子拼接而成,代表方法有基于图排序的 TextRank、LexRank 和基于神经网络的句子打分模型,优点是忠实原文、不易出错;生成式(抽象式)摘要则像人一样重新组织语言,可换词改写,基于 Seq2Seq、指针生成网络(Pointer-Generator)发展到 BART、PEGASUS 等预训练模型和大语言模型,可读性更好但存在事实性幻觉风险。
常用 ROUGE 指标对照人工参考摘要评分,经典数据集包括 CNN/DailyMail、XSum 和中文的 LCSTS。
新闻要点提取、搜索结果摘要、会议纪要生成、论文速读和法律文书浓缩等场景均有落地,大语言模型已使摘要成为日常可用的功能。

登录 后参与讨论
暂无讨论,来发表第一条评论吧