加载中...

T5(Text-to-Text Transfer Transformer)是 Google 于 2019 年提出的预训练模型,核心思想是把所有自然语言任务统一为「文本进、文本出」的形式:翻译、分类、摘要、问答都通过在输入前加任务前缀来区分,用同一个模型生成答案文本。
T5 采用标准的 Transformer 编码器-解码器架构,使用相对位置编码。预训练任务为 span corruption:随机遮盖连续片段,让模型还原。训练语料为经过清洗的 C4 数据集。模型规模从 6000 万到 110 亿参数,论文以大规模消融实验系统比较了各类架构与训练选择。
T5 是编码器-解码器路线的代表作,其「一切皆文本生成」的理念直接影响了后来的指令微调范式;衍生的 mT5、Flan-T5 在多语言与指令跟随方向被广泛使用,C4 数据集也成为社区标准语料之一。

登录 后参与讨论
暂无讨论,来发表第一条评论吧