加载中...

fastText 是 Facebook AI Research 于 2016 年开源的轻量级文本表示与分类库,提供高效的词向量训练和文本分类功能,以 C++ 实现并附带多语言预训练词向量。
fastText 在 Skip-gram 模型基础上引入子词(subword)机制,将每个词拆分为字符级 n-gram 的集合,词向量由其所有子词向量求和得到。这使模型能够利用词形信息,并为训练时未出现的词(OOV)推断出合理向量,对形态丰富的语言尤其有效。
其分类器将文档中所有词与 n-gram 向量取平均后送入线性分类器,配合层次 softmax,可在普通 CPU 上于数分钟内完成大规模语料训练,精度接近深度模型而速度快得多。
常用于语言识别、垃圾内容过滤、标签推荐等对速度敏感的场景,官方发布了覆盖 150 余种语言的预训练词向量。

登录 后参与讨论
暂无讨论,来发表第一条评论吧