一种低频词词向量优化方法及其在短文本分类中的应用

引用

摘要：

众多自然语言处理(Natural Language Processing,NLP)任务受益于在大规模语料上训练的词向量.由于预训练的词向量具有大语料上的通用语义特征,因此将这些词向量应用到特定的下游任务时,往往需要通过微调进行一定的更新和调整,使其更适用于目标任务.但是,目标语料集中的低频词由于缺少训练样本,导致在微调过程中无法获得稳定的梯度信息,使得词向量无法得到有效更新.而在短文本分类任务中,这些低频词对分类结果同样有着重要的指示性.因此,在具体的短文本分类任务上获得一个更好的低频词词向量表示是有必要的.针对这个问题,文中提出了一种与下游任务模型无关的低频词词向量更新算法,通过基于K近邻的词向量偏移计算方法,利用通用词向量中与低频词相似的高频词所获得的任务特征信息,来指导低频词的信息更新,从而获得更准确的且适用于当前任务语境的低频词词向量表示;并以TextCNN作为基准模型,基于word2vec和GloVe得到的两个通用预训练词向量,在3个公开的短文本数据集上进行了优化算法的效果验证.实验结果表明,使用优化算法更新低频词词表示后,模型分类准确率能达到84.3％～94％,较更新前提升了0.4％～1.4％,体现了优化算法的有效性,也进一步证明了短文本分类任务中低频词对分类结果的影响,为短文本分类的研究工作提供了一定的借鉴.

关键词：词向量、低频词、微调、短文本分类

所属期刊栏目：47

分类号：TP391(计算技术、计算机技术)

资助基金：国家自然科学基金;赛尔网络下一代互联网技术创新项目

在线出版日期：2020-08-26（万方平台首次上网日期，不代表论文的发表时间）

页数：共6页

页码：255-260

英文信息展示

期刊专题