10.3778/j.issn.1002-8331.2212-0259
面向短文本的增强上下文神经主题模型
目前的主题模型大多数基于自身文本的词共现信息进行建模,并没有引入主题的稀疏约束来提升模型的主题抽取能力,此外短文本本身存在词共现稀疏的问题,该问题严重影响了短文本主题建模的准确性.针对以上问题,提出了一种增强上下文神经主题模型(enhanced context neural topic model,ECNTM).ECNTM基于主题控制器对主题进行稀疏性约束,过滤掉不相关的主题,同时模型的输入变成BOW向量和SBERT句子嵌入的拼接,在高斯解码器中,通过在嵌入空间中将单词上的主题分布处理为多元高斯分布或高斯混合分布,显式地丰富了短文本有限的上下文信息,解决了短文本词共现特征稀疏问题.在WS、Reuters、KOS、20 NewsGroups四个公开数据集上的实验结果表明,该模型在困惑度、主题一致性以及文本分类准确率上相较基准模型均有明显提升,证明了引入主题稀疏约束特性以及丰富的上下文信息到短文本主题建模的有效性.
神经主题模型、短文本、稀疏约束、变分自编码器、主题建模
60
TP391(计算技术、计算机技术)
黑龙江省高等教育教学改革研究项目;黑龙江省自然科学基金项目;国家高端外国专家引进计划项目
2024-01-18(万方平台首次上网日期,不代表论文的发表时间)
共11页
154-164