期刊专题

10.3778/j.issn.1002-8331.2212-0259

面向短文本的增强上下文神经主题模型

引用
目前的主题模型大多数基于自身文本的词共现信息进行建模,并没有引入主题的稀疏约束来提升模型的主题抽取能力,此外短文本本身存在词共现稀疏的问题,该问题严重影响了短文本主题建模的准确性.针对以上问题,提出了一种增强上下文神经主题模型(enhanced context neural topic model,ECNTM).ECNTM基于主题控制器对主题进行稀疏性约束,过滤掉不相关的主题,同时模型的输入变成BOW向量和SBERT句子嵌入的拼接,在高斯解码器中,通过在嵌入空间中将单词上的主题分布处理为多元高斯分布或高斯混合分布,显式地丰富了短文本有限的上下文信息,解决了短文本词共现特征稀疏问题.在WS、Reuters、KOS、20 NewsGroups四个公开数据集上的实验结果表明,该模型在困惑度、主题一致性以及文本分类准确率上相较基准模型均有明显提升,证明了引入主题稀疏约束特性以及丰富的上下文信息到短文本主题建模的有效性.

神经主题模型、短文本、稀疏约束、变分自编码器、主题建模

60

TP391(计算技术、计算机技术)

黑龙江省高等教育教学改革研究项目;黑龙江省自然科学基金项目;国家高端外国专家引进计划项目

2024-01-18(万方平台首次上网日期,不代表论文的发表时间)

共11页

154-164

暂无封面信息
查看本期封面目录

计算机工程与应用

1002-8331

11-2127/TP

60

2024,60(1)

专业内容知识聚合服务平台

国家重点研发计划“现代服务业共性关键技术研发及应用示范”重点专项“4.8专业内容知识聚合服务技术研发与创新服务示范”

国家重点研发计划资助 课题编号:2019YFB1406304
National Key R&D Program of China Grant No. 2019YFB1406304

©天津万方数据有限公司 津ICP备20003920号-1

信息网络传播视听节目许可证 许可证号:0108284

网络出版服务许可证:(总)网出证(京)字096号

违法和不良信息举报电话:4000115888    举报邮箱:problem@wanfangdata.com.cn

举报专区:https://www.12377.cn/

客服邮箱:op@wanfangdata.com.cn