一种结合上下文语义的短文本聚类算法
短文本因具有特征信息不足且高维稀疏等特点,使得传统文本聚类算法应用于短文本聚类任务时性能有限.针对上述情况,提出一种结合上下文语义的短文本聚类算法.首先借鉴社会网络分析领域的中心性和权威性思想设计了一种结合上下文语义的特征词权重计算方法,在此基础上构建词条一文本矩阵;然后对该矩阵进行奇异值分解,进一步将原始特征词空间映射到低维的潜在语义空间;最后通过改进的K-means聚类算法在低维潜在语义空间完成短文本聚类.实验结果表明,与传统的基于词频及逆向文档频权重的文本聚类算法相比,该算法能有效改善短文本特征不足及高维稀疏性,提高了短文的本聚类效果.
短文本聚类、上下文语义、奇异值分解、K均值算法
43
TP181(自动化基础理论)
国家自然科学基金61273302
2016-12-16(万方平台首次上网日期,不代表论文的发表时间)
共5页
443-446,450