10.3778/j.issn.1002-8331.1503-0340
基于字集特征向量的网页消重改进算法
基于MD5算法计算数字指纹的网页消重算法简单而高效,在网页消重领域应用比较广泛。但是由于MD5算法是一种严格的信息加密算法,在文章内容变动很少的情况下得出的指纹结果完全不同,导致基于这种算法的网页消重技术召回率不是很高。提出了两种基于字集特征向量的网页消重改进算法,把文章内容映射到字集空间中去,计算字集空间距离来判断文章是否相似。提出的算法具有良好的泛化能力,段落中存在的调整语序和增删改个别字不会影响到对相似段落的识别,大大提高了网页消重算法的召回率。实验结果表明,算法的时间复杂度为O(n),空间复杂度为O(1),适合应用于大规模网页消重。
字集向量、机器码向量、网页消重、数字指纹、MD5
53
TP391(计算技术、计算机技术)
国家“十五”科技攻关项目No.2001BA605A09。
2017-03-06(万方平台首次上网日期,不代表论文的发表时间)
共5页
53-57