期刊专题

10.16652/j.issn.1004-373x.2023.11.019

多特征融合的文本相似度方法

引用
通过从多方面考虑在自然语言处理中文本相似度的问题,从而提升文本相似度计算的准确性.提出一种多特征融合的文本相似度方法,该方法使用Jaro Distance编辑距离算法结合相同词计算文本结构相似度,使用长短时记忆网络的双塔模型算法计算文本语义相似度,使用融合多向量模型的双向长短时记忆网络的注意力算法计算文本相似度.考虑上述三种特征,通过线性加权调整模型的权重以避免其中任意一种方法计算出的相似度过大或者过小对最终的文本相似度造成不好的影响.以文本相似度的实验值与真实值的均方误差作为衡量标准,均方误差越小方法效果越好.实验结果表明,MFTM算法比WBLSA、MVBLSA算法的MSE值在SICK数据集上平均降低了5.4%、1.276%,因此,提出的算法在文本相似度计算上的效果更好.

特征融合、文本相似度、改进编辑距离、长短时记忆网络、双塔模型、注意力机制

46

TN911.1-34;TP391.1

国家自然科学基金41872243

2023-06-05(万方平台首次上网日期,不代表论文的发表时间)

共6页

103-108

暂无封面信息
查看本期封面目录

现代电子技术

1004-373X

61-1224/TN

46

2023,46(11)

专业内容知识聚合服务平台

国家重点研发计划“现代服务业共性关键技术研发及应用示范”重点专项“4.8专业内容知识聚合服务技术研发与创新服务示范”

国家重点研发计划资助 课题编号:2019YFB1406304
National Key R&D Program of China Grant No. 2019YFB1406304

©天津万方数据有限公司 津ICP备20003920号-1

信息网络传播视听节目许可证 许可证号:0108284

网络出版服务许可证:(总)网出证(京)字096号

违法和不良信息举报电话:4000115888    举报邮箱:problem@wanfangdata.com.cn

举报专区:https://www.12377.cn/

客服邮箱:op@wanfangdata.com.cn