基于信息丰富度的切碎中文文档自动拼接复原

引用

摘要：

针对切碎中文文档的自动拼接复原中无法利用碎纸片形状特征的问题,提出一种基于内容信息丰富度的拼接算法.首先分析了基于汉字内容的碎纸片特征表达方式；在此基础上,提出从横纵2个方面进行碎纸片特征匹配度估计的方法；最后采用信息丰富度确定拼接次序,逐一高效地完成碎纸片的拼接.基于不同碎纸片数量的匹配实验结果表明,相对于传统方法,横纵特征匹配度估计方法分别提高了约4.73%,3.76%的准确度；自动拼接复原实验结果表明,相对于传统算法,基于信息丰富度拼接算法的错误率下降约18%,并大大降低了时间复杂度.

关键词：文档复原、中文文档、碎纸片、匹配度估计、信息丰富度、自动拼接算法

分类号：TP391(计算技术、计算机技术)

资助基金：国家自然科学基金61173143;公益性行业气象科研专项GYHY201506080

在线出版日期：2015-06-26（万方平台首次上网日期，不代表论文的发表时间）

页数：共8页

页码：1039-1046

英文信息展示

期刊专题