基于邻接矩阵的全文索引模型

引用

摘要：

文本信息的急剧增加和越来越多的用户通过在线方式获取文本信息,使得查询效率成为信息检索系统一个突出瓶颈.提出两种新型全文索引模型,用于改善信息检索系统的查询效率.通过使用有向图表示文本串,引出关于文本串的邻接矩阵;采用两种不同的方式实现文本串邻接矩阵,导出了两种基于邻接矩阵的新型全文索引模型,即基于邻接矩阵的倒排文件和基于邻接矩阵的PAT数组.给出了基于新模型的文本查询算法;分析了新模型的存储空间和查询时间的开销,并分别与两种传统索引模型进行了比较.对实际文本库进行了测试以证实新模型的效能.新模型能够以相对于原文较小的空间代价获得较大幅度的查询效率的提高,因此适合于在大规模文本检索系统中应用.

关键词：信息检索、全文索引、倒排文件、PAT数组、邻接矩阵、模型

所属期刊栏目：13

分类号：TP311(计算技术、计算机技术)

资助基金：国家自然科学基金60173027;湖北省自然科学基金2001ABB050

在线出版日期：2004-01-08（万方平台首次上网日期，不代表论文的发表时间）

页数：共10页

页码：1933-1942

英文信息展示

期刊专题