DOI：10.3772/j.issn.1000-0135.2011.03.006

基于网页结构相似度的Web 信息抽取

引用

摘要：

本文重点探讨基于编辑距离的网页相似度算法在Web 抽取系统中的应用与实现.通过结合基于URL 及编辑距离的网页结构相似度的计算方法,抽取系统在抽取过程中能够检测网页结构的变化,从而主动做出判断,选择适应规则进行抽取或通过主动学习自动扩展规则库.结构相似度计算赋予系统感知网页结构变化的能力,系统通过主动自我更新与调整,能更好地适应面向实际应用的异构资源的获取.算法的可行性和效率在原型系统中得以验证.

关键词：Web、信息抽取、结构相似度、编辑距离

所属期刊栏目：28

分类号：TP3;TP2

资助基金：教育部人文社会科学研究项目研究成果项目批准号08JC870013

在线出版日期：2011-03-28（万方平台首次上网日期，不代表论文的发表时间）

页数：共7页

页码：268-274

英文信息展示

期刊专题