D-EEM:一种基于DOM树的Deep Web实体抽取机制
随着Web数据库的不断增长,通过对Deep Web的访问逐渐成为获取信息的主要手段.如何有效地抽取Deep Web中结果页面所包含的实体信息成为一个值得研究的问题.通过分析Deep Web结果页面的特点,提出了一种基于DOM树的Deep Web实体抽取机制(DOM-tree based entity extraction mechanism for Deep web, D-EEM),能够有效解决Deep Web环境中的实体抽取问题.D-EEM采用基于DOM树的自动实体抽取策略,利用DOM树中的文本内容和层次结构来确定数据区域和实体区域,提高了实体抽取的准确性;另外,提出了一种基于上下文距离和共现次数的语义标注方法,有效地将来自不同数据源的抽取结果进行合成.通过实验验证了D-EEM中所采用的关键技术的可行性和有效性,同其他实体抽取策略相比,D-EEM在抽取效率及抽取准确性等方面具有一定的优势.
实体抽取、DOM树、Deep Web、数据区域定位、实体区域定位
47
TP311.13(计算技术、计算机技术)
国家自然科学基金项目60673139,60973021;国家"八六三"高技术研究发展计划基金项目2008AA01Z146;中央高校基本科研业务费专项基金项目0304005
2010-06-22(万方平台首次上网日期,不代表论文的发表时间)
共8页
858-865