10.3969/j.issn.2095-2163.2013.03.002
面向BitTorrent种子文件获取的网络爬虫技术研究
分析了当前主题爬虫在面向BT种子文件获取应用上存在的问题,从提高BT种子获取速率、提高覆盖率和降低种子获取延时的角度出发,提出了基于Hash的去重机制,给出了爬虫自动登录的实现方法,设计了AJAX页面解析引擎,提出批量抓取和增量抓取相结合的数据抓取机制、历史数据和更新数据相结合的数据存储机制.通过设计并实现一个基于爬虫方式的BT种子文件获取系统证明了这几种方法能使系统整体性能平均提高30%~50%.这些技术和方法也可应用于其他主题爬虫.
BitTorrent、BT种子爬虫、去重机制、自动登录、AJAX解析
3
TP393(计算技术、计算机技术)
973计划资助项目2007CB311101;863计划资助项目2009AA012437
2013-09-09(万方平台首次上网日期,不代表论文的发表时间)
共7页
7-13