10.3969/j.issn.1002-137X.2014.03.026
一种基于Kademlia的全分布式爬虫集群方法
针对将海量爬虫节点组织成全分布式爬虫集群所遇到的高效、均衡、可靠、可拓展等问题,提出了一种基于Kademlia的全分布式爬虫集群方法.该方法通过改进的Kademlia技术建立起爬虫节点间的底层通信机制.在此基础上,根据Kademlia的异或特性及节点的可用资源情况,设计并实现具有任务划分、异常处理、节点加入退出处理及负载均衡的全分布式爬虫集群模型.在实际网络系统上的实验结果表明,该方法能有效利用海量弱计算终端的计算、存储和带宽资源,构建高效、均衡、可靠、可大规模拓展的全分布式爬虫集群.
Kademlia、分布式爬虫、弱计算终端、海量节点、结构化P2P
41
TP301.6(计算技术、计算机技术)
863重大项目课题:融合网络业务体系的开发2011AA01A102;中科院先导专项课海端交互数据实时处理XDA6030500;国家科技支撑计划课题:支持增强型搜索的重点新闻网站三屏融合服务2011BAH11B05
2014-04-16(万方平台首次上网日期,不代表论文的发表时间)
共5页
124-128