论文部分内容阅读
由于互联网具有海量信息并且快速增长,提高搜索引擎的信息采集器WebSpider的数据采集和更新速度有重要意义。受计算资源限制,单机多线程WebSpider的采集速率不高。带中心节点的分布式并行webSpider又容易产生中心节点瓶颈问题。利用ProActive网格网络并行分布计算中间件提供的主动对象技术、网络并行计算技术、自动部署机制等设计和实现了一个名为P—Spider2.0的节点对等的分布式并行WebSpider,并设计了一个基于Raibin算法的URL去重算法。实验表明该WebSpider方便管理和