1、http://www.cnblogs.com/FengYan/archive/2012/11/27/2788369.html#2566041 ZeroCrawlerV0.1是一只简单的多线程爬虫,其基本架构如下: 整个程序是这样运作的:Scheduler不断从Queue取出URL,如果发现可用的爬虫(空闲线程),那么就将URL分给一只爬虫。然后爬虫完成下载网页,抽取URL,保存网页的工作后就回归Scheduler(变回空闲线程)。直到Queue没有待爬取的URL,并且所有爬虫都空闲下来,就停止程序。 S