网络蜘蛛即Web Spider,是一个很形象的名字。把互联网比喻成一个蜘蛛网,那么Spider就是在网上爬来爬去的蜘蛛。网络蜘蛛是通过网页的链接地址来寻找网页,从 网站某一个页面(通常是首页)开始,读取网页的内容,找到在网页中的其它链接地址,然后通过这些链接地址寻找下一个网页,这样一直循环下去,直到把这个网站所有的网页都抓取完为止。如果把整个互联网当成一个网站,那么网络蜘蛛就可以用这个原理把互联网上所有的网页都抓取下来。
Java+MySQL实现网络爬虫程序
http://johnhany.net/2013/11/web-crawler-using-java-and-mysql/
http://blog.csdn.net/wuhailin2005/article/details/3736026
http://blog.csdn.net/lmj623565791/article/details/23272657
JAVA使用爬虫抓取网站网页内容的方法
http://www.jb51.net/article/69936.htm