在\home\apache-nutch-1.4-bin\runtime\local下新建urls新建url.txt输入如下内容:
http://www.163.com/
http://www.baidu.com/
http://www.sina.com.cn/
http://www.renren.com/
更改\home\apache-nutch-1.4-bin\runtime\local\conf\regex-urlfilter.txt最下面:
# accept anything else
#+^http://([a-z0-9]*\.)*(.*\.)*.*/
#+^http://([a-z0-9]*\.)*nutch.apache.org/
+^http://([a-z0-9]*\.)*renren.com/
+^http://([a-z0-9]*\.)*163.com/
+^http://([a-z0-9]*\.)*baidu.com/
+^http://([a-z0-9]*\.)*sina.com.cn/
如果配置了solr,就可以执行了: bin/nutch crawl urls -solr http://localhost:8983/solr/ -depth 5 -topN 100 -threads 4 >&log.txt