公司让写爬去,抓取网页的js文件,结果用了HtmlParser 却老是乱码,追究其原因是多方面的,其中最主要的原因是,web上的编码是多种多样,在抓取时手动设置编码解决不了各种编码问题,会报HtmlParser org.htmlparser.util.EncodingChangeException 异常,查了很多资料终于解决,不过在网页中的中文仍然会乱码,但是不会报这个异常!
解决办法:重写InputStreamSource 和 Page 类 ,主要思想是,在抓取时获得页面编码,然后再以这种编码抓取内容,重写的两个类文件url
http://download.csdn.net/source/2574509