本来一直以为是网站网址中文编码出现问题导致无法访问,后来研究查资料发现是网站禁止爬虫程序所导致的。
当然,解决方案也很easy
headers = {'User-Agent':'Mozilla/5.0 (Windows; U; Windows NT 6.1; en-US; rv:1.9.1.6) Gecko/20091201 Firefox/3.5.6'}
req = urllib2.Request(url = 'http://topic.csdn.net/u/20110123/15/F71C5EBB-7704-480B-9379-17A96E920FEE.html',headers = headers)
feeddata = urllib2.urlopen(req).read()