Python爬虫主要使用的是urllib模块,Python2.x版本是urllib2,很多博客里面的示例都是使用urllib2的,因为我使用的是Python3.3.2,所以在文档里面没有urllib2这个模块,import的时候会报错,找不到该模块,应该是已经将他们整合在一起了。
下面是一个简单的代码示例:
- #encoding:UTF-8
- import urllib.request
- def getdata():
- url="http://www.baidu.com"
- data=urllib.request.urlopen(url).read()
- print(data)
- getdata()
结果:
中文转码,修改一下代码:
- #encoding:UTF-8
- import urllib.request
- def getdata():
- url="http://www.baidu.com"
- data=urllib.request.urlopen(url).read()
- z_data=data.decode('UTF-8')
- print(z_data)
- getdata()
结果如下: