python标准库urllib2使用细节

最新推荐文章于 2023-10-20 09:12:18 发布

walter1990

最新推荐文章于 2023-10-20 09:12:18 发布

阅读量1k

点赞数

分类专栏：编程语言

本文链接：https://blog.csdn.net/suichen1/article/details/50358248

版权

编程语言专栏收录该内容

6 篇文章 0 订阅

订阅专栏

urllib2下载网页方法：

1、最简洁的方法

response = urllib2.urlopen('http://www.baidu.com')

print response.getcode()

cont = response.read()

2、添加data、http header

request = urllib2.Request(url)

//添加数据

request.add_data('a', '1')

request.add_header('User-Agent', 'Mozilla/5.0')

response = urllib2.urlopen(request)

3、添加特殊情景的处理器

例如HTTPCookieProcessor，ProxyHandler，HTTPSHandler，HTTPRedirectHandler

然后 opener = urllib2.build_opener(handler)

urllib2.install_opener(opener)

urllib2.urlopen(url)

python有哪几种网页解析器：

正则表达式，html.parser，Beautiful Soup，lxml

1、Proxy的设置

urllib2默认会使用环境变量http_proxy来设置HTTP Proxy。如果想在程序中明确控制Proxy 而不受环境变量的影响，可以使用如下方式：

import urllib2

enable_proxy=True
proxy_handler = urllib2.ProxyHandler({"http":'http://some-proxy.com:8080'})
null_proxy_handler = urllib2.ProxyHandler({})

if enable_proxy:
    opener = urllib2.build_opener(proxy_handler)
else:
    opener = urllib2.build_opener(null_proxy_handler)
urllib2.install_opener(opener)

2、Timeout的设置

response = urllib2.urlopen('http://www.google.com', timeout=10)

3、在HTTP Request中加入特定的Header

要加入header，需要使用Request对象

url = 'http:www.baidu.com'
response = urllib2.urlopen('http://www.google.com', timeout=10)
request = urllib2.Request(url)
request.add_header('User-Agent', 'fake-client')
response = urllib2.urlopen(request)

对有些header要特别留意，服务器会针对这些header做检查。

User-Agent：有些服务器或Proxy会通过该值来判断是否是浏览器发出的请求

Content-Type:在使用REST接口时，服务器会检查该值，用来确定HTTP Body中的内容该怎样解析。常见的取值有：

4、Redict

urllib2默认情况下回针对HTTP 3XX返回码自动进行redict动作，无需人工配置。

如果不想自动redict，除了使用更低层次的httplib库之外，还可以自定义HTTPRedictHandler类

class RedictHandler(urllib2.HTTPRedirectHandler):
    def http_error_301(self, req, fp, code, msg, headers):
        pass
    def http_error_302(self, req, fp, code, msg, headers):
        pass
opener = urllib2.build_opener(RedictHandler)
opener.open('http://www.baidu.com')

5、cookie

URLlib2对Cookie的处理也是自动的。如果需要得到某个Cookie项的值，可以这么做：

import cookielib
cookie = cookielib.CookieJar()
opener = urllib2.build_opener(urllib2.HTTPCookieProcessor(cookie))
response = opener.open('http://www.baidu.com')
for item in cookie:
    if item.name == 'some_cookie_item_name':
        print item.value

6、使用HTTP的PUT和DELETE方法

urllib2只支持HTTP的GET和POST方法，如果要使用HTTP PUT和DELETE方法，只能使用比较底层的httplib库。虽然如此，也能通过下面的方式，使urllib2能够发出PUT或DELETE请求

request = urllib2.Request(url, data=data)
request.get_method = lambda: 'PUT' # or DELETE
response = urllib2.urlopen(request)

7、得到HTTP的返回码

对于200 OK来说，只要使用urlopen返回的response对象的getcode()方法就可以得到HTTP的返回码。但对其他的返回码来说，urlopen会抛出异常。这时候，就要检查异常对象的code属性了。

try:
    response = urllib2.urlopen('http"restrict.web.com')
except urllib2.HTTPError, e:
    print e.code

8、Debug Log

使用urllib时，可以通过下面的方式把debug log打开，这样收发的包内容就会在屏幕上打印出来。

httpHandler = urllib2.HTTPHandler(debuglevel=1)
httpsHandler = urllib2.HTTPSHandler(debuglevel=1)
opener = urllib2.build_opener(httpHandler, httpsHandler)

urllib2.install_opener(opener)
response = urllib2.urlopen('http://www.baidu.com')

URLError可能产生的原因：

1、网络无法连接

2、连接不到特定的服务器

3、服务器不存在

HTTPError是URLError的子类。

HTTPError实例产生后会有一个code属性，这就是服务器发送的相关错误号

因为urllib2可以处理重定向，也就是3开头的代号可以被处理，并且100-299范围的号码指示成功，所以只能看到400-599的错误代码

为什么要使用Cookie呢？

Cookie，指某些网站为了辨别用户身份，进行session跟踪而存储在用户本地终端上的数据（通常经过加密）

当获取一个URL你使用一个opener(一个urllib2.OpenerDirector的实例)。在前面都是使用默认的opener，也就是urlopen。它是一个特殊的opener，可以理解成opener的一个特殊实例，传入的参数仅仅是url，data，timeout

如果需要Cookie，只使用这个opener是不能达到目的的。需要创建更一般的opener来实现对Cookie的设置。

cookielib模块的主要作用是提供可存储cookie的对象，以便于urllib2模块配合使用来访问Internet资源。Coookielib模块非常强大，可以利用本模块的CookieJar类的对象来捕获cookie并在后续连接请求时重新发送，比如实现模拟登陆功能。

//保存cookie到变量中

#声明一个CookieJar对象实例保存cookie    
cookie = cookielib.CookieJar()
#利用urllib2库的HTTPCookieProcessor对象来创建cookie处理器
handler = urllib2.HTTPCookieProcessor(cookie)
#通过handler来构建opener
opener = urllib2.build_opener(handler)
response = opener.open('http://www.baidu.com')
for item in cookie:
    print 'Name = '+item.name
    print 'Value = '+item.value

//保存cookie到文件中，需要用到FileCookieJar对象，在这里使用它的子类MozillaCookieJar来实现保存CookieJar

#保存到文件中
filename = 'cookie.txt'
cookie = cookielib.MozillaCookieJar(filename)
handler = urllib2.HTTPCookieProcessor(cookie)
opener = urllib2.build_opener(handler)
response = opener.open('http://www.baidu.com')
cookie.save(ignore_discard=True, ignore_expires=True)

ignore_discard的意思是：即使cookies将被丢弃也将它保存下来

ignore_expires的意思是：如果在该文件中cookies已经存在，则覆盖文件写入。

现在已经把Cookie保存到文件中了，如果以后想使用，可以利用下面的方法来读取cookie并访问网站。