urllib2的简单教程

重要声明

本文作者只是根据网络上博客和官方文档内容进行知识的一些整理,文章有错误在所难免,望各位不吝赐教,我会在评论区进行回复,另外,官方文档是最好的选择!

一个基本的例子

import urllib2
response = urllib2.urlopen('http://www.baidu.com')
print response.read(200)
<!DOCTYPE html><!--STATUS OK--><html><head><meta http-equiv="content-type" content="text/html;charset=utf-8"><meta http-equiv="X-UA-Compatible" content="IE=Edge"><meta content="always" name="referrer"

解释:read()方法可以进行字节数的控制,具体参看文档。

urlopen()方法的解释

urlopen(url, data, timeout)函数,其中有三个参数,第一个参数是要进行解析的网址;data参数是访问网址时要传递的数据,比如登陆时候的参数;timeout参数使用设置超时时间。
注意方法返回值response即服务器返回的所有信息。

还可以通过构造request的方式进行url访问,这种访问方式能够对参数进行设置,推荐使用这种方法。

import urllib2

request = urllib2.Request("http://www.baidu.com")
response = urllib2.urlopen(request)
print response.read(200)
<!DOCTYPE html><!--STATUS OK--><html><head><meta http-equiv="content-type" content="text/html;charset=utf-8"><meta http-equiv="X-UA-Compatible" content="IE=Edge"><meta content="always" name="referrer"

我们使用request的方式进行模拟登陆。#此处可能存在错误,待改正

import urllib
import urllib2

values = {"username":"testname","password":"test"}
data = urllib.urlencode(values) 
url = "https://passport.csdn.net/account/login?from=http://my.csdn.net/my/mycsdn"
request = urllib2.Request(url,data)
response = urllib2.urlopen(request)
print response.read(200)
<html>
  <head>
    <meta charset="utf-8" />
    <meta http-equiv="X-UA-Compatible" content="IE=edge"/>
    <meta property="qc:admins" content="24530273213633466654" />
    <meta na

注意urllib.urlencode(values)函数是将字典中的参数值变成url参数的形式进行表示,比如下面的例子:

print urllib.urlencode(values)
username=1016903103%40qq.com&password=XXXX

headers、代理设置

urllib2库有许多内容可以进行设置,除了设置data内容外,还可以进行比如设置Headers,Proxy(代理),timeout等内容。设置内容最终都要填入函数request = urllib2.Request(url,data,headers)函数中,注意参数的形式都是字典。

通常,服务器为了防止爬虫操作,经常会在header中进行设置,我们要进行一些伪装,下面是经典的参数,必要时自己查看网址headers内容。
User-Agent : 有些服务器或 Proxy 会通过该值来判断是否是浏览器发出的请求
Content-Type : 在使用 REST 接口时,服务器会检查该值,用来确定 HTTP Body 中的内容该怎样解析。
application/xml : 在 XML RPC,如 RESTful/SOAP 调用时使用
application/json : 在 JSON RPC 调用时使用
application/x-www-form-urlencoded : 浏览器提交 Web 表单时使用
在使用服务器提供的 RESTful 或 SOAP 服务时, Content-Type 设置错误会导致服务器拒绝服务。

使用chrome浏览器自带的开发者工具查看http头的方法
1.在网页任意地方右击选择审查元素或者按下 shift+ctrl+c, 打开chrome自带的调试工具;
2.选择network标签, 刷新网页(在打开调试工具的情况下刷新);
3.刷新后在左边找到该网页url,点击 后右边选择headers,就可以看到当前网页的http头了;

代理的使用可以有效阻止服务器禁止访问他的页面,类似情况:反 反爬虫。基本使用如此,后期我会写博客针对代理给出实际案例。

import urllib2
enable_proxy = True
proxy_handler = urllib2.ProxyHandler({"http" : 'http://some-proxy.com:8080'})
null_proxy_handler = urllib2.ProxyHandler({})
if enable_proxy:
    opener = urllib2.build_opener(proxy_handler)
else:
    opener = urllib2.build_opener(null_proxy_handler)
urllib2.install_opener(opener)

urllib2.urlopen(‘http://www.baidu.com‘, timeout=10),timeout的使用要自己去查询,学会自学。

URLError异常

import urllib2

requset = urllib2.Request('http://www.xxxxx.com')
try:
    urllib2.urlopen(requset)
except urllib2.URLError, e:
    print e.reason
---------------------------------------------------------------------------

error                                     Traceback (most recent call last)

<ipython-input-2-9a33cc5d494e> in <module>()
      3 requset = urllib2.Request('http://www.xxxxx.com')
      4 try:
----> 5     urllib2.urlopen(requset)
      6 except urllib2.URLError, e:
      7     print e.reason


...
/home/fisher/soft/anaconda2/lib/python2.7/socket.pyc in readline(self, size)
    478             while True:
    479                 try:
--> 480                     data = self._sock.recv(self._rbufsize)
    481                 except error, e:
    482                     if e.args[0] == EINTR:


error: [Errno 104] Connection reset by peer

服务器不存在报错。另外我们可以进行异常的设置,进行异常捕捉,获取失误原因。小技巧:利用hasattr进行属性判断。

import urllib2

req = urllib2.Request('http://blog.csdn.net/cqcre')
try:
    urllib2.urlopen(req)
except urllib2.URLError, e:
    if hasattr(e,"code"):
        print e.code
    if hasattr(e,"reason"):
        print e.reason
else:
    print "OK"
403
Forbidden
  • 0
    点赞
  • 0
    收藏
    觉得还不错? 一键收藏
  • 0
    评论
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值