重定向请求的header来源_(硬货)初识 Python 网络请求库 urllib

本文介绍了Python内置的urllib网络请求库,特别是urllib.request模块,包括如何发送GET、POST请求,设置超时、处理重定向,以及模拟浏览器发送带有Header的请求。同时提到了urllib.error用于异常处理,如URLError和HTTPError。
摘要由CSDN通过智能技术生成

本文的文字及图片来源于网络,仅供学习、交流使用,不具有任何商业用途,版权归原作者所有,如有问题请及时联系我们以作处理

以下文章来源于腾讯云 作者:keinYe


urllib 是 Python 自带的网络请求标准库,包含了多个处理 URL 功能的模块。

  • urllib.request 用于请求和读取 URL『包含网页认证、重定向、cookies 等等』,可以方便的获取 URL 内容。
  • urllib.error 用于 urlib.request 的异常处理。
  • urllib.parse 用于 urls 解析。
  • urllib.robotparse 用于 robot.txt 文件解析。

urllib.request 和 urllib.error 是我们常用的两个库,这两个库也是在爬虫程序中使用频繁的库。

urllib.request

通过 urllib.request 模块可以发送 http 请求,并读取请求结果。

urllib.request.urlopen(url, data=None, [timeout, ]*, cafile=None, capath=None, cadefault=False , context=None

参数信息如下:

  • url 是网页网址,可以是域名也可以是 IP 地址。
  • data 是发往服务器的数据,当无数据发送时可省略该参数,是 bytes 类型的内容,可通过 bytes()函数转为化字节流
  • timeout 用于设置请求超时时间;单位是秒。
  • cafile 和 capath 代表 CA 证书和 CA 证书的路径。如果使用HTTPS则需要用到。
  • cadefault 目前已弃用。
  • context 参数必须是 ssl.SSLContext 类型,用来指定 SSL 设置

抓取网页内容

使用 urllib.request.urlopen 可以很方便的获取网页内容,我们以获取 http://httpbin.org 内容为例,介绍 urlopen 的使用方法

7f45b3689ec595fa3fa303932b6d3846.png

运行结果如下:

0e7f359b8210a632d40febf450dc5078.png

网络请求难免会遇到长时间无法正常连接的问题,此时可以通过设置超时时间「timeout」,使 urlopen 方法在一定时间内无法连接时自动退出,以免影响整个程序的运行。我们可以通过以下方式来设置超时时间

05c349a390ad53208205617957833eef.png


以上代码设置 5 秒钟内无法正常连接,则退出 urlopen 方法。

向服务器提交数据

向服务器提交数据或请求某些需要携带数据的网页时,需要用到 POST 请求,此时只需要将数据以 bytes 的格式传入参数 data 即可。

使用 POST 提交数据的示例如下

b620e2eb487ff93ec7ddfb48ba3d78de.png


执行结果如下

853ff7bf2315c085a6ad742cb86513b8.png

模拟浏览器请求

在前面使用 urlopen 方法完成了简单的 get 和 post 请求,但是仅仅 urlopen 方法中的几个参数不足以构建完整的请求,完整的请求通常包含有 header 等信息,我们可以使用 urllib.request.Request 类来构建含有 header 以及请求方法的网络请求。

c54365d64a6431c3c08b857cb7c4ee0d.png


以下是 urllib.request.Request 的定义:

class urllib.request.Request(url, data=None, headers={}, origin_req_host=None, unverifiable=False, method=None)

af75cb3b3a78908f6561592441d3e49c.png

# -*- coding:utf-8 -*- from urllib import request url ='https://httpbin.org/get' headers = {'User-Agent':"Mozilla/5.0 (Macintosh; Intel Mac OS X 10_14_2) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/72.0.3626.119 Safari/537.36" }

0072fbec8cdb8eda8ebe59b59624ac96.png


运行结果

fd1dce5acec963a55cf668dae6ad44db.png

"User-Agent" : "Mozilla/5.0 (Macintosh; Intel Mac OS X 10_14_2) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/72.0.3626.119 Safari/537.36" }, "origin": "119.137.3.11, 119.137.3.11", "url": "https://httpbin.org/get" }

从运行结果中可以看出,http://httpbin.org 的放回数据中包含有我们提交给 http://httpbin.org 的浏览器信息。

urllib.error

网络通信是一个异步的通信过程,不可避免的会出现异常,此时就要用到 urllib.error 来处理错误『若不处理错误会造成程序中断执行』,这个会增加程序的健壮性。

urlib.error 中有三个异常处理类,分别是 URLError、HTTPError 和 ContentToolShortError。

URLError 是 urllib.error 异常的类的基类,URLError 是 OSError 的子类,当程序在运行过程中出现错误时会触发该异常。URLError 类带有一个 reason 属性,返回异常的原因,reason 是一个消息字符串或者是一个异常实例。

URLError 示例代码:

e3a95619a9962accf524065e2f194275.png


HTTPError 是专门用于处理 http 和 https 请求错误的异常类,HTTPError 也可以作为一个特殊的文件返回值「它与 URLopen 的返回相同」。HTTPError 是 URLError 的子类,它有 code、reason 和 headers 三个属性,code 是 HTTP 请求的返回吗,reason 同 URLError 中相同是一个表示异常原因的消息字符串,headers 是 HTTP 请求返回的请求头信息。

HTTPError 示例代码:

8e782a6ae7a85cd42d05a27bf1789aad.png
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值