Python爬虫实践(三)设置Headers

最新推荐文章于 2024-07-24 10:39:56 发布

Ian ma

最新推荐文章于 2024-07-24 10:39:56 发布

阅读量4w

点赞数 6

分类专栏： Python 文章标签： python 爬虫

本文链接：https://blog.csdn.net/horseinch/article/details/51720630

版权

Python 专栏收录该内容

30 篇文章 1 订阅

订阅专栏

例子：以登录知乎为例

import urllib2
import urllib

values={"username":"XXXX@qq.com","password":"XXXX"}
data=urllib.urlencode(values)
url= "https://www.zhihu.com/#signin"
request=urllib2.Request(url,data)
response=urllib2.urlopen(request)
print response.read()

以上程序运行之后无法登录知乎，错误如下：

    raise HTTPError(req.get_full_url(), code, msg, hdrs, fp)
HTTPError: HTTP Error 403: Forbidden

出现urllib2.HTTPError: HTTP Error 403: Forbidden错误是由于网站禁止爬虫，可以在请求加上头信息，伪装成浏览器访问.

在登录之后的知乎首页按F12->network,点击第一个请求，查看headers，可看到General、Response Headers 、Request Headers三个分类，有

Request URL: https://www.zhihu.com/
Request Method:GET
User-Agent:Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/51.0.2704.103 Safari/537.36

等等参数。

其中，agent就是请求的身份，如果没有写入请求身份，那么服务器不一定会响应，所以可以在headers中设置agent,

import urllib2
import urllib

values={"username":"xxxx","password":"xxxxx"}
data=urllib.urlencode(values)
url= "https://www.zhihu.com/#signin"
user_agent="Mozilla/5.0 (Windows NT 10.0; Win64; x64)"
referer='http://www.zhihu.com/articles'
headers={"User-Agent":user_agent,'Referer':referer}
request=urllib2.Request(url,data,headers)
response=urllib2.urlopen(request)
print response.read()

好吧，知乎好像不行啊，好像有什么反爬虫机制什么的。

算了降低难度，直接不登录扒一扒自己的博客看看：

import urllib2
import urllib

url= "http://blog.csdn.net/horseinch"
user_agent="Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/51.0.2704.103 Safari/537.36"
headers={"User-Agent":user_agent}
request=urllib2.Request(url,headers=headers)
response=urllib2.urlopen(request)
print response.read()

运行正常（不加header运行失败）。

Ian ma

关注

6
点赞
踩
23

收藏

觉得还不错? 一键收藏
0
评论
Python爬虫实践(三)设置Headers

例子：以登录知乎为例import urllib2import urllibvalues={"username":"XXXX@qq.com","password":"XXXX"}data=urllib.urlencode(values)url= "https://www.zhihu.com/#signin"request=urllib2.Request(url,data)response=u
复制链接

扫一扫

专栏目录