Python爬虫实践(三)设置Headers

原创 2016年06月20日 14:44:43

例子:以登录知乎为例

import urllib2
import urllib

values={"username":"XXXX@qq.com","password":"XXXX"}
data=urllib.urlencode(values)
url= "https://www.zhihu.com/#signin"
request=urllib2.Request(url,data)
response=urllib2.urlopen(request)
print response.read()

以上程序运行之后无法登录知乎,错误如下:

    raise HTTPError(req.get_full_url(), code, msg, hdrs, fp)
HTTPError: HTTP Error 403: Forbidden

出现urllib2.HTTPError: HTTP Error 403: Forbidden错误是由于网站禁止爬虫,可以在请求加上头信息,伪装成浏览器访问.


在登录之后的知乎首页按F12->network,点击第一个请求,查看headers,可看到GeneralResponse HeadersRequest Headers三个分类,有

  • Request URL: https://www.zhihu.com/
  • Request Method:GET
  • User-Agent:Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/51.0.2704.103 Safari/537.36

等等参数。

其中,agent就是请求的身份,如果没有写入请求身份,那么服务器不一定会响应,所以可以在headers中设置agent,

import urllib2
import urllib

values={"username":"xxxx","password":"xxxxx"}
data=urllib.urlencode(values)
url= "https://www.zhihu.com/#signin"
user_agent="Mozilla/5.0 (Windows NT 10.0; Win64; x64)"
referer='http://www.zhihu.com/articles'
headers={"User-Agent":user_agent,'Referer':referer}
request=urllib2.Request(url,data,headers)
response=urllib2.urlopen(request)
print response.read()

好吧,知乎好像不行啊,好像有什么反爬虫机制什么的。

算了 降低难度,直接不登录扒一扒自己的博客看看:

import urllib2
import urllib

url= "http://blog.csdn.net/horseinch"
user_agent="Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/51.0.2704.103 Safari/537.36"
headers={"User-Agent":user_agent}
request=urllib2.Request(url,headers=headers)
response=urllib2.urlopen(request)
print response.read()

运行正常(不加header运行失败)。

版权声明:本文为博主原创文章,未经博主允许不得转载。

Python爬虫实践(三)设置Headers

例子:以登录知乎为例import urllib2 import urllibvalues={"username":"XXXX@qq.com","password":"XXXX"} data=urlli...
  • horseinch
  • horseinch
  • 2016年06月20日 14:44
  • 14823

python-网络爬虫初学二:headers的设置和一些高级特性

一、设置headers url = "http://www.server.com/login" # 设置请求的身份,如果没有,服务器可能会没有响应 user_agent = "Mozilla/4.0...
  • Hz_ZDeveloper
  • Hz_ZDeveloper
  • 2017年04月14日 15:35
  • 4840

Python爬虫:一些常用的爬虫技巧总结(IP,cookie,header,多线程)

http://python.jobbole.com/84622/ 用python也差不多一年多了,python应用最多的场景还是web快速开发、爬虫、自动化运维:写过简单...
  • sherri_du
  • sherri_du
  • 2016年05月17日 09:31
  • 6745

http请求(Python爬虫headers)

在http请求中,第一行必须是一个请求行,用来说明请求类型,要访问的资源,以及使用的HTTP版本; 然后是一个首部(header)小节,用来说明服务器要使用的附加信息。 :在首部之后是一个空行,...
  • hardhard123
  • hardhard123
  • 2017年03月12日 21:01
  • 332

妹子图爬虫,最重要的是请求头headers设置'Referer':'http://www.mzitu.com/'

获取网页源代码及设置http请求头 import requests from bs4 import BeautifulSoup import osheaders = {'User-Agent':"Mo...
  • Jamin2018
  • Jamin2018
  • 2017年12月11日 14:51
  • 139

ajax跨域请求实践+headers 设置

解决跨域调用服务并设置headers 主要的解决方法需要通过服务器端设置响应头、正确响应options请求,正确设置 JavaScript端需要设置的headers信息 方能实现。 1.第一步 ...
  • u014136161
  • u014136161
  • 2016年10月04日 23:36
  • 1355

Python爬虫实践(四):一些不常用设置

代理设置urllib2默认会使用环境变量 http_proxy 来设置 ==HTTP Proxy==。假如一个网站它会检测某一段时间某个IP 的访问次数,如果访问次数过多,它会禁止你的访问。所以你可以...
  • horseinch
  • horseinch
  • 2016年06月20日 15:31
  • 401

Python网络爬虫从入门到实践代码范例

  • 2018年01月04日 15:09
  • 2.92MB
  • 下载

"玩转Python爬虫——入门与实践"课程源码

  • 2017年05月09日 16:55
  • 2.51MB
  • 下载

Python中文资料书籍源码爬虫项目实践最全资料集合.

  • 2017年12月03日 08:31
  • 57.4MB
  • 下载
内容举报
返回顶部
收藏助手
不良信息举报
您举报文章:Python爬虫实践(三)设置Headers
举报原因:
原因补充:

(最多只允许输入30个字)