一、Web请求过程解析
1.服务器渲染:在服务器端把数据和html整合在一起,统一返回给浏览器。(在页面源代码中科院看到数据)
2.客户端渲染:第一次请求只要html骨架,第二次请求数据,在客户端进行拼接展示。(在页面源代码中看不到数据)
二、HTML协议
爬虫中需要注意:反爬基本都是出现在请求头和响应头
请求头:
1.UserAgent:请求载体的身份标识(用get还是post发送请求)
GET:查询时使用(显示提交)
POST:对数据进行修改时(隐式提交)
2.Referer:防盗链(反爬中使用,请求是从哪个页面来的)
3.cookie:本地字符串数据信息(用户登录信息,反爬cookie)
响应头:
1.cookie:本地字符串数据信息(用户登录信息,反爬cookie)
2.各种字符串(一般是token,防止攻击和反爬