爬虫与反爬虫

基本概念

  • 爬虫 - 自动获取网站数据的程序,关键是批量的获取
  • 反爬虫 - 使用技术手段防止爬虫程序的方法
  • 误伤 - 反爬技术将普通用户识别为爬虫,如果误伤过高,效果再好也不能用
  • 成本 - 反爬虫需要的人力和机器成本
  • 拦截 - 成功拦截爬虫,一般拦截率越高,误伤率越高

反爬虫的目的

  • 初级爬虫 - 简单粗暴,不管服务器的压力,容易弄挂网站
  • 数据保护 -
  • 失控的爬虫 - 由于某些情况下,忘记或者无法关闭的爬虫
  • 商业竞争对手

爬虫与反爬虫的对抗过程

下图清晰的反映了爬虫与反爬虫的对抗过程
在这里插入图片描述

评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值