网络爬虫概述

网络爬虫了解

  • 爬虫是一个模拟人类请求网站行为的程序。可以自动请求网页,并把数据抓取下来,然后使用一定的规则提取有价值的数据。
  • 实际例子:搜索引擎(谷歌、百度等)

通用爬虫和聚焦爬虫

  • 通用爬虫是搜索引擎系统的重要组成部分,主要将互联网上的网页下载到本地,形成一个互联网内容的镜像备份。
  • 聚焦爬虫是面向特定需求的一种爬虫程序,与通用爬虫的区别在于,聚焦爬虫在实施网页抓取的时候会对内容进行筛选和处理,尽量保证之抓取与需求相关的网页信息。

Python写爬虫优势

  • PHP天生不做这个,且对多线程、异步支持不是很好,并发处理能力弱。爬虫是工具性程序,对速度和效率要求比较高。
  • Java生态圈很完善,是Python爬虫最大竞争对手,但Java语言本身很笨重,代码量极大,重构成本比较高,任何修改会导致代码大量改动。爬虫经常要修改采集代码。
  • C/C++运行效率是无敌的。但是学习和开发成本高,写个小爬虫程序可能要大半天时间。
  • Python语法优美、代码简洁、开发效率高、支持模块多。相关的HTTP请求和HTML解析模块非常丰富,还有scrapy和scrapy-redis框架让爬虫开发变得异常简单。
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值