爬虫复习笔记

最新推荐文章于 2024-04-15 19:12:08 发布

KassadinSw

最新推荐文章于 2024-04-15 19:12:08 发布

阅读量430

点赞数

分类专栏：人生苦短，我用Python 文章标签：大数据爬虫

本文链接：https://blog.csdn.net/KassadinSw/article/details/78964553

版权

15 篇文章 1 订阅

订阅专栏

一、“大数据时代”，数据获取的方式：

企业生产的用户数据：大型互联网公司有海量用户，所以他们积累数据有天然的优势。
有数据意识的中小型企业，也开始积累的数据。
数据管理咨询公司：通常这样的公司有很庞大的数据采集团队，一般会通过市场调研、问卷调查、固定的样本检测，
和各行各业的公司进行合作、专家对话（数据积累很多年了，最后得出科研结果）来采集数据。
政府/机构提供的公开数据：政府通过各地政府统计上报的数据进行合并；机构都是权威的第三方网站。
第三方数据平台购买数据：通过各个数据交易平台来购买各行各业需要的数据，根据获取难度不同，价格也会不同。
爬虫爬取数据：如果市场上没有我们需要的数据，或者价格太高不愿意买，那么就可以招/做一个爬虫工程师，从互联网上定向采集数据。

二、什么是爬虫？

爬虫：就是抓取网页数据的程序。

三、爬虫怎么抓取网页数据：

网页三大特征：

-1. 网页都有自己唯一的URL（统一资源定位符）来进行定位
-2. 网页都使用HTML （超文本标记语言）来描述页面信息。
-3. 网页都使用HTTP/HTTPS（超文本传输协议）协议来传输HTML数据。

爬虫的设计思路：
-1. 首先确定需要爬取的网页URL地址。
-2. 通过HTTP/HTTP协议来获取对应的HTML页面。
-3. 提取HTML页面里有用的数据：
a. 如果是需要的数据，就保存起来。
b. 如果是页面里的其他URL，那就继续执行第二步。

四、为什么选择Python做爬虫？

可以做爬虫的语言有很多，如 PHP、Java、C/C++、Python等等…

PHP 虽然是世界上最好的语言，但是他天生不是干这个的，而且对多线程、异步支持不够好，并发处理能力很弱。
爬虫是工具性程序，对速度和效率要求比较高。
Java 的网络爬虫生态圈也很完善，是Python爬虫最大的对手。但是Java语言本身很笨重，代码量很大。
重构成本比较高，任何修改都会导致代码的大量变动。爬虫经常需要修改部分采集代码。
C/C++ 运行效率和性能几乎最强，但是学习成本很高，代码成型比较慢。
能用C/C++做爬虫，只能说是能力的表现，但是不是正确的选择。
Python 语法优美、代码简洁、开发效率高、支持的模块多，相关的HTTP请求模块和HTML解析模块非常丰富。
还有强大的爬虫Scrapy，以及成熟高效的 scrapy-redis分布式策略。
而且，调用其他借口也非常方便（胶水语言）

关注