Python网络爬虫专业级框架_scrapy

最新推荐文章于 2024-05-21 10:35:05 发布

Anderslu

最新推荐文章于 2024-05-21 10:35:05 发布

阅读量5.6k

点赞数 1

分类专栏： Python 把python带回家文章标签： python 网络爬虫

本文链接：https://blog.csdn.net/anderslu/article/details/65981661

版权

Python 同时被 2 个专栏收录

31 篇文章 2 订阅

订阅专栏

把python带回家

28 篇文章 2 订阅

订阅专栏

首先感慨下当今的互联网，08年刚来北京工作的时候什么也没有、出去面试全凭一张纸质的北京地图跟一张嘴、学习还停留在看书的阶段(天天上下班的公交车上看书看到睡着，哈哈)。
通过这段时间的学习，初步掌握了如下的几个技术点：Request库(自动抓取html页面)、网络爬虫标准(robots)、Beautiful Soup库(解析html页面)、Re(python自带的正则表达式库)、Scrapy(专业爬虫框架)。
这里写图片描述

scrapy介绍：

Scrapy，Python开发的一个快速,高层次的屏幕抓取和web抓取框架，用于抓取web站点并从页面中提取结构化的数据。Scrapy用途广泛，可以用于数据挖掘、监测和自动化测试。
Scrapy吸引人的地方在于它是一个框架，任何人都可以根据需求方便的修改。它也提供了多种类型爬虫的基类，如BaseSpider、sitemap爬虫等，最新版本又提供了web2.0爬虫的支持。
这里写图片描述

scrapy框架的安装：

这里写图片描述

Scrapy初步使用记录:

创建一个Scrapy爬虫工程：

这里写图片描述

在工程中产生一个Scrapy爬虫：

这里写图片描述

配置产生的spider爬虫：

修改上一步产生的demo.py内的代码。

运行爬虫获取网页：

第一次运行失败，错误如下截图：
这里写图片描述
接下来处理掉这个错误：下载pywin32：

下载完双击安装即可，安装过程中它会自动跟我们本机的python安装程序对应起来。
再次运行，成功抓取了互联网网页内容：

Scrapy使用步骤总结:

第一步：创建工程；
第二步：编写Spider；
第二步：编写Item Pipeline；
第四步：优化配置策略；
由衷的感谢MOOC平台下的嵩天老师，分享了很多全面又实用的课程，大家可以参加试试：Python网络爬虫与信息提取课程。

Anderslu

关注

1
点赞
踩
11

收藏

觉得还不错? 一键收藏
0
评论
Python网络爬虫专业级框架_scrapy

首先感慨下当今的互联网，08年刚来北京工作的时候什么也没有、出去面试全凭一张纸质的北京地图跟一张嘴、学习还停留在看书的阶段(天天上下班的公交车上看书看到睡着，哈哈)。通过这段时间的学习，初步掌握了如下的几个技术点：Request库(自动抓取html页面)、网络爬虫标准(robots)、Beautiful Soup库(解析html页面)、Re(python自带的正则表达式库)、Scrapy(专业爬虫框架)。
复制链接

扫一扫