爬虫框架Scrapy学习记录II--Selector学习

最新推荐文章于 2024-01-24 17:28:23 发布

qq_30717683

最新推荐文章于 2024-01-24 17:28:23 发布

阅读量413

点赞数

分类专栏： python 文章标签：框架

版权声明：本文为博主原创文章，遵循 CC 4.0 BY-SA 版权协议，转载请附上原文出处链接和本声明。

本文链接：https://blog.csdn.net/qq_30717683/article/details/68949192

版权

python 专栏收录该内容

18 篇文章

订阅专栏

Selectors （选择器）

当抓取网页时，一般都是从HTML源码中提取数据。
- BeautifulSoup—网页分析库，缺点慢
- lxml，基于ElementTree的XML解析库
Scrapy 拥有自己一套机制。即为选择器（selectors），通过特定的 XPath 和 CSS 表达式来选择HTML文件中的某个部分
- XPath 是一门用来在XML文件中选择节点的语言，也可以用在HTML上。 CSS 是一门将HTML文档样式化的语言。选择器由它定义，并与特定的HTML元素的样式相关连。
  - example ：
    /html/head/title: 选择HTML文档元素下面的标签。
    /html/head/title/text(): 选择前面提到的元素下面的文本内容
    //td: 选择所有元素
    //div[@class=”mine”]: 选择所有包含 class=”mine” 属性的div 标签元素
  - 路径的意义：
    nodename ：选取此节点的所有子节点。
    / ：从根节点选取。
    // ：匹配所选择的当前节点来选择文档中的节点，而不考虑它们的位置。
    . ：选取当前节点。
    .. ：选取当前节点的父节点。
    @ ：选取属性。
- Scrapy 选择器构建于 lxml 库之上，这意味着它们在速度和解析准确性上非常相似。

大量实例：
response.css(‘title’) #选取title元素完整内容
response.css(‘title::text’) #只选取title元素的文本
response.css(‘title::text’).re(r’(\w+) to (\w+)’) #搭配正则选取
response.css(‘img’).xpath(‘@src’).extract() #css和xpath搭配使用选取img元素中src属性的值

response.xpath(‘//base/@href’).extract() #选取base元素中的href属性
response.css(‘base::attr(href)’).extract() #选取base元素中的href属性
response.css(‘img::attr(src)’).extract() #获得图片的下载地址

response.xpath(‘//a[contains(@href, “image”)]/text()’).re(r’Name:\s*(.*)’) #选取a元素中属性为href 包含image文字的文本

response.css(“span.text::text”).extract_first() #选取span类名字为text的文本

response.css(‘div.tags a.tag::text’).extract() #选取类名字为tags的div元素下类名字为tag的a元素的文本信息

评论

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。