提取数据xpath,re,css

最新推荐文章于 2022-08-18 18:32:52 发布

aa_2017

最新推荐文章于 2022-08-18 18:32:52 发布

阅读量160

点赞数

文章标签：爬虫

原文链接：http://www.cnblogs.com/7134g/p/11510509.html

版权

XPATH

（1）/ 逐层提取

（2）text() 提取标签下面的文本

（3）//标签名提取所有的标签

（4）//标签名[num>=1] 提取相同标签名的兄弟节点。
<tr class="h">
<td class="l" width="374">职位名称</td>
<td class="">职位类别</td>
<td class="">人数</td>
<td class="">地点</td>
<td class="">发布时间</td>
</tr>
xpath('/tr[@class="h"]/td[1]/text()') #职位名称
xpath('/tr[@class="h"]/td[2]/text()') #职位类别
xpath('/tr[@class="h"]/td[3]/text()') #人数
xpath('/tr[@class="h"]/td[3]/text()') #地点

（5）//标签名[@属性='属性值'] 提取属性为...的标签
//a[@class='noactive']
//a[@class='noactive' and @id='next']

（6）@属性名取某个属性

=============================================================

RE

re.compile(pattern, flags=0)
flags 标志位参数

re.I(re.IGNORECASE)
使匹配对大小写不敏感

re.L(re.LOCAL)
做本地化识别（locale-aware）匹配

re.M(re.MULTILINE)
多行匹配，影响 ^ 和 $

re.S(re.DOTALL)
使 . 匹配包括换行在内的所有字符

re.U(re.UNICODE)
根据Unicode字符集解析字符。这个标志影响 \w, \W, \b, \B.

re.X(re.VERBOSE)
该标志通过给予你更灵活的格式以便你将正则表达式写得更易于理解。

============================================================

转载于:https://www.cnblogs.com/7134g/p/11510509.html

关注

0
点赞
踩
0

收藏

觉得还不错? 一键收藏
0
评论
提取数据xpath,re,css

XPATH（1）/ 逐层提取（2）text() 提取标签下面的文本（3）//标签名提取所有的标签（4）//标签名[num>=1] 提取相同标签名的兄弟节点。 <tr class="h"> <td class="l" width="374">职位名称</td> <td class="">职位类别&...
复制链接

扫一扫

aa_2017 CSDN认证博客专家 CSDN认证企业博客

码龄9年

0: 原创

-: 周排名

167万+: 总排名

6143: 访问

: 等级

30: 积分

0: 粉丝

1: 获赞

0: 评论

7: 收藏

私信

关注

热门文章

您愿意向朋友推荐“博客详情页”吗？

强烈不推荐
不推荐
一般般
推荐
强烈推荐

提交

最新文章

目录

评论

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。