数据采集与预处理之xpath爬取豆瓣电影新片榜信息(完整版)

目录

一、xpath获取信息内容的多种方式

二、防止反爬机制

 三、保存获取信息

 四、对不同页面的爬取

五、完整代码


 

一、xpath获取信息内容的多种方式

type=html.xpath('//*[@id="info"]/span[@property="v:genre"]/text()')
nation=html.xpath('//*[@id="info"]/span[@class="pl"][2]/following-sibling::text()')

这两行代码是使用XPath查询语言从HTML文档中提取信息的例子。XPath是用于在XML文档中查找信息的语言,也常用于HTML文档,特别是在网页抓取和数据提取中。 

第一行代码
type=html.xpath('//*[@id="info"]/span[@property="v:genre"]/text()')

这行代码正在尝试从HTML文档中提取与特定元素相关的文本。它查找:
1、一个元素,其id属性值为info。
2、在这个元素内部&#x

  • 22
    点赞
  • 25
    收藏
    觉得还不错? 一键收藏
  • 打赏
    打赏
  • 1
    评论

“相关推荐”对你有帮助么?

  • 非常没帮助
  • 没帮助
  • 一般
  • 有帮助
  • 非常有帮助
提交
评论 1
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包

打赏作者

Mikuc

你的鼓励将是我创作的最大动力

¥1 ¥2 ¥4 ¥6 ¥10 ¥20
扫码支付:¥1
获取中
扫码支付

您的余额不足,请更换扫码支付或充值

打赏作者

实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值