2021-5-15 爬虫学习 list index out of range

爬取网页时,IndexError: list index out of range的错误原因及解决方案(针对上一篇博客遇到的问题进行总结。)

在爬取糗事百科时,遇到了这个问题。研究后发现是使用Xpath定位目标内容时,框架定义错了。

# 解析详情页的内容
def parse_detail(url):
    qiushi = {}
    resp = requests.get(url, headers=Headers)
    text = resp.content.decode("utf-8", "ignore")
    html = etree.HTML(text)
    DivE = html.xpath("//div[@class='col1 new-style-col1']")[0]
    title = DivE.xpath("//h1[@class='article-title']/text()")[0]
    qiushi["title"] = title
    content = DivE.xpath("//div[@class='content']/text()")[0]
    qiushi["content"] = content

    return qiushi

这里我的目标是爬取段子的标题和内容。但是最开始,因为对Xpath使用不熟悉,认为爬取主页的框架就可以,导致了一直报错。
在这里插入图片描述
所以,在爬取时,我们应该首先爬取详情页的内容,找到详情页的框架
在这里插入图片描述
然后问题解决,成功爬取到段子标题和内容。
在这里插入图片描述

  • 1
    点赞
  • 0
    收藏
    觉得还不错? 一键收藏
  • 打赏
    打赏
  • 1
    评论

“相关推荐”对你有帮助么?

  • 非常没帮助
  • 没帮助
  • 一般
  • 有帮助
  • 非常有帮助
提交
评论 1
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包

打赏作者

S1901

你的鼓励将是我创作的最大动力

¥1 ¥2 ¥4 ¥6 ¥10 ¥20
扫码支付:¥1
获取中
扫码支付

您的余额不足,请更换扫码支付或充值

打赏作者

实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值