python从入门到放弃篇34(selenium库开启万花筒写轮眼)开启无界面模式,爬取豆瓣名著

今天,突然发现,selenium库不开万花筒的话,有点脑热,因为,每爬一页就打开一个网页,除非我是撕裂者3990X的CPU,64核,128线的,但是,我的CPU不是,所以,怕到时候打开页面太多,直接卡机废了。。我就去搜了开启万花筒模式,这样就更好了,直接爬数据不用打开浏览器页面。

这次案例的网址是:https://book.douban.com/tag/%E5%90%8D%E8%91%97?start=0&type=T

完整代码:

首先,我们先导入需要用到的库,selenium库和time库。然后,开启selenium的万花筒模式(无界面),即不打开网页就能爬取信息。所以有:
在这里插入图片描述
然后,我们观察url地址,发现,它的start值会随着翻页规律性增加,每次增加20,等到start值达到980的时候,停止增加,因为start=980的时候,就是最后一页了。所以,我们可以人为构造url地址,我们观察网页结构,发现通过提取ul标签,可以将整个页面的内容抓取下来,如下图:
在这里插入图片描述
在这里插入图片描述
所以有:
在这里插入图片描述
运行结果,随机抽取开头和结尾截图,剩下的就不截图了,请大家见谅。
在这里插入图片描述
在这里插入图片描述
接着,我们要给我们的工作留个纪念,要不然太亏了,我选择以csv的文件格式保存数据。修改代码,如下图:
在这里插入图片描述
静等一小段时间后,运行结果:
在这里插入图片描述
pycharm编辑器路径下面找到保存的文件,如下图:
在这里插入图片描述
打开,如下图,数据太多不便截图,请大家谅解:
在这里插入图片描述
在这里插入图片描述
pycharm编辑器中打开文件,如下图,数据太多不便截图,请大家谅解:
在这里插入图片描述
在这里插入图片描述
在这里插入图片描述
过瘾,第一次爬了将近5000行的数据,就一个字,爽!!这次学会开启万花筒写轮眼,这将是我陷入万花筒不能自拔的开始。。。。

最后,感谢大家前来阅读鄙人的文章,文中或有诸多不妥之处,还望指出和海涵。

  • 5
    点赞
  • 0
    收藏
    觉得还不错? 一键收藏
  • 打赏
    打赏
  • 0
    评论

“相关推荐”对你有帮助么?

  • 非常没帮助
  • 没帮助
  • 一般
  • 有帮助
  • 非常有帮助
提交
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包

打赏作者

不羁_神话

感谢支持,欢迎交流。

¥1 ¥2 ¥4 ¥6 ¥10 ¥20
扫码支付:¥1
获取中
扫码支付

您的余额不足,请更换扫码支付或充值

打赏作者

实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值