猫眼电影作为爬虫的必备练手网站,相信每个人都试过吧? 那么这篇文章,我就再爬一次猫眼电影,而且用上正则和xpath一起,分别保存为excel表格和csv表格,(text文本这个就太简单了,自动忽略), 所以这篇文章,虽然网站熟悉,但是内容上的干货确实不少。希望大家能学到一点东西!
爬虫思路:
-
本次爬取网站为: https://maoyan.com/board/4?offset=0
-
本次爬虫函数库:
这些函数库没有的话 就自己下载一下, 下载慢出现timeout的话,需要搭配一下国内镜像网站。 百度一下 清华镜像
-
本次爬虫代码思路: 面向过程的简单操作
-
本次爬虫主要侧重于解析页面和保存数据二大模块,有需求可以直接跳转阅读。
分析页面:
拿到这个网站的第一步,就是分析页面, 切不可着急,直接套用代码而上!
-
查看网页源代码之后, 你可以找到页面中对应的数据, 如图: