python下载电影天堂_【PY】没有电影看?来教你用Python爬取电影天堂最新电影!...

项目开始

第一步仍然是创建scrapy项目与spider文件

切换到工作目录两条命令依次输入

scrapy startproject xunleidianying

scrapy genspider xunleiBT https://www.xl720.com/thunder/years/2019

内容分析

打开目标网站(分类是2019年上映的电影),分析我们需要的数据8e449e4fad2c9a675ebc5b450c296702a5f92e28.png

进入页面是列表的形式就像豆瓣电影一样,然后我们点进去具体页面看看be0e080f270d3bf96918c0df6811217eb529a122.png

这个页面就是我们需要拿到的内容页面,我们来看我们需要哪些数据(某些数据从第一个页面就可以获得,但是下载地址必须到第二个页面)电影名称

电影信息

电影内容剧情

电影下载地址

分析完成之后就可以首先编写 items.py文件a4fc854845e962103ec77ef5123b5f92de6cfb7b.png

另外别忘了去settings.py中开启 ITEM_PIPELINES 选项

爬虫文件编写

老样子,为了方便测试我们的爬虫,首先编写一个main.py的文件方便IDE调用

main.py:

import scrapy.cmdline

scrapy.cmdline.execute('scrapy crawl xunleiBT'.split())

首先我们先测试直接向目标发送请求是否可以得到响应

爬虫文件 xunleiBT.py编写如下:cc82b9c9c84b0d36faa9a3602fd96658362c9334.png

运行 main.py 看看会出现什么cb057fe3001e76fe46d28e1c13b225adb61addb8.png

好的,发现直接返回正常的网页也就是我们要的网页,说明该网站没有反爬机制,这样我们就更容易爬取了

然后通过xpath定位页面元素,具体就不再赘述,之前的scarpy教程中都有 继续编写爬虫文件936a63e58b0d7ee6bf69c2ef28ec047d22971485.jpg

ITEM爬取完成后该干什么?当然是入库保存了,编写pipelines.py文件进行入库保存

再次提醒别忘了去settings.py中开启 ITEM_PIPELINES 选项

pipelines.py文件代码如下:7f6e5876df4ca0409e5f9f94a96ab2b982ad790c.png

再次运行main.py 等待运行完成后打开数据库查询

67320d10eb0d8b9f8dd98601d200b4bd05543306.png

数据保存完成,这次我们一共导入了380个数据,可以愉快的查看电影了

评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值