使用requests库和lxml解析爬取电影天堂电影信息

最新推荐文章于 2020-04-02 19:20:10 发布

Eric_ariel

最新推荐文章于 2020-04-02 19:20:10 发布

阅读量1.6k

点赞数

分类专栏：爬虫文章标签： requests 电影天堂 lxml

本文链接：https://blog.csdn.net/Eric_ariel/article/details/89203461

版权

使用requests库获取电影天堂电影信息，将所有链接保存下来后可以使用迅雷批量下载。快速获得最新最全电影资源！

站点分析

以电影天堂国内电影为例
http://www.ygdy8.net/html/gndy/china/index.html
页面分析
分析其目录内每一个电影信息存在table中，首先我们要获取每一个电影的详情地址

所有电影信息的详情链接获取

通过request，获取页面源码，xpath取得所有class="tbspan"的table下面的class="ulink"的a标签的@href的值，由于是相对地址，因此需要与网站地址base_url进行拼接。最后得到的就是该页面所有电影的详情地址。

base_url='http://www.ygdy8.net'
url='http://www.ygdy8.net/html/gndy/china/index.html'
def get_content(url):
    resp=requests.get(url)
    text=resp.content.decode(encoding='gbk', errors='ignore')
    html=etree.HTML(text)
    urls=html.xpath('//table[@c

最低0.47元/天解锁文章

Eric_ariel

关注

0
点赞
踩
1

收藏

觉得还不错? 一键收藏
0
评论
使用requests库和lxml解析爬取电影天堂电影信息

使用requests库获取电影天堂电影信息，将所有链接保存下来后可以使用迅雷批量下载。快速获得最新最全电影资源！站点分析以电影天堂国内电影为例http://www.ygdy8.net/html/gndy/china/index.html分析其目录内每一个电影信息存在table中，首先我们要获取每一个电影的详情地址所有电影信息的详情链接获取通过request，获取页面源码，xpath取...
复制链接

扫一扫