Python爬虫：XPath解析爬取豆瓣电影Top250示例

最新推荐文章于 2024-10-02 10:53:34 发布

m0_64880493_江哥

最新推荐文章于 2024-10-02 10:53:34 发布

阅读量467

点赞数 2

文章标签： python 爬虫开发语言

本文链接：https://blog.csdn.net/m0_64880493/article/details/138474278

版权

文章介绍了如何使用Python编写一个爬虫程序，通过processing函数处理字符串并从豆瓣电影Top250页面抓取电影名称、导演演员、评分、评价人数和总结。程序通过循环每25页获取电影信息，模拟随机等待时间以避免被封禁。

摘要由CSDN通过智能技术生成

一、示例的函数说明：

函数processing()：用于处理字符串中的空白字符，并拼接字符串。

主函数程序入口：每页显示25部影片，实现循环，共10页。通过format方法替换切换的页码的url地址。然后调用实现爬虫程序的函数get_movie_info()，获取电影信息。

二、示例代码：

from lxml import etree
import time
import random
import requests

headers = {
    'User-Agent': 'Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) '
                  'Chrome/117.0.0.0 Safari/537.36'
}


def processing(strs):
    s = ''
    for n in strs:
        n = ''.join(n.split())
        s = s + n
    return s


def get_movie_info(url):
    response = requests.get(url, headers=headers)
    html = etree.HTML(response.text)
    div_all = html.xpath('//div[@class="info"]')
    for div in div_all:
        names = div.xpath('./div[@class="hd"]/a//span/text()')
        name = processing(names)
        infos = div.xpath('./div[@class="bd"]/p/text()')
        info = processing(infos)
        score = div.xpath('./div[@class="bd"]/div/span[2]/text()')
        evaluation = div.xpath('./div[@class="bd"]/div/span[4]/text()')
        summary = div.xpath('./div[@class="bd"]/p[@class="quote"]/span/text()')
        print('电影名称：', name)
        print('导演与演员：', info)
        print('影片评分：', score)
        print('评价人数：', evaluation)
        print('影片总结：', summary)
        print('-------分割线-------')


if __name__ == '__main__':
    for i in range(0, 250, 25):
        url = 'https://movie.douban.com/top250?start={page}&filter='.format(page=i)
        get_movie_info(url)
        time.sleep(random.randint(1, 3))