爬虫实战2-猫眼电影top100

import requests
from pyquery import PyQuery

header = {
    'User-Agent': 'Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/80.0.3987.149 Safari/537.36'}


def get_html(url, header=''):
    '''
    :param url: 要访问的地址
    :param header: 设置请求头
    :return: 返回响应数据
    '''
    response = requests.get(url, headers=header, timeout=3)
    # 如果状态码200  表示成功
    if response.status_code == 200:
        # 设置编码
        response.encoding = response.apparent_encoding
        # 返回数据
        return response.text
    else:
        print('访问 {} 失败了。。 {}'.format(url, response.status_code))
        return None


def parser_html(html):
    '''
    :param html: 需要处理的html
    :return: 返回当前页面的数据
    '''
    doc = PyQuery(html)
    title = doc('title')
    name = doc('p.name a')
    star = doc('p.star')
    releasetime = doc('p.releasetime')
    img = doc('.image-link img.board-img')
    integer = doc('i.integer')
    fraction = doc('i.fraction')
    print(title.text())
    data = []
    for i in range(len(name)):
        info = '电影名' + name[i].text + star[i].text.strip() + releasetime[i].text[5:] + '图片' + img[i].get(
            'data-src') + '分数:' + (integer[i].text + fraction[i].text)
        print(info)
        data.append(info)
    return data


def save_data(data, path=''):
    '''
    :param data: 要保存的数据
    :param path: 保存的路径
    :return:
    '''
    # 保存数据
    with open(path, 'a', encoding='utf-8') as f:
        for i in data:
            f.write(i + '\n')


def main(url):
    print('q')  # 获取当前页面
    html = get_html(url, header=header)
    # 解析当前页
    data = parser_html(html)
    # 保存当前数据集
    save_data(data, '猫眼电影top100.txt')


if __name__ == '__main__':
    for i in range(10):
        main(f'https://maoyan.com/board/4?offset={i*10}')

  • 0
    点赞
  • 0
    收藏
    觉得还不错? 一键收藏
  • 1
    评论
### 内容概要 《计算机试卷1》是一份综合性的计算机基础和应用测试卷,涵盖了计算机硬件、软件、操作系统、网络、多媒体技术等多个领域的知识点。试卷包括单选题和操作应用两大类,单选题部分测试学生对计算机基础知识的掌握,操作应用部分则评估学生对计算机应用软件的实际操作能力。 ### 适用人群 本试卷适用于: - 计算机专业或信息技术相关专业的学生,用于课程学习或考试复习。 - 准备计算机等级考试或职业资格认证的人士,作为实战演练材料。 - 对计算机操作有兴趣的自学者,用于提升个人计算机应用技能。 - 计算机基础教育工作者,作为教学资源或出题参考。 ### 使用场景及目标 1. **学习评估**:作为学校或教育机构对学生计算机基础知识和应用技能的评估工具。 2. **自学测试**:供个人自学者检验自己对计算机知识的掌握程度和操作熟练度。 3. **职业发展**:帮助职场人士通过实际操作练习,提升计算机应用能力,增强工作竞争力。 4. **教学资源**:教师可以用于课堂教学,作为教学内容的补充或学生的课后练习。 5. **竞赛准备**:适合准备计算机相关竞赛的学生,作为强化训练和技能检测的材料。 试卷的目标是通过系统性的题目设计,帮助学生全面复习和巩固计算机基础知识,同时通过实际操作题目,提高学生解决实际问题的能力。通过本试卷的学习与练习,学生将能够更加深入地理解计算机的工作原理,掌握常用软件的使用方法,为未来的学术或职业生涯打下坚实的基础。
### 内容概要 这份《计算机试卷1》包含多个部分,主要覆盖了计算机基础知识、操作系统应用、文字处理、电子表格、演示文稿制作、互联网应用以及计算机多媒体技术。试卷以单选题开始,涉及计算机历史、基本概念、硬件组成、软件系统、网络协议等。接着是操作应用部分,要求考生在给定的软件环境中完成一系列具体的计算机操作任务。 ### 适用人群 本试卷适用于计算机科学与技术、信息技术相关专业的学生,以及准备计算机水平考试或职业资格认证的人士。它适合那些希望检验和提升自己计算机操作能力的学习者,也适用于教育工作者作为教学评估工具。 ### 使用场景及目标 1. **学习评估**:作为教育机构的课程评估工具,帮助教师了解学生对计算机基础知识的掌握程度。 2. **自学检验**:供个人自学者检验自己的计算机操作技能和理论知识,为进一步学习提供方向。 3. **职业发展**:为职场人士提供计算机技能的自我提升途径,增强其在信息时代的竞争力。 4. **考试准备**:为准备计算机相关考试的考生提供实战演练的机会,加强考试自信。 5. **教学资源**:教师可以将其作为教学资源,设计课程和实验,提高教学效果。 试卷的目标是通过理论知识的测试和实践技能的操作,全面提升考生的计算机应用能力。考生应掌握从基础的计算机组成原理到复杂的数据处理、演示文稿制作、网络应用以及多媒体技术处理等多方面技能。通过本试卷的学习与练习,考生将能够更加熟练地使用计算机解决实际问题,为未来的学术或职业生涯打下坚实的基础。
要爬取Python爬虫猫眼电影Top100,你可以按照以下步骤进行操作: 1. 首先,定义一个函数get_page(url),用于获取指定URL的HTML源码。这个函数可以使用requests库发送GET请求来获取页面内容。如果返回的状态码为200,表示获取成功,将HTML源码返回;如果状态码不为200,则返回'Crawl Failed'。 2. 在获取HTML源码之后,你需要解析HTML源码来提取所需的电影信息。可以使用正则表达式来匹配HTML源码中的电影排名、名称、主演、上映时间和地区等信息。 3. 创建一个空的DataFrame,用于存储电影信息。DataFrame的列可以分别定义为'Rank'、'Name'、'Actors'、'Date'和'Region'。然后,遍历解析HTML源码后得到的结果列表,将每个电影的信息添加到DataFrame中的相应行和列中。注意在处理演员信息、上映时间和地区字段时要进行相应的处理和清洗。 4. 最后,将DataFrame保存为CSV格式的数据文件,即可得到你所期望的Python爬虫猫眼电影Top100的电影信息。你可以使用pandas库的to_csv方法来实现保存。 下面是一个示例代码,演示了如何爬取猫眼电影Top100的电影信息并保存为CSV文件: import requests import re import pandas as pd def get_page(url): response = requests.get(url) if response.status_code == 200: return response.text else: return 'Crawl Failed' def parse_html(html): pattern = re.compile('<dd>.*?board-index.*?>(\d )</i>.*?name.*?title="(.*?)".*?star.*?主演:(.*?)</p>.*?releasetime.*?上映时间:(.*?)</p>', re.S) result = re.findall(pattern, html) return result html = get_page('https://maoyan.com/board/4') result = parse_html(html) data = pd.DataFrame([], columns=['Rank', 'Name', 'Actors', 'Date', 'Region']) for i, item in enumerate(result): rank = i + 1 name = item actors = item.strip() temp = item.split('(') if len(temp) == 1: date = temp region = '' else: date = temp region = temp[:-1] data.loc[i] = [rank, name, actors, date, region] data.to_csv('maoyan_top100.csv', index=False) 以上代码将会爬取猫眼电影Top100的电影信息,并且保存为名为maoyan_top100.csv的CSV文件。你可以根据实际需求进行修改和扩展。<span class="em">1</span><span class="em">2</span><span class="em">3</span>

“相关推荐”对你有帮助么?

  • 非常没帮助
  • 没帮助
  • 一般
  • 有帮助
  • 非常有帮助
提交
评论 1
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值