基于Python的bilibili会员购数据爬取

最新推荐文章于 2024-10-14 15:25:05 发布

喜欢你，还有大家

最新推荐文章于 2024-10-14 15:25:05 发布

阅读量3.7k

点赞数 6

分类专栏：大数据Python基础学习文章标签： python 开发语言 pip

本文链接：https://blog.csdn.net/m0_68754495/article/details/128718981

版权

一、确定好需要爬取的网站

二、右键检查网页源码，找到所需要爬取的数据所在的位置

通过分析链接可得所需要爬取的数据都在这个页面，并且通过链接可以看到不通的页面page和不通的类型type之间都有差别，可以通过这些差别来爬取不同页面或不同类型的数据。

三、编写代码来爬取数据（这里我只用了最粗糙的代码，便于理解。）

import requests
from lxml import etree
import time
import re
import os
import threading
lists = ['%E5%85%A8%E9%83%A8%E7%B1%BB%E5%9E%8B','%E6%BC%94%E5%87%BA','%E5%B1%95%E8%A7%88','%E6%9C%AC%E5%9C%B0%E7%94%9F%E6%B4%BB']
def get_txt():
    headers = {
        'User-Agent': 'Mozilla/5.0 (Windows NT 10.0; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/92.0.4515.131 Safari/537.36 SLBrowser/8.0.0.9231 SLBChan/105'