Python爬虫入门【19】： B站博人传评论数据抓取 scrapy

最新推荐文章于 2024-06-12 23:26:22 发布

未衬老师

最新推荐文章于 2024-06-12 23:26:22 发布

阅读量538

点赞数 5

文章标签： Python 爬虫

本文链接：https://blog.csdn.net/weichen090909/article/details/97040928

版权

1. B站博人传评论数据爬取简介

今天想了半天不知道抓啥，去B站看跳舞的小姐姐，忽然看到了评论，那就抓取一下B站的评论数据，视频动画那么多，也不知道抓取哪个，选了一个博人传跟火影相关的，抓取看看。网址： https://www.bilibili.com/bangumi/media/md5978/?from=search&seid=16013388136765436883#short
在这个网页看到了18560条短评，数据量也不大，抓取看看，使用的还是scrapy。

2. B站博人传评论数据案例—获取链接

从开发者工具中你能轻易的得到如下链接，有链接之后就好办了，如何创建项目就不在啰嗦了，我们直接进入主题。

我在代码中的parse函数中，设定了两个yield一个用来返回items 一个用来返回requests。
然后实现一个新的功能，每次访问切换UA，这个点我们需要使用到中间件技术。


class BorenSpider(scrapy.Spider):
    BASE_URL = "https://bangumi.bilibili.com/review/web_api/short/list?media_id=5978&folded=0&page_size=20&sort=0&cursor={}"
    name = 'Boren'
    allowed_domains = ['bangumi.bilibili.com']

    start_urls = [BASE_URL.format("76742479839522")]

    def parse(self, response):
        print(response.url)
        resdata = json.loads(response.body_as_unicode())

        if resdata["code"] == 0:
            # 获取最后一个数据
            if len(resdata["result"]["list"]) > 0:
                data = resdata["result"][&

最低0.47元/天解锁文章

未衬老师

关注

5
点赞
踩
8

收藏

觉得还不错? 一键收藏
3
评论
Python爬虫入门【19】： B站博人传评论数据抓取 scrapy

1. B站博人传评论数据爬取简介今天想了半天不知道抓啥，去B站看跳舞的小姐姐，忽然看到了评论，那就抓取一下B站的评论数据，视频动画那么多，也不知道抓取哪个，选了一个博人传跟火影相关的，抓取看看。网址： https://www.bilibili.com/bangumi/media/md5978/?from=search&seid=16013388136765436883#short在这个...
复制链接

扫一扫