120行代码爬取豆瓣电影top250

最新推荐文章于 2024-06-20 11:34:52 发布

MarDino

最新推荐文章于 2024-06-20 11:34:52 发布

阅读量7.7k

点赞数 56

分类专栏：爬虫

本文链接：https://blog.csdn.net/weixin_44106928/article/details/89192740

版权

笔者最近学习爬虫，拿豆瓣电影进行练手，无奈豆瓣电影存在反爬机制，爬完250就会重定向要求我进行登陆操作，所以我这一次只爬取前50进行相关测试，废话不多说，我们来看下源代码
这次用到的还是requests库，BeautifulSoup解析库，和re进行辅助的正则匹配库，最后老样子利用pandas的DataFrame进行excel的写入

import requests
from bs4 import BeautifulSoup
import re
import pandas

headers = {
    'Host':'movie.douban.com',
    'Origin':'movie.douban.com',
    'User-Agent':'Mozilla/5.0 (Linux; Android 6.0; Nexus 5 Build/MRA58N) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/73.0.3683.103 Mobile Safari/537.36',
}
base_url = 'https://movie.douban.com/top250?start={}&filter='





response = requests.get('https://movie.douban.com/top250?start=0&filter=', headers = headers)
if response.status_code == 200:
    # print(response.text)
    pass

pattern1 = re.compile('<div.*?class="item">.*?<div.*?class="

最低0.47元/天解锁文章

MarDino

关注

56
点赞
踩
109

收藏

觉得还不错? 一键收藏
18
评论
120行代码爬取豆瓣电影top250

笔者最近学习爬虫，拿豆瓣电影进行练手，无奈豆瓣电影存在反爬机制，爬完250就会重定向要求我进行登陆操作，所以我这一次只爬取前50进行相关测试，废话不多说，我们来看下源代码这次用到的还是requests库，BeautifulSoup解析库，和re进行辅助的正则匹配库，最后老样子利用pandas的DataFrame进行excel的写入import requestsfrom bs4 import ...
复制链接

扫一扫

专栏目录