编写Python爬虫抓取豆瓣电影TOP100及用户头像的方法

最新推荐文章于 2023-01-04 19:34:23 发布

进阶程序员阿福

最新推荐文章于 2023-01-04 19:34:23 发布

阅读量4.1k

点赞数

分类专栏： python 教程文章标签： python 编程语言

本文链接：https://blog.csdn.net/haoxun07/article/details/104583072

版权

本文介绍如何使用Python的urllib和urllib2模块编写爬虫抓取豆瓣电影TOP100的电影名称，并提供了代码示例。文章还提及了抓取用户头像的思路，适合Python初学者参考。

摘要由CSDN通过智能技术生成

这篇文章主要介绍了编写Python爬虫抓取豆瓣电影TOP100及用户头像的方法,用到了Python的urllib和urllib2模块,需要的朋友可以参考下
抓取豆瓣电影TOP100
一、分析豆瓣top页面，构建程序结构
1.首先打开网页http://movie.douban.com/top250?start，也就是top页面
然后试着点击到top100的页面，注意带top100的链接依次为

http://movie.douban.com/top250?start=0
http://movie.douban.com/top250?start=25
http://movie.douban.com/top250?start=50
http://movie.douban.com/top250?start=75

2.然后通过查看源码，发现电影名的代码如下：

肖申克的救赎
/ The Shawshank Redemption
如图，因为有一些英文名等描述，通过正则抓取有些干扰，可能还需要后续过滤。

根据以上信息，此程序主要分以下3个步骤：

二、构建url地址池

抓取top100电影名称
依次打印输出
依次写出代码

1.构建url地址池。代码如下：

mport urllib2
import re
# ----------确定url地址池------------
pre_url = 'http://movie.douban.com/top250?start='
top_urls = []
# 因为top100，每页25部电影，故为4页,从零开始
f

最低0.47元/天解锁文章

进阶程序员阿福

关注

0
点赞
踩
14

收藏

觉得还不错? 一键收藏
0
评论
编写Python爬虫抓取豆瓣电影TOP100及用户头像的方法

这篇文章主要介绍了编写Python爬虫抓取豆瓣电影TOP100及用户头像的方法,用到了Python的urllib和urllib2模块,需要的朋友可以参考下抓取豆瓣电影TOP100一、分析豆瓣top页面，构建程序结构1.首先打开网页http://movie.douban.com/top250?start，也就是top页面然后试着点击到top100的页面，注意带top100的链接依次为htt...
复制链接

扫一扫