简单爬虫--爬取豆瓣阅读出版社信息并保存

最新推荐文章于 2021-11-19 15:25:29 发布

Nicht_Sehen

最新推荐文章于 2021-11-19 15:25:29 发布

阅读量330

点赞数

分类专栏：爬虫

本文链接：https://blog.csdn.net/Nicht_sehen/article/details/102017850

版权

爬虫专栏收录该内容

6 篇文章 0 订阅

订阅专栏

先看看要爬取页面出版社信息格式：
在这里插入图片描述

import urllib.request
import re

data = urllib.request.urlopen("https://read.douban.com/provider/all").read().decode("UTF-8")
# print(len(data))
pat = '<div class="name">(.*?)</div>'
r = re.compile(pat).findall(data)
# print(r[0])
fh = open("C:/Users/Nicht_sehen/Desktop/cbs.txt","w")
for i in range(0,len(r)):
    fh.write(r[i]+"\n")
fh.close()

打开桌面的cbs文件：
在这里插入图片描述
可以看到爬下来的出版社信息已经写入了文件

确定要放弃本次机会？

福利倒计时

: :

立减 ¥

普通VIP年卡可用

立即使用

Nicht_Sehen

关注关注

0
点赞
踩
0

收藏

觉得还不错? 一键收藏
0
评论
简单爬虫--爬取豆瓣阅读出版社信息并保存

先看看要爬取页面出版社信息格式：import urllib.requestimport redata = urllib.request.urlopen("https://read.douban.com/provider/all").read().decode("UTF-8")# print(len(data))pat = '<div class="name">(.*?)&...
复制链接

扫一扫