Python网络爬虫实战练习：爬取豆瓣图书信息

最新推荐文章于 2022-01-23 11:44:09 发布

Siumai

最新推荐文章于 2022-01-23 11:44:09 发布

阅读量903

点赞数 2

分类专栏： Python

本文链接：https://blog.csdn.net/qq_43749739/article/details/105071807

版权

Python 专栏收录该内容

13 篇文章 0 订阅

订阅专栏

一、注意事项
1、文件名尽量使用英文，避免出现编码问题
2、含中文的文件写入，注意标注编码，如：

with open(r"C:\Users\10335\Desktop\response.txt", 'w', encoding = "utf-8") as f:
    f.write(html)
    f.close()

3、若长时间得不到输出，考虑正则表达式的构造是否捕捉效率不高

二、代码实现

import requests
import re
import time


class Book():# 书籍类
    def __init__(self, title="NULL", href="NULL", author="NULL", year="NULL", publisher="NULL", abstract="NULL"):
        self.title = title
        self.href = href
        self.author = author
        self.year = year
        self.publisher = publisher
        self.abstract = abstract

    def get_info(self):# 格式化输出至文件
        content = "Title:" + self.title + "   Author:" + self.author + "\nPublisher:" + self.publisher + " Year:" + self.year + "\nAbstract:\n" + self.abstract + "\nLink:" + self.href + "\n_________________________\n"
        with open(r"C:\Users\10335\Desktop\doubanbook.txt", 'a', encoding = "utf-8") as f:
            f.write(content)
            f.close()


header = {
    "user-agent": "Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/80.0.3987.106 Safari/537.36"}
html = requests.get("https://book.douban.com/", headers=header).text
with open(r"C:\Users\10335\Desktop\response.txt", 'w', encoding = "utf-8") as f:#将响应保存为文件，以分析匹配效果
    f.write(html)
    f.close()
books = []
pattern = re.compile(
    '<div class="title">.*?href="(.*?)"\s*title="(.*?)".*?<div class="author">\s*(.*?)\s*?</div>\s.*?"year">\s*(.*?)\s.*?publisher">\s*(.*?)\s.*?abstract">\s*(.*?)\s</p>',
    re.S)
start = time.perf_counter()
results = pattern.findall(html)
end = time.perf_counter()
for result in results:
    books.append(Book(href=result[0], title=result[1], author=result[2], year=result[3],
                      publisher=result[4], abstract=result[5]))
for book in books:
    book.get_info()
print("Running time:", (end - start), "seconds")# 输出运行时间

三、部分输出截取：

Title:不管狗和茶炊怎么闹腾   Author:王这么
Publisher:人民文学出版社 Year:2020-1
Abstract:
⭐一本点亮平庸日常的生活之书
⭐讲述平淡中的光怪陆离和嘈杂中的诗意
⭐不管狗和茶炊怎么闹腾，生活就在那里
⭐努力地将日子过下去，就是我们的坎坷征途与星辰大海
——————————————————————————————————————
契诃夫说：“不管狗和茶炊怎么闹腾，夏天过后还会有冬天，青春过后还会有衰老，幸福后面跟着不幸，或者是相反。不管这多么...
               
Link:https://book.douban.com/subject/34954089/?icn=index-latestbook-subject
_________________________
Title:女生徒   Author:[日]太宰治
Publisher:天津人民出版社 Year:2020-1
Abstract:
太宰治&#34;女性独白体“短篇小说集
野间文艺翻译奖得主 陆求实全新译本
——————————————————————————
本书选取太宰治作品中以女性第一人称视角叙述的10 篇作品，以其中的名篇《女生徒》为书名，并对照各个故事中女性的人生轨迹——少年、青年、壮年、老年追忆少年时光，对各篇顺序做出梳理。
——————————————————————————
...
               
Link:https://book.douban.com/subject/34924767/?icn=index-latestbook-subject
_________________________
Title:东京百景   Author:[日] 又吉直树
Publisher:上海译文出版社 Year:2020-3
Abstract:
史上最畅销的芥川奖获奖者又吉直树的随笔集——写给东京的一封情书，但永远得不到它的回眸
豆瓣9.3分日剧《火花》的创作原点，又吉直树的另类个人传记
以东京为背景，直指正在大城市打拼的现代年轻人的生活和内心
在幻想与现实的交错之间，发现东京的残酷与温柔
“我期望，这个世界不要欺骗年轻人。别把他们当食物吞掉。”
内容简介：
《东京百景》由100篇小短文串联而成...
               
Link:https://book.douban.com/subject/34900487/?icn=index-latestbook-subject
_________________________
Title:好学校   Author:[美] 理查德·耶茨
Publisher:上海译文出版社 Year:2020-2
Abstract:
美国寄宿男校的一段伤心往事 耶茨最温柔的一部小说
-
书名中的“好学校”是一所虚构的康涅狄格州预备中学。故事发生在上个世纪四十年代初期，“好学校”中的男孩毕业后就要立刻参军作战，老师们对于自身职业和所在学校的情感五味杂陈。尽管这是一所学校，可正如书中一名老师所说，这里“蕴藏了巨大的潜在能量”，学生如此，老师亦如此。从某种程度上，本书延续了《革命...
               
Link:https://book.douban.com/subject/34888772/?icn=index-latestbook-subject
_________________________
Title:周作人集外文   Author:周作人 著&nbsp;/&nbsp;陈子善, 赵国忠 编
Publisher:上海人民出版社 Year:2020-1
Abstract:
☆全新《周作人集外文》，搜集更为完备、考订更为准确
☆收入近年来新发现的周作人佚文，增补文章百余篇
☆填补研究资料之缺漏，展现更为丰富立体的周作人形象
·
新版《周作人集外文》共两卷，本书为上卷，收入1904年至1945年的集外文，包括散文、旧诗、新诗，以及为自己或他人的文章、译文所写的题记、附记、按语等未曾收入自编文集的作品。
相较于之前版本，新版《周...
               
Link:https://book.douban.com/subject/30212806/?icn=index-latestbook-subject
_________________________