用python实现csdn博主全部博文下载，html转pdf，有了学习的电子书了。。。（附源码）

最新推荐文章于 2023-12-10 14:59:22 发布

置顶

主打Python

最新推荐文章于 2023-12-10 14:59:22 发布

阅读量2.3w

点赞数 124

分类专栏： python爬虫实例100条 parsel css 文章标签：新星计划 python 爬虫 pdfkit lxml

本文链接：https://blog.csdn.net/weixin_54733110/article/details/117884699

版权

这篇博客介绍了如何使用Python的pdfkit和lxml库，从CSDN抓取博主的所有文章并将其转换为PDF格式。首先演示了单篇文章的下载转换过程，然后详细阐述了完整的批量下载和转换步骤，包括分析网页、获取文章URL、解析HTML、保存HTML文件以及最后的文件转换。提供了源码分享，并鼓励读者讨论和完善。

摘要由CSDN通过智能技术生成

用python实现csdn博主全部博文下载，html转pdf，有了学习的电子书了。。。（附源码）

我们学习编程，在学习的时候，会有想把有用的知识点保存下来，我们可以把知识点的内容爬下来转变成pdf格式，方便我们拿手机可以闲时翻看，是很方便的

先来一个单个的博文下载转pdf格式的操作

在这里插入图片描述
python中将html转化为pdf的常用工具是Wkhtmltopdf工具包，在python环境下，pdfkit是这个工具包的封装类。如何使用pdfkit以及如何配置呢？分如下几个步骤。
下载wkhtmltopdf安装包，并且安装到电脑上。
下载地址：https://wkhtmltopdf.org/downloads.html
在这里插入图片描述
我下的是这个版本，安装的时候要记住路径，之后调用要用到路径

开发工具

python
pycharm
pdfkit （pip install pdfkit）
lxml

今天目标：博主的全部博文下载，并且转pdf格式保存

基本思路：
1、url + headers
2、分析网页： CSDN网页是静态网页，请求获取网页源代码
3、lxml解析获取boke_urls, author_name
4、循环遍历，得到 boke_url
5、xpath解析获取文件名
6、css选择器获取标签文本的主体
7、构造拼接html文件
8、保存html文件
9、文件的转换

分析网页： CSDN网页是静态网页，请求获取网页源代码
start_url =“https://i1bit.blog.csdn.net/” 为例
确定网址为同步加载
在这里插入图片描述
css选择器获取标签文本的主体为代码要点部分
css语法部分

	html_css = parsel.Selector(响应的数据)
    html_content = html_css.css('要获取的部分').get()

点开博主的一篇博文打开开发者工具
在这里插入图片描述

# css选择器获取标签文本的主体
        html_css = parsel.Selector(response_2)
        html_content = html_css.css('article').get()
# 构造拼接html文件
        html = \
            '''
                <!DOCTYPE html>
                    <html lang="en">
                    <head>
                        <meta charset="UTF-8">
                        <title>Title</title>
                    </head>
                    <body>
                        {}
                    </body>
                </html>
            '''.

最低0.47元/天解锁文章

主打Python

关注

124
点赞
踩
322

收藏

觉得还不错? 一键收藏
打赏
181
评论
用python实现csdn博主全部博文下载，html转pdf，有了学习的电子书了。。。（附源码）

用python实现csdn博主全部博文下载，html转pdf，有了学习的电子书了。。。（附源码）我们学习编程，在学习的时候，会有想把有用的知识点保存下来，我们可以把知识点的内容爬下来转变成pdf格式，方便我们拿手机可以闲时翻看，是很方便的先来一个单个的博文下载转pdf格式的操作python中将html转化为pdf的常用工具是Wkhtmltopdf工具包，在python环境下，pdfkit是这个工具包的封装类。如何使用pdfkit以及如何配置呢？分如下几个步骤。下载wkhtmltopdf安装包，并且
复制链接

扫一扫