10分钟教你用Python爬取Baidu文库全格式内容，2024年最新面试过程视频教程

m0_60707708

于 2024-04-16 20:08:16 发布

阅读量896

点赞数 17

分类专栏： 2024年程序员学习文章标签： python 百度面试

版权声明：本文为博主原创文章，遵循 CC 4.0 BY-SA 版权协议，转载请附上原文出处链接和本声明。

本文链接：https://blog.csdn.net/m0_60707708/article/details/137838366

版权

先自我介绍一下，小编浙江大学毕业，去过华为、字节跳动等大厂，目前阿里P7

深知大多数程序员，想要提升技能，往往是自己摸索成长，但自己不成体系的自学效果低效又漫长，而且极易碰到天花板技术停滞不前！

因此收集整理了一份《2024年最新Python全套学习资料》，初衷也很简单，就是希望能够帮助到想自学提升又不知道该从何学起的朋友。

既有适合小白学习的零基础资料，也有适合3年以上经验的小伙伴深入学习提升的进阶课程，涵盖了95%以上Python知识点，真正体系化！

由于文件比较多，这里只是将部分目录截图出来，全套包含大厂面经、学习笔记、源码讲义、实战项目、大纲路线、讲解视频，并且后续会持续更新

如果你需要这些资料，可以添加V获取：vip1024c （备注Python）

正文

res = requests.get(url , headers = header)

res.text

很可惜的是，我们并没有访问到。原因仔细想想也很简单，在百度搜索的时候，直接搜索是搜不到PPT或者PDF的内容的。

在这里插入图片描述

那么很显然，PPT和PDF是通过异步的方法进行内容加载的。

对待异步加载的数据，我们通常采取的策略有两种，第一个就是直接找到发起异步请求的接口，自己构造请求头，发起请求，第二个就是通过Selenium这样的自动化测试工具去爬取。

百度文库的接口太难找了，请求头的构造也很麻烦，找了很久也没有很满意。所以在本次爬取中，我们使用的是第二种方法，使用Selenium这样的自动化测试工具。

在这里不多加介绍WebDriver，有兴趣的小伙伴可以自己查一下，我们直接上手使用。

这里我们需要下载ChromeDriver这个插件，当然这里是默认大家使用的是Chrome浏览器，如果是其他的浏览器，firefox，safari等等，直接去网上找到相应Driver就可以了。

这里给出ChromeDriver的下载地址：

http://npm.taobao.org/mirrors/chromedriver/

大家一定要下载和自己Chrome浏览器版本一致的ChromeDriver，不然程序是运行不起来的。

在这里插入图片描述

我们先不急着马上开始爬取，我们先来尝试使用一下Selenium调用ChromeDriver。

import requests

from selenium import webdriver

url = ‘https://wenku.baidu.com/view/5292b2bc0166f5335a8102d276a20029bd64638c.html?fr=search’

driver = webdriver.Chrome(r’F:\driver\chromedriver.exe’)

driver.get(url)

怎么样，是不是浏览器自动打开了?现在我们尝试输出这个driver，就可以看见，网页的正确源代码已经在里面了。

现在我们仔细研究一下源代码就可以看到，我们需要的内容在下面这个位置。

最低0.47元/天解锁文章

关注

17
点赞
踩
10

收藏

觉得还不错? 一键收藏
0
评论
10分钟教你用Python爬取Baidu文库全格式内容，2024年最新面试过程视频教程

Python崛起并且风靡，因为优点多、应用领域广、被大牛们认可。学习 Python 门槛很低，但它的晋级路线很多，通过它你能进入机器学习、数据挖掘、大数据，CS等更加高级的领域。Python可以做网络应用，可以做科学计算，数据分析，可以做网络爬虫，可以做机器学习、自然语言处理、可以写游戏、可以做桌面应用…Python可以做的很多，你需要学好基础，再选择明确的方向。这里给大家分享一份全套的 Python 学习资料，给那些想学习 Python 的小伙伴们一点帮助！
复制链接

扫一扫

专栏目录

普通网友 CSDN认证博客专家 CSDN认证企业博客

码龄3年

611: 原创

-: 周排名

-: 总排名

39万+: 访问

: 等级

1万+: 积分

5783: 粉丝

8239: 获赞

9: 评论

8312: 收藏

私信

关注

热门文章

分类专栏

最新评论

Onlyoffice环境搭建-Docker-windows-离线安装，「架构师必备
指尖联盟: 你好，离线安装包能分享一下么
python爬虫云南昆明招聘数据可视化大屏全屏系统设计与实现（django框架）
普通网友: 这篇文章是优质之作，内容充实，结构明晰，语言流畅且通俗易懂，适合广大读者阅读。【我也写了一些相关领域的文章，希望能够得到博主的指导，共同进步！】
全面学习了解Python_全面学习python
普通网友: 大佬高质量文章，图文并茂，逻辑清晰，受益匪浅，期待大佬新作。【我也写了一些相关领域的文章，希望能够得到博主的指导，共同进步！】
全面学习了解Python_全面学习python(1)
普通网友: 每当我阅读你的编程博客文章时，我总能感受到你的专业水平和耐心解答的精神。【我也写了一些相关领域的文章，希望能够得到博主的指导，共同进步！】
全面学习了解Python_全面学习python
普通网友: 优质好文，支持支持。【我也写了一些相关领域的文章，希望能够得到博主的指导，共同进步！】

您愿意向朋友推荐“博客详情页”吗？

强烈不推荐
不推荐
一般般
推荐
强烈推荐

提交

最新文章

2024

目录

评论

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。