2024年最全Python爬虫：原理与实战(1)，面试官问有哪些技术栈

本文链接：https://blog.csdn.net/2401_84140302/article/details/138661059

做了那么多年开发，自学了很多门编程语言，我很明白学习资源对于学一门新语言的重要性，这些年也收藏了不少的Python干货，对我来说这些东西确实已经用不到了，但对于准备自学Python的人来说，或许它就是一个宝藏，可以给你省去很多的时间和精力。

别在网上瞎学了，我最近也做了一些资源的更新，只要你是我的粉丝，这期福利你都可拿走。

我先来介绍一下这些东西怎么用，文末抱走。

（1）Python所有方向的学习路线（新版）

这是我花了几天的时间去把Python所有方向的技术点做的整理，形成各个领域的知识点汇总，它的用处就在于，你可以按照上面的知识点去找对应的学习资源，保证自己学得较为全面。

最近我才对这些路线做了一下新的更新，知识体系更全面了。

在这里插入图片描述

（2）Python学习视频

包含了Python入门、爬虫、数据分析和web开发的学习视频，总共100多个，虽然没有那么全面，但是对于入门来说是没问题的，学完这些之后，你可以按照我上面的学习路线去网上找其他的知识资源进行进阶。

在这里插入图片描述

（3）100多个练手项目

我们在看视频学习的时候，不能光动眼动脑不动手，比较科学的学习方法是在理解之后运用它们，这时候练手项目就很适合了，只是里面的项目比较多，水平也是参差不齐，大家可以挑自己能做的项目去练练。

在这里插入图片描述

（4）200多本电子书

这些年我也收藏了很多电子书，大概200多本，有时候带实体书不方便的话，我就会去打开电子书看看，书籍可不一定比视频教程差，尤其是权威的技术书籍。

基本上主流的和经典的都有，这里我就不放图了，版权问题，个人看看是没有问题的。

（5）Python知识点汇总

知识点汇总有点像学习路线，但与学习路线不同的点就在于，知识点汇总更为细致，里面包含了对具体知识点的简单说明，而我们的学习路线则更为抽象和简单，只是为了方便大家只是某个领域你应该学习哪些技术栈。

在这里插入图片描述

（6）其他资料

还有其他的一些东西，比如说我自己出的Python入门图文类教程，没有电脑的时候用手机也可以学习知识，学会了理论之后再去敲代码实践验证，还有Python中文版的库资料、MySQL和HTML标签大全等等，这些都是可以送给粉丝们的东西。

在这里插入图片描述

这些都不是什么非常值钱的东西，但对于没有资源或者资源不是很好的学习者来说确实很不错，你要是用得到的话都可以直接抱走，关注过我的人都知道，这些都是可以拿到的。

网上学习资料一大堆，但如果学到的知识不成体系，遇到问题时只是浅尝辄止，不再深入研究，那么很难做到真正的技术提升。

需要这份系统化学习资料的朋友，可以戳这里获取

一个人可以走的很快，但一群人才能走的更远！不论你是正从事IT行业的老鸟或是对IT行业感兴趣的新人，都欢迎加入我们的的圈子（技术交流、学习资源、职场吐槽、大厂内推、面试辅导），让我们一起学习成长！

1、发起请求

使用http库向目标站点发起请求，即发送一个Request

Request包含：请求头、请求体等

Request模块缺陷：不能执行JS 和CSS 代码

2、获取响应内容

如果服务器能正常响应，则会得到一个Response

Response包含：html，json，图片，视频等

3、解析内容

解析html数据：正则表达式（RE模块），第三方解析库如Beautifulsoup，pyquery等

解析json数据：json模块

解析二进制数据:以wb的方式写入文件

4、保存数据

数据库（MySQL，Mongdb、Redis）

文件

接下来，我们将通过一个实战案例来演示如何使用Python爬虫抓取目标网站的数据。

3、客户端HTTP请求格式

在网络传输中HTTP协议非常重要，该协议规定了客户端和服务器端请求和应答的标准。HTTP协议能保证计算机正确快速地传输超文本文档，并确定了传输文档中的哪一部分，以及哪一部分内容首先显示（如文本先于图形）等。
根据HTTP协议的规定，客户端发送了一个HTTP请求到服务器的请求消息，由请求行、请求头部、空行以及请求数据四个部分组成。

下面结合一个典型的HTTP请求示例，详细介绍HTTP请求信息的各个组成部分：

Get https://www.baidu.com/ HTTP/1.1
Host: www.baidu.com
Connection: keep-alive
Upgrade-Insecure-Requests: 1
User-Agent: Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/111.0.0.0 Safari/537.36
Accept: text/html,application/xhtml+xml,application/xml;q=0.9,image/avif,image/webp,image/apng,/;q=0.8,application/signed-exchange;v=b3;q=0.7
Referer: https://www.baidu.com/link?url=8vUrPYDUaSkXWxUEOlT8QhvB5kMr1o6I27EP0NJICmG&wd=&eqid=e69078350001654000000003641051fc
Accept-Encoding: gzip, deflate, br
Accept-Language: zh-CN,zh;q=0.9
Cookie: BIDUPSID=498703BAB592E42B1A4200A2F69121AD; PSTM=1657099499; MCITY=-291%3A; BAIDUID=498703BAB592E42BC6776C4114ED28E6:SL=0:NR=10:FG=1; BD_UPN=12314753; BDUSS=J5OEFjZ3pBb05tR3QxNUo0TEVJdjVpYzQ5Q2FORC04TnlrMHhFYkhRMnNKeGxrRVFBQUFBJCQAAAAAAQAAAAEAAAAXv8pawrfIy73U1qpUYQAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAKya8WOsmvFjLT; BDUSS_BFESS=J5OEFjZ3pBb05tR3QxNUo0TEVJdjVpYzQ5Q2FORC04TnlrMHhFYkhRMnNKeGxrRVFBQUFBJCQAAAAAAQAAAAEAAAAXv8pawrfIy73U1qpUYQAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAKya8WOsmvFjLT;

（1）请求行
第一行为请求行，包含了请求的方法，URL地址和协议版本。GET是请求方法，https：//www.baidu.com是URL地址，HTTP/1.1指定了协议版本。
不同的请求方法含义不同，如下：


序号	方法	描述
1	GET	请求指定的页面信息，并返回实体主体
2	POST	向指定资源提交数据进行处理请求（如提交表单或者上传文件），数据被包含在请求体中。Post请求可能会导致新的资源的建立和已有资源的修改
3	HEAD	类似于GET请求，只不过返回的响应中没有具体的内容，用于获取报头
4	PUT	这种请求方式下，从客户端向服务器传送的数据取代指定的文档的内容
5	DELETE	请求服务器删除指定的页面
6	CONNECT	HTTP1.1协议中预留给能够将连接改为管道方式的代理服务器
7	OPTIONS	允许客服端查看服务器的性能
8	TRACE	回显服务器收到的请求，主要用于测试或诊断

其中GET和POST请求最常用，区别在于：

GET是从服务器上获取指定页面信息，POST是向服务器提交数据并获取页面信息。

GET请求参数都显示在URL上，服务器根据该请求所包含URL中的参数来产生响应内容。由于请求参数都暴露在外，所以安全性不高。

POST请求参数在请求体中，消息长度没有限制而且采取隐式发送，通常用来向HTTP服务器提交量比骄大的数据（如请求中包含许多参数或者文件上传的操作）POST请求的参数不在URL中，而在请求体中，在安全性方面比GET请求要高。

（2）请求报头
请求行下是若干个请求报头，下面介绍常用的请求报头及含义：

Host（主机和端口号）：指定被请求的资源的Internet主机和端口号，对应网址URL中的Web名称和端口号，通常属于URL的Host部分。
Connection(连接类型）：表示客户端与服务端的连接类型。
Upgrade-Insecure-Requests(升级为HTTPS请求）：表示升级不安全的请求，会在加载HTTP资源时自动替换成HTTPS请求，让浏览器不再显示HTTPS页面中的HTTP请求警报。HTTPS时以安全为目标的HTTP通道，所以在HTTPS承载的页面上不允许出现HTTP请求，一旦出现就会提示或报错。
User-Agent(浏览器名称）：表示客户端身份的名称，通常页面会根据不同的User-Agent信息自动做出适配，甚至返回不同的响应内容。
Accept(传输文件类型）：指浏览器或其他客户端可以接受的MIME(Multipurpose Internet Mail Extensions,多用途因特网邮件扩展)文件类型，服务器可以根据他判断并返回适当的文件格式
Referer(页面跳转来源）：表明产生请求的网页来自于哪个URL，用户是从该Referer页面访问到当前请求的页面。这个属性可以用来跟踪Web请求来自哪个页面，是从什么网站下载下来的，有时下载某网站的图片时，需要对应的Referer，否则是无法下载图片，那是因为做了防盗链。原理就是根据Referer去判断URL是否是本网站的地址，如果不是，则拒绝，如果是，就可以下载。

4. 服务器HTTP响应格式

HTTP响应报文由四部分组成，分别是状态行，响应报头，空行和响应正文。

响应状态码
响应状态码由3位数字组成，其中第一位数字定义了响应的类别，有5种可能取值，常见的响应状态码如下：
100~199：表示服务器成功接收部分请求，要求客户端继续提价奥其余请求才能完成整个处理过程。
200~299：表示服务器成功接受请求并已完成整个处理过程。常用的状态码为200（表示OK，请求成功）。
200~399：为完成请求，客户需进一步细化请求。例如，请求的资源已经移动到一个新的地址。常用状态码包括302（表示所请求的页面已经临时转移至新的URL）、307和304（表示使用缓存资源）。
400~499：客户端的请求有错误，常用状态码包括404（表示服务器无法找到被请求的页面）和403（表示服务器拒绝访问，权限不够）。
500~599：服务器端出现错误，常用的状态码为500（表示请求未完成，服务器遇到不可预知的情况）。

二、Python爬虫实战

2、实战案例：抓取豆瓣电影Top250榜单

1. 发送请求

首先，我们需要向豆瓣电影Top250榜单的URL发送请求，获取网页的HTML代码。这里我们使用requests库来实现：

import requests  
  
url = 'https://movie.douban.com/top250'  
headers = {  
    'User-Agent': 'Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/58.0.3029.110 Safari/537.3'}  
response = requests.get(url, headers=headers)  
html = response.text

现在能在网上找到很多很多的学习资源，有免费的也有收费的，当我拿到1套比较全的学习资源之前，我并没着急去看第1节，我而是去审视这套资源是否值得学习，有时候也会去问一些学长的意见，如果可以之后，我会对这套学习资源做1个学习计划，我的学习计划主要包括规划图和学习进度表。

分享给大家这份我薅到的免费视频资料，质量还不错，大家可以跟着学习