Python爬虫入门教程！手把手教会你爬取网页数据

最新推荐文章于 2024-07-30 17:21:38 发布

平静愉悦

最新推荐文章于 2024-07-30 17:21:38 发布

阅读量6.4k

点赞数 3

分类专栏：爬虫入门教学文章标签： python 爬虫大数据经验分享恰饭

本文链接：https://blog.csdn.net/aaahtml/article/details/114009754

版权

本文介绍了Python爬虫的基础知识，包括爬虫流程、Requests库的使用、爬取豆瓣海报的实战。通过Chrome开发者工具分析网页，使用BeautifulSoup或XPath解析HTML，实现分页处理并下载海报。文章强调了学会分析网页和理解爬虫原理的重要性。

摘要由CSDN通过智能技术生成

其实在当今社会，网络上充斥着大量有用的数据，我们只需要耐心的观察，再加上一些技术手段，就可以获取到大量的有价值数据。这里的“技术手段”就是网络爬虫。今天就给大家分享一篇爬虫基础知识和入门教程：

什么是爬虫？

爬虫就是自动获取网页内容的程序，例如搜索引擎，Google，Baidu 等，每天都运行着庞大的爬虫系统，从全世界的网站中爬虫数据，供用户检索时使用。

爬虫流程

其实把网络爬虫抽象开来看，它无外乎包含如下几个步骤

模拟请求网页。模拟浏览器，打开目标网站。
获取数据。打开网站之后，就可以自动化的获取我们所需要的网站数据。
保存数据。拿到数据之后，需要持久化到本地文件或者数据库等存储设备中。

那么我们该如何使用 Python 来编写自己的爬虫程序呢，在这里我要重点介绍一个 Python 库：Requests。

Requests 使用

Requests 库是 Python 中发起 HTTP 请求的库，使用非常方便简单。

模拟发送 HTTP 请求

发送 GET 请求

当我们用浏览器打开豆瓣首页时，其实发送的最原始的请求就是 GET 请求

import requests
res = requests.get('http://www.douban.com')
print(res)
print(type(res))
>>>
<Response [200]>
<class 'requests.models.Response'>

可以看到，我们得到的是一个 Response 对象

如果我们要获取网站返回的数据，可以使用 text 或者 content 属性来获取

text：是以字符串的形式返回数据

content：是以二进制的方式返回数据

print(type(res.text))
print(res.text)
>>>
<class 'str'> <!DOCTYPE HTML>
<html lang="zh-cmn-Hans" class="">
<head>
<meta charset="UTF-8">
<meta name="google-site-verification" content="ok0wCgT20tBBgo9_zat2iAcimtN4Ftf5ccsh092Xeyw" />
<meta name="description" content="提供图书、电影、音乐唱片的推荐、评论和价格比较，以及城市独特的文化生活。">
<meta name="keywords" content="豆瓣,广播,登陆豆瓣">.....

发送 POST 请求

对于 POST 请求，一般就是提交一个表单

r = requests.post('http://www.xxxx.com', data={"key": "value"})

data 当中，就是需要传递的表单信息，是一个字典类型的数据。

header 增强

对于有些网站，会拒绝掉没有携带 header 的请求的，所以需要做一些 header 增强。比如：UA，Cookie，host 等等信息。

header = {"User-Agent": "Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/76.0.3809.100 Safari/537.36",
         "Cookie": "your cookie"}
res = requests.get('http://www.xxx.com', headers=header)

解析 HTML

现在我们已经获取到了网页返回的数据，即 HTML 代码，下面就需要解析 HTML，来提取其中有效的信息。

BeautifulSoup

BeautifulSoup 是 Python 的一个库，最主要的功能是从网页解析数据。

from bs4 import BeautifulSoup  # 导入 BeautifulSoup 的方法
# 可以传入一段字符串，或者传入一个文件句柄。一般都会先用 requests 库获取网页内容，然后使用 soup 解析。
soup = BeautifulSoup(html

最低0.47元/天解锁文章

平静愉悦

关注

3
点赞
踩
43

收藏

觉得还不错? 一键收藏
打赏
0
评论
复制链接

分享到 QQ

分享到新浪微博

扫一扫

专栏目录