python爬取网页数据步骤,python爬取网页详细教程

最新推荐文章于 2024-09-19 10:02:44 发布

nannannanmu

最新推荐文章于 2024-09-19 10:02:44 发布

阅读量860

点赞数 6

文章标签：人工智能

本文链接：https://blog.csdn.net/nannannanmu/article/details/136455040

版权

大家好，小编来为大家解答以下问题，利用python爬取简单网页数据步骤，怎么用python爬取网站上的数据，现在让我们一起来看看吧！

其实在当今社会，网络上充斥着大量有用的数据，我们只需要耐心的观察，再加上一些技术手段，就可以获取到大量的有价值数据。这里的“技术手段”就是网络爬虫python的基本知识点总结。今天就给大家分享一篇爬虫基础知识和入门教程：

什么是爬虫？

爬虫就是自动获取网页内容的程序，例如搜索引擎，Google，Baidu 等，每天都运行着庞大的爬虫系统，从全世界的网站中爬虫数据，供用户检索时使用。

爬虫流程

其实把网络爬虫抽象开来看，它无外乎包含如下几个步骤

模拟请求网页。模拟浏览器，打开目标网站。
获取数据。打开网站之后，就可以自动化的获取我们所需要的网站数据。
保存数据。拿到数据之后，需要持久化到本地文件或者数据库等存储设备中。

那么我们该如何使用 Python 来编写自己的爬虫程序呢，在这里我要重点介绍一个 Python 库：Requests。

Requests 使用

Requests 库是 Python 中发起 HTTP 请求的库，使用非常方便简单。

模拟发送 HTTP 请求

发送 GET 请求

当我们用浏览器打开豆瓣首页时，其实发送的最原始的请求就是 GET 请求

import requests
res = requests.get('http://www.douban.com')
print(res)
print(type(res))
>>>
<Response [200]>
<class 'requests.models.Response'>

可以看到，我们得到的是一个 Response 对象

如果我们要获取网站返回的数据，可以使用 text 或者 content 属性来获取

text：是以字符串的形式返回数据

content：是以二进制的方式返回数据

print(type(res.text))
print(res.text)
>>>
<class 'str'> <!DOCTYPE HTML>
<html lang="zh-cmn-Hans" class="">
<head>
<meta charset="UTF-8">
<meta name="google-site-verification" content="ok0wCgT20tBBgo9_zat2iAcimtN4Ftf5ccsh092Xeyw" />
<meta name="deion" content="提供图书、电影、音乐唱片的推荐、评论和价格比较，以及城市独特的文化生活。">
<meta name="keywords" content="豆瓣,广播,登陆豆瓣">.....

发送 POST 请求

对于 POST 请求，一般就是提交一个表单

r?=?requests.post('http://www.xxxx.com',?data={"key":?"value"})

data 当中，就是需要传递的表单信息，是一个字典类型的数据。

header 增强

对于有些网站，会拒绝掉没有携带 header 的请求的，所以需要做一些 header 增强。比如：UA，Cookie，host 等等信息。

header = {"User-Agent": "Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/76.0.3809.100 Safari/537.36",
         "Cookie": "your cookie"}