练练手：用Python爬虫抓取网页

Llama-Turbo

已于 2024-03-11 14:41:25 修改

阅读量895

点赞数

文章标签： python 爬虫开发语言 pycharm 数据挖掘

于 2023-01-29 09:41:34 首次发布

本文链接：https://blog.csdn.net/pythonhy/article/details/128784691

版权

本节讲解第一个 Python 爬虫实战案例：抓取您想要的网页，并将其保存至本地计算机。

首先我们对要编写的爬虫程序进行简单地分析，该程序可分为以下三个部分：

拼接 url 地址
发送请求
将照片保存至本地

明确逻辑后，我们就可以正式编写爬虫程序了。

导入所需模块

本节内容使用 urllib 库来编写爬虫，下面导入程序所用模块：

from urllib import request
from urllib import parse

拼接URL地址

定义 URL 变量，拼接 url 地址。代码如下所示：

url = ‘http://www.baidu.com/s?wd={}’
#想要搜索的内容
word = input(‘请输入搜索内容:’)
params = parse.quote(word)
full_url = url.format(params)

向URL发送请求

发送请求主要分为以下几个步骤：

创建请求对象-Request
获取响应对象-urlopen
获取响应内容-read

代码如下所示：

#重构请求头
headers = {‘User-Agent’:‘Mozilla/5.0 (Windows NT 6.1; WOW64; rv:6.0) Gecko/20100101 Firefox/6.0’}
#创建请求对应
req = request.Request(url=full_url,headers=headers)
#获取响应对象
res = request.urlopen(req)
#获取响应内容
html = res.read().decode(“utf-8”)

保存为本地文件

把爬取的照片保存至本地，此处需要使用 Python 编程的文件 IO 操作，代码如下：

filename = word + ‘.html’
with open(filename,‘w’, encoding=‘utf-8’) as f:
f.write(html)

完整程序如下所示：

from urllib import request,parse
1.拼url地址
url = ‘http://www.baidu.com/s?wd={}’
word = input(‘请输入搜索内容:’)
params = parse.quote(word)
full_url = url.format(params)
2.发请求保存到本地
headers = {‘User-Agent’:‘Mozilla/5.0 (Windows NT 6.1; WOW64; rv:6.0) Gecko/20100101 Firefox/6.0’}
req = request.Request(url=full_url,headers=headers)
res = request.urlopen(req)
html = res.read().decode(‘utf-8’)
3.保存文件至当前目录
filename = word + ‘.html’
with open(filename,‘w’,encoding=‘utf-8’) as f:
f.write(html)

尝试运行程序，并输入编程帮，确认搜索，然后您会在 Pycharm 当前的工作目录中找到“编程帮.html”文件。

函数式编程修改程序

Python 函数式编程可以让程序的思路更加清晰、易懂。接下来，使用函数编程的思想更改上面代码。

定义相应的函数，通过调用函数来执行爬虫程序。修改后的代码如下所示：

from urllib import request
from urllib import parse
拼接URL地址
def get_url(word):
url = ‘http://www.baidu.com/s?{}’
#此处使用urlencode()进行编码
params = parse.urlencode({‘wd’:word})
url = url.format(params)
return url
发请求,保存本地文件
def request_url(url,filename):
headers = {‘User-Agent’:‘Mozilla/5.0 (Windows NT 6.1; WOW64; rv:6.0) Gecko/20100101 Firefox/6.0’}
请求对象 + 响应对象 + 提取内容
req = request.Request(url=url,headers=headers)
res = request.urlopen(req)
html = res.read().decode(‘utf-8’)
保存文件至本地
with open(filename,‘w’,encoding=‘utf-8’) as f:
```
 f.write(html)
```
主程序入口
if name == ‘main’:
word = input(‘请输入搜索内容:’)
url = get_url(word)
filename = word + ‘.html’
request_url(url,filename)

除了使用函数式编程外，您也可以使用面向对象的编程方法（本教程主要以该方法），在后续内容中会做相应介绍。

这里给大家分享一份Python全套学习资料，包括学习路线、软件、源码、视频、面试题等等，都是我自己学习时整理的，希望可以对正在学习或者想要学习Python的朋友有帮助！

CSDN大礼包：全网最全《全套Python学习资料》免费分享🎁

😝有需要的小伙伴，可以点击下方链接免费领取或者V扫描下方二维码免费领取🆓

👉CSDN大礼包🎁：全网最全《Python学习资料》免费分享（安全链接，放心点击）👈

1️⃣零基础入门

① 学习路线

对于从来没有接触过Python的同学，我们帮你准备了详细的学习成长路线图。可以说是最科学最系统的学习路线，你可以按照上面的知识点去找对应的学习资源，保证自己学得较为全面。
在这里插入图片描述

② 路线对应学习视频

还有很多适合0基础入门的学习视频，有了这些视频，轻轻松松上手Python~ 在这里插入图片描述

③练习题

每节视频课后，都有对应的练习题哦，可以检验学习成果哈哈！
在这里插入图片描述
因篇幅有限，仅展示部分资料

2️⃣国内外Python书籍、文档

① 文档和书籍资料

在这里插入图片描述

3️⃣Python工具包+项目源码合集

①Python工具包

学习Python常用的开发软件都在这里了！每个都有详细的安装教程，保证你可以安装成功哦！
在这里插入图片描述

②Python实战案例

光学理论是没用的，要学会跟着一起敲代码，动手实操，才能将自己的所学运用到实际当中去，这时候可以搞点实战案例来学习。100+实战案例源码等你来拿！
在这里插入图片描述

③Python小游戏源码

如果觉得上面的实战案例有点枯燥，可以试试自己用Python编写小游戏，让你的学习过程中增添一点趣味！
在这里插入图片描述

4️⃣Python面试题

我们学会了Python之后，有了技能就可以出去找工作啦！下面这些面试题是都来自阿里、腾讯、字节等一线互联网大厂，并且有阿里大佬给出了权威的解答，刷完这一套面试资料相信大家都能找到满意的工作。
在这里插入图片描述

5️⃣Python兼职渠道

而且学会Python以后，还可以在各大兼职平台接单赚钱，各种兼职渠道+兼职注意事项+如何和客户沟通，我都整理成文档了。
在这里插入图片描述

上述所有资料 ⚡️ ，朋友们如果有需要 📦《全套Python学习资料》的，可以扫描下方二维码免费领取 🆓
😝有需要的小伙伴，可以点击下方链接免费领取或者V扫描下方二维码免费领取🆓