爬虫500 internal server error_爬虫的基本原理和基本库使用

最新推荐文章于 2024-06-06 13:57:24 发布

weixin_39611725

最新推荐文章于 2024-06-06 13:57:24 发布

阅读量1.3k

点赞数

文章标签：爬虫500 internal server error

版权声明：本文为博主原创文章，遵循 CC 4.0 BY-SA 版权协议，转载请附上原文出处链接和本声明。

本文链接：https://blog.csdn.net/weixin_39611725/article/details/113366751

版权

爬虫的基本原理和基本库使用

爬虫简单来说就是获取网页并提取和保存信息的自动化程序。

获取网页

获取网页的源代码：向网站的服务器发送一个请求，返回的响应体便是网页源代码。

提取信息

分析网页源代码，从中提取我们想要的数据。最通用的方式便是采用正则表达式提取

保存数据

将提取到的数据保存到某处以便以后使用

自动化程序

利用爬虫代替我们完成这份爬取工作的自动化程序

爬虫过程中遇到的一些情况：比如403错误，打开网页一看，可能会看到"您的ip访问频率过高"这样提示，是因为网站采用了一些反爬虫的措施，这个时候我们可以使用代理，所谓的代理，就是代理服务器，就是一个网络信息的中转站，正常请求一个网站的时候，是发送给web服务器，web服务器吧响应传回给我们，如果我们设置了代理服务器，就相当于本机和服务器之间搭了一座桥，本机向代理服务器发送请求，再由代理服务器发送给Web服务器。再由代理服务器把web服务器返回的响应转发本机，这样我们就实现了IP伪装

网上免费代理比较多，但最好筛选一下可用代理，付费的质量会比免费代理好很多

然后我们正式来开始学习爬虫的一些基本使用库(python3环境),这里我们用的是pycharm软件

使用urllib

Urlopen

Urllib.request模块提供了最基本的构造HTTP请求的方法，可以利用它模拟浏览器一个请求发起的过程,这里我们以python官网为例

import urllib.requestresponse=urllib.re

最低0.47元/天解锁文章

weixin_39611725

关注

0
点赞
踩
0

收藏

觉得还不错? 一键收藏
0
评论
爬虫500 internal server error_爬虫的基本原理和基本库使用

爬虫的基本原理和基本库使用爬虫简单来说就是获取网页并提取和保存信息的自动化程序。获取网页获取网页的源代码：向网站的服务器发送一个请求，返回的响应体便是网页源代码。提取信息分析网页源代码，从中提取我们想要的数据。最通用的方式便是采用正则表达式提取保存数据将提取到的数据保存到某处以便以后使用自动化程序利用爬虫代替我们完成这份爬取工作的自动化程序爬虫过程中遇到的一些情况：比如403错误，打开网页一看，可...
复制链接

扫一扫

评论

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。