Python爬虫入门：怎么用Python扒网页？基本流程是什么

最新推荐文章于 2024-04-27 16:08:33 发布

程序员迪迪

最新推荐文章于 2024-04-27 16:08:33 发布

阅读量1.1k

点赞数

文章标签： python 爬虫开发语言经验分享职场和发展

本文链接：https://blog.csdn.net/DD1023hhh/article/details/122603518

版权

Python爬虫网页的基本流程：首先选取一部分精心挑选的种子URL。将这些URL放入待抓取URL队列。从待抓取URL队列中读取待抓取队列的URL，解析DNS，并且得到主机的IP，并将URL对应的网页下载下来，存储进已下载网页库中。此外，将这些URL放进已抓取URL队列。分析已抓取URL队列中的URL，从已下载的网页数据中分析出其他URL，并和已抓取的URL进行比较去重，最后将去重过的URL放入待抓取URL队列，从而进入下一个循环。1、HTTP请求实现使用urllib2/urllib实现：url

摘要由CSDN通过智能技术生成

Python爬虫网页的基本流程：

首先选取一部分精心挑选的种子URL。

将这些URL放入待抓取URL队列。

从待抓取URL队列中读取待抓取队列的URL，解析DNS，并且得到主机的IP，并将URL对应的网页下载下来，存储进已下载网页库中。此外，将这些URL放进已抓取URL队列。

分析已抓取URL队列中的URL，从已下载的网页数据中分析出其他URL，并和已抓取的URL进行比较去重，最后将去重过的URL放入待抓取URL队列，从而进入下一个循环。

1、HTTP请求实现

使用urllib2/urllib实现：

urllib2和urllib是Python中的两个内置模块，要实现HTTP功能，实现方式是以urllib2为主，urllib为辅。

urllib2提供一个基础函数urlopen，通过向指定的URL发出请求来获取数据。最简单的形式是：

import urllib2
response=urllib2.urlopen('http://www.zhihu.com')
html=response.read()
print html

其实可以将上面对http://www.zhihu.com的请求响应分为两步，一步是请求，一步是响应，形式如下：

import urllib2

# 请求

request=urllib2.Request('http://www.zhihu.com')

# 响应

response = urllib2.urlopen(request)

html=response.read()

print html

还有post请求实现：</

最低0.47元/天解锁文章

程序员迪迪

关注

0
点赞
踩
1

收藏

觉得还不错? 一键收藏
0
评论
Python爬虫入门：怎么用Python扒网页？基本流程是什么

Python爬虫网页的基本流程：首先选取一部分精心挑选的种子URL。将这些URL放入待抓取URL队列。从待抓取URL队列中读取待抓取队列的URL，解析DNS，并且得到主机的IP，并将URL对应的网页下载下来，存储进已下载网页库中。此外，将这些URL放进已抓取URL队列。分析已抓取URL队列中的URL，从已下载的网页数据中分析出其他URL，并和已抓取的URL进行比较去重，最后将去重过的URL放入待抓取URL队列，从而进入下一个循环。1、HTTP请求实现使用urllib2/urllib实现：url
复制链接

扫一扫