Python爬取信息的方法

最新推荐文章于 2024-04-15 10:34:36 发布

落叶散华

最新推荐文章于 2024-04-15 10:34:36 发布

阅读量1.7k

点赞数

分类专栏： Python 文章标签： Python 图片抓取爬取网页信息

本文链接：https://blog.csdn.net/luoyestudio/article/details/12860093

版权

Python 专栏收录该内容

7 篇文章 0 订阅

订阅专栏

Python爬取网页信息的方法

下面主要介绍两种方法：以图片为例

1、使用urltrieve方法

通过urllib下载文件并在本地文件中存储一个文件的副本，可以使用urltrieve。urltrieve用法是urltrieve（url，filename），url为URL地址，filename为所存储的本地文件名，顺带提及一点urltrieve返回一个元组（filename，headers）；

import urllib
import urllib2
import os
url = 'http://210.42.121.241//servlet/GenImg'
output = 'GenImg.jpg')
urllib.urlretrieve(url,output)

2、使用文件写入方法

函数urlopen提供一个能从中读取数据的类对象文件，通过读取对象文件的信息，并将其写入本地文件即可。因为所有的文件都可以看作是二进制文件，因此以二进制文件写入，可以保持文件正确性；具体过程如下：

import urllib
import urllib2
import os
url = 'http://210.42.121.241//servlet/GenImg'   #武汉大学选课系统验证码地址
fp=open('GenImg.jpg','wb')
response = urllib2.urlopen(url)
html = response.read()
fp.write(html)
fp.close()

3、本博文主要以爬取验证码信息

这也是大多数爬取网页信息的方法，爬取其他网页信息与本例几乎相同，具体过程完全以这个为基准，中间加入一些异常处理，正则表达式匹配等即可通过以上两种方法获取所需网页信息。

落叶散华

关注

0
点赞
踩
0

收藏

觉得还不错? 一键收藏
0
评论
复制链接

分享到 QQ

分享到新浪微博

扫一扫

专栏目录