Python爬取网页信息的方法
下面主要介绍两种方法:以图片为例
1、使用urltrieve方法
通过urllib下载文件并在本地文件中存储一个文件的副本,可以使用urltrieve。urltrieve用法是urltrieve(url,filename),url为URL地址,filename为所存储的本地文件名,顺带提及一点urltrieve返回一个元组(filename,headers);
import urllib
import urllib2
import os
url = 'http://210.42.121.241//servlet/GenImg'
output = 'GenImg.jpg')
urllib.urlretrieve(url,output)
2、使用文件写入方法
函数urlopen提供一个能从中读取数据的类对象文件,通过读取对象文件的信息,并将其写入本地文件即可。因为所有的文件都可以看作是二进制文件,因此以二进制文件写入,可以保持文件正确性;具体过程如下:
import urllib
import urllib2
import os
url = 'http://210.42.121.241//servlet/GenImg' #武汉大学选课系统验证码地址
fp=open('GenImg.jpg','wb')
response = urllib2.urlopen(url)
html = response.read()
fp.write(html)
fp.close()
3、本博文主要以爬取验证码信息
这也是大多数爬取网页信息的方法,爬取其他网页信息与本例几乎相同,具体过程完全以这个为基准,中间加入一些异常处理,正则表达式匹配等即可通过以上两种方法获取所需网页信息。