Python爬取信息的方法

Python爬取网页信息的方法

下面主要介绍两种方法:以图片为例

1、使用urltrieve方法

通过urllib下载文件并在本地文件中存储一个文件的副本,可以使用urltrieve。urltrieve用法是urltrieve(url,filename),url为URL地址,filename为所存储的本地文件名,顺带提及一点urltrieve返回一个元组(filename,headers);

 

import urllib
import urllib2
import os
url = 'http://210.42.121.241//servlet/GenImg'
output = 'GenImg.jpg')
urllib.urlretrieve(url,output)


 

2、使用文件写入方法

函数urlopen提供一个能从中读取数据的类对象文件,通过读取对象文件的信息,并将其写入本地文件即可。因为所有的文件都可以看作是二进制文件,因此以二进制文件写入,可以保持文件正确性;具体过程如下:

 

import urllib
import urllib2
import os
url = 'http://210.42.121.241//servlet/GenImg'   #武汉大学选课系统验证码地址
fp=open('GenImg.jpg','wb')
response = urllib2.urlopen(url)
html = response.read()
fp.write(html)
fp.close()

 

3、本博文主要以爬取验证码信息

这也是大多数爬取网页信息的方法,爬取其他网页信息与本例几乎相同,具体过程完全以这个为基准,中间加入一些异常处理,正则表达式匹配等即可通过以上两种方法获取所需网页信息。

  • 0
    点赞
  • 0
    收藏
    觉得还不错? 一键收藏
  • 0
    评论

“相关推荐”对你有帮助么?

  • 非常没帮助
  • 没帮助
  • 一般
  • 有帮助
  • 非常有帮助
提交
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值