Python模块之Gzip压缩与解压模块Gzip模块

最新推荐文章于 2024-06-18 14:41:52 发布

diaowuli0618

最新推荐文章于 2024-06-18 14:41:52 发布

阅读量295

点赞数

文章标签： python

原文链接：http://www.cnblogs.com/liuzhang0223/p/7146253.html

版权

Gzip模块为python的压缩和解压缩模块，读写gzip 文件

一、使用gzip模块压缩文件：

1 import gzip #导入python gzip模块，注意名字为全小写
2 g = gzip.GzipFile(filename="", mode="wb", compresslevel=9, fileobj=open('sitemap.log.gz', 'wb'))#filename参数是压缩文件内文件的名字，为空也可以。fileobj是生成的压缩文件对象
3 g.write(open('d:\\test\\sitemap.xml').read())
4 g.close()

二、使用gzip解压缩文件：

代码如下：

g = gzip.GzipFile(mode="rb", fileobj=open('d:\\test\\sitemap.log.gz', 'rb')) # python gzip 解压
open(r"d:\\haha.xml", "wb").write(g.read())

三、实际应用

在实际应用中，例如在爬取网页的过程中，我们检查网页源代码的head头部信息发现，是结果gzip压缩处理的，所以在显示过程中显示不完全，例如：

我们要抓取指定url的源代码

#-*-coding:utf8 -*-
import urllib2
from lxml import etree


request = urllib2.Request('http://outofmemory.cn/')

response = urllib2.urlopen(request)

print data.text()

发现显示出的源代码是经过压缩的数据

此时我们需要对齐进行解压操作,最终代码入下：

#-*-coding:utf8 -*-
import urllib2
from lxml import etree
from StringIO import StringIO  #StringIO模块就是在内存中读写str
import gzip  #加压缩文件
request = urllib2.Request('http://outofmemory.cn/')
request.add_header('Accept-encoding', 'gzip') #添加头信息
response = urllib2.urlopen(request)
if response.info().get('Content-Encoding') == 'gzip':
    buf = StringIO( response.read()) #将读取的response信息作为stringIO方便后面作为文件写入
    f = gzip.GzipFile(fileobj=buf)  #解压缩response
    data = f.read()
print data

转载于:https://www.cnblogs.com/liuzhang0223/p/7146253.html

diaowuli0618

关注

0
点赞
踩
1

收藏

觉得还不错? 一键收藏
0
评论
Python模块之Gzip压缩与解压模块Gzip模块

Gzip模块为python的压缩和解压缩模块，读写gzip 文件一、使用gzip模块压缩文件：1 import gzip #导入python gzip模块，注意名字为全小写2 g = gzip.GzipFile(filename="", mode="wb", compresslevel=9, fileobj=open('sitemap.log.gz', 'wb'))#fi...
复制链接

扫一扫