判断网页的编码方式 python

最新推荐文章于 2021-10-22 16:14:01 发布

Winterto1990

最新推荐文章于 2021-10-22 16:14:01 发布

阅读量6.5k

点赞数 2

分类专栏： python 文章标签： python 编码

本文链接：https://blog.csdn.net/winterto1990/article/details/47658887

版权

python 专栏收录该内容

75 篇文章 1 订阅

订阅专栏

在学习python爬取网页的时候，我们经常会遇到编码方式的困扰，为了解决这个编码方式的问题，首先是要获取网页的编码方式，下面就获取网页的编码方式重点说一下三种方法。

一， 使用urllib模块的getparam方法

>import urllib
>fopen1 = urllib.urlopen('http://www.baidu.com').info()
>print fopen1.getparam('charset')# baidu

二， 使用chardet模块

>import chardet 
>import urllib
>#先获取网页内容
>data1 = urllib.urlopen('http://www.baidu.com').read()
>#用chardet进行内容分析
>chardit1 = chardet.detect(data1)
>print chardit1['encoding'] # baidu

三，利用BeautifulSoup模块方法

>from bs4 import BeautifulSoup
>import urllib2
>content=urllib2.urlopen(url)#这里url是你需要获取的网页
>soup=BeautifulSoup(content)
>print soup.original_encoding #这里的输出就是网页的编码方式

这里爬取网页内容出现的乱码问题，可以参考博客文章。

这里获取网页html内容，可以参考博客文章。