Python:UnicodeEncodeError: 'gbk' codec can't encode character '\xbb' in position 12305，以及中文乱码的解决方案

最新推荐文章于 2023-03-14 13:47:13 发布

HW140701

最新推荐文章于 2023-03-14 13:47:13 发布

阅读量1.4w

点赞数 2

分类专栏： Python

本文为博主原创文章，未经博主允许不得转载，如需转载请先得到博主的同意，如需疑问，请联系stubbornhuang@qq.com，也可以加入计算机图形图像群526867211，以及访问我的个人站点：www.stubbornhuang.com，谢谢。

本文链接：https://blog.csdn.net/hw140701/article/details/52044905

版权

Python 专栏收录该内容

28 篇文章 4 订阅

订阅专栏

刚刚学习了Python没几天，看了《Python网络数据采集》这本书，准备今天在网上试验着爬一个数据，网站是UTF-8编码的，可以在网站的文件头可以看出来

所以我就按照书上的代码照着写了几行代码

#__author__ = 'Administrat
#coding=utf-8
from urllib.request import  urlopen
from urllib  import request
from bs4 import BeautifulSoup
import requests
headers = {'User-Agent':'Mozilla/5.0 (Windows NT 6.1; WOW64; rv:23.0) Gecko/20100101 Firefox/23.0'}
req=request.Request("网址",headers=headers)
html=urlopen(req)
bsObj=BeautifulSoup(html.read())
print(bsObj.body)

结果马上出现UnicodeEncodeError: 'gbk' codec can't encode character '\xbb' in position 12305: illegal multibyte sequence

的这个错误，所以在网上搜索教程后发现了问题的所在，附上网址http://blog.csdn.net/jim7424994/article/details/22675759点击打开链接

结果按照上述的解决方案将代码改成，添加了

sys.stdout = io.TextIOWrapper(sys.stdout.buffer,encoding='utf-8')

#__author__ = 'Administrat
#coding=utf-8
from urllib.request import  urlopen
from urllib  import request
from bs4 import BeautifulSoup
import requests

import sys

impory io

sys.stdout = io.TextIOWrapper(sys.stdout.buffer,encoding='utf-8')

headers = {'User-Agent':'Mozilla/5.0 (Windows NT 6.1; WOW64; rv:23.0) Gecko/20100101 Firefox/23.0'}
req=request.Request("网址",headers=headers)
html=urlopen(req)
bsObj=BeautifulSoup(html.read())
print(bsObj.body)

改了代码之后，虽然没有报之前的那个错误，但是打印出来文字，英文文字没有出现乱码，但是中文出现乱码的情况

所以在详细查看了刚刚的博客之后，将

sys.stdout = io.TextIOWrapper(sys.stdout.buffer,encoding='utf-8')

改成

sys.stdout = io.TextIOWrapper(sys.stdout.buffer,encoding='gb18030')

然后就完美中文显示

真是感谢上面写博客的那位大大。。。

如果您觉得这篇博文有用，请访问我的个人站：http://www.stubbornhuang.com，更多博文干货等着您。

HW140701

关注

2
点赞
踩
4

收藏

觉得还不错? 一键收藏
打赏
2
评论
复制链接

分享到 QQ

分享到新浪微博

扫一扫

专栏目录