import chardet 查看字符编码

最新推荐文章于 2024-04-24 10:00:00 发布

木下瞳

最新推荐文章于 2024-04-24 10:00:00 发布

阅读量1.3k

点赞数

分类专栏： Python模块使用

51 篇文章 4 订阅

订阅专栏

chardet.detect(b'Hello, world!')
{'encoding': 'ascii', 'confidence': 1.0, 'language': ''}

检测出的编码是ascii，注意到还有个confidence字段，表示检测的概率是1.0（即100%）

>>> data = '离离原上草，一岁一枯荣'.encode('gbk')
>>> chardet.detect(data)
{'encoding': 'GB2312', 'confidence': 0.7407407407407407, 'language': 'Chinese'}

检测的编码是GB2312，注意到GBK是GB2312的超集，两者是同一种编码，检测正确的概率是74%，language字段指出的语言是'Chinese'

对UTF-8编码进行检测：

>>> data = '离离原上草，一岁一枯荣'.encode('utf-8')
>>> chardet.detect(data)
{'encoding': 'utf-8', 'confidence': 0.99, 'language': ''}

>>> data = '最新の主要ニュース'.encode('euc-jp')
>>> chardet.detect(data)
{'encoding': 'EUC-JP', 'confidence': 0.99, 'language': 'Japanese'}

总结：要查看字符串编码，要先解码成对应的码，data = '离离原上草，一岁一枯荣'.encode('utf-8')，如果改成 data = '离离原上草，一岁一枯荣'.encode('euc-jp') 会报错

确定要放弃本次机会？

福利倒计时

: :

立减 ¥

普通VIP年卡可用

关注关注