python --编码检测

时间：08-16来源：作者：点击数：34

python --编码检测

import chardet

当我们拿到一个bytes时，就可以对其检测编码。用chardet检测编码，只需要一行代码：

chardet.detect(b'Hello, world!')
{'encoding': 'ascii', 'confidence': 1.0, 'language': ''}

检测出的编码是ascii，注意到还有个confidence字段，表示检测的概率是1.0（即100%）。

我们来试试检测GBK编码的中文：

 data = '离离原上草，一岁一枯荣'.encode('gbk')
 chardet.detect(data)
 {'encoding': 'GB2312', 'confidence': 0.7407407407407407, 'language': 'Chinese'}

检测的编码是GB2312，注意到GBK是GB2312的超集，两者是同一种编码，检测正确的概率是74%，language字段指出的语言是’Chinese’。

对UTF-8编码进行检测：

 data = '离离原上草，一岁一枯荣'.encode('utf-8')
 chardet.detect(data)
 {'encoding': 'utf-8', 'confidence': 0.99, 'language': ''}

我们再试试对日文进行检测：

data = '最新の主要ニュース'.encode('euc-jp')
chardet.detect(data)
{'encoding': 'EUC-JP', 'confidence': 0.99, 'language': 'Japanese'}

方便获取更多学习、工作、生活信息请关注本站微信公众号 城东书院微信服务号

吐血整理\| 全国招投标	高考生入学注意：这些大
【健康】纯净水、天然	14种竞赛生升学路径盘

首页