Python中的编码

写在前面

因为计算机是美国人发明的的,ASCII编码也是美国人发明的,编程语言也都是基于英语的,因此,对于中文的支持就不那么友好,ASCII压根就没有考虑中文,这就导致汉字的编码解码问题一直困扰着我。

encode()和decode()函数

从英文意思上看,encodedecode分别指编码解码。在python中,Unicode类型是作为编码的基础类型,即:

先看编码过程,不同的编码会有不同的结果,但都为`bytes`类型 ``` >>> a = "中文" >>> b1 = a.encode() # 等价于a.encode("utf8") >>> b1 b'\xe4\xb8\xad\xe6\x96\x87' >>> type(b1) >>> b2 = a.encode("gbk") >>> b2 b'\xd6\xd0\xce\xc4' >>> type(b2) >>> bytes(a, "utf8") # 同样的效果 b'\xe4\xb8\xad\xe6\x96\x87' ``` 一把钥匙开一把锁,你用`utf8`方式编码,就得用`utf8`方式解码,要是用`gbk`方式解码,要么是解析不了内容而报错,要么是一堆乱码。 ``` >>> b1.decode() '中文' >>> b1.decode("gbk") Traceback (most recent call last): File "", line 1, in b1.decode("gbk") UnicodeDecodeError: 'gbk' codec can't decode byte 0xad in position 2: illegal multibyte sequence >>> b2.decode("gbk") '中文' >>> str(b1, "utf8") # 等效表示 '中文' ```

base64

Base64编码是一种“防君子不防小人”的编码方式。广泛应用于MIME协议,作为电子邮件的传输编码,生成的编码可逆,后一两位可能有“=”,生成的编码都是ascii字符。
优点:速度快,ascii字符,肉眼不可理解
缺点:编码比较长,非常容易被破解,仅适用于加密非关键信息的场合

在python3.x中,字符都为unicode编码,而b64encode函数的参数为byte类型,所以必须先转码。

>>> import base64
>>> base64.b64encode('中文')
Traceback (most recent call last):
  File "<pyshell#30>", line 1, in <module>
    base64.b64encode('中文')
  File "C:\Python36\lib\base64.py", line 58, in b64encode
    encoded = binascii.b2a_base64(s, newline=False)
TypeError: a bytes-like object is required, not 'str'

>>> base64.b64encode('中文'.encode('gbk'))
b'1tDOxA=='
>>> base64.b64encode('中文'.encode('utf8'))
b'5Lit5paH'
posted @ 2020-03-07 17:55  crj1998  阅读(85)  评论(0)    收藏  举报