Python-编码encoding基础
编码,就是一本 “翻译词典” ,规定了如何把人类文字“翻译”成计算机能理解的“0和1”,反过来也能把“0和1”翻译回人类文字。
- 字符、character:各种文字、数字、符号等
- 字符集、charset:多个字符的集合,定义字符和数字的对应关系(为每个字符分配唯一的二进制码字符)
- 统一码、Unicode:定义了几乎所有字符对应的数字(Unicode字符集的实现:UTF-8、UTF-16和UTF-32)
- Python3:将读入的字节解码为 Unicode 字符串(str),在内存中操作。(处理/操作时(内部))
- 优点:按字符为单位操作,处理高效
- 编码、encoding:将字符转换为对应二进制并存储到计算机中(规定了如何转换、如何存储)
- 转换和存储:解决字符如何用二进制字节来存储,是1个字节还是多个字节?
- Python3:文本被编码成 UTF-8 格式的字节(bytes),存于文件或网络中。(存储/传输时(外部))
- 优点:节省空间、保证兼容性
| ASCII编码 |
共128个字符,只能用于表示英文和数字 1、编码长度:用前7位表示一个字符,最高位默认为0 2、存储长度:占用1个字节(8位) |
| 中文编码 |
包含汉字数量:GB18030 > GBK > GB2312 |
| UTF-8编码 |
可变长度字符编码、使用1~4个字节来存储 1、字母、数字使用1个字节 2、常用中文字符在UTF-8中占用3个字节 |
本文来自博客园,作者:Fēngwèi,转载请注明原文链接:https://www.cnblogs.com/fengwei-blogs/p/21012455

浙公网安备 33010602011771号