Python-编码encoding基础

编码,就是一本 “翻译词典” ,规定了如何把人类文字“翻译”成计算机能理解的“0和1”,反过来也能把“0和1”翻译回人类文字。

  • 字符、character:各种文字、数字、符号等
  • 字符集、charset:多个字符的集合,定义字符和数字的对应关系(为每个字符分配唯一的二进制码字符)
    • 统一码、Unicode:定义了几乎所有字符对应的数字(Unicode字符集的实现:UTF-8、UTF-16和UTF-32)
    • Python3:将读入的字节解码为 Unicode 字符串(str),在内存中操作。(处理/操作时(内部)
      • 优点:按字符为单位操作,处理高效
  • 编码、encoding:将字符转换为对应二进制并存储到计算机中(规定了如何转换、如何存储)
    • 转换和存储:解决字符如何用二进制字节来存储,是1个字节还是多个字节?
    • Python3:文本被编码成 UTF-8 格式的字节(bytes),存于文件或网络中。(存储/传输时(外部))
      • 优点:节省空间、保证兼容性
ASCII编码

共128个字符,只能用于表示英文和数字

1、编码长度:用前7位表示一个字符,最高位默认为0

2、存储长度:占用1个字节(8位)

中文编码

包含汉字数量:GB18030 > GBK > GB2312

UTF-8编码

可变长度字符编码、使用1~4个字节来存储

1、字母、数字使用1个字节

2、常用中文字符在UTF-8中占用3个字节

posted @ 2026-07-01 17:37  Fēngwèi  阅读(13)  评论(0)    收藏  举报