2017 年 8月 8 日随笔档案 - 熊猫猛男

2017年8月8日

Unicode 与 Unicode Transformation Format（UTF-8 / UTF-16 / UTF-32)

摘要： UTF-8用1个字节(U+0000~U+007F)来编码所有ASCII字符，并且与ASCII字符表示是一样的，故其与ASCII兼容，而那些ISO Latin-1扩展ASCII字符集的字符(128~255)是UNICODE的子集，但不是UTF-8的子集；其他的字符UTF-8编码将需要2～4个字节，首字节连续的1的个数表示字符编码所需的字节数。“编”的Unicode编码是U+7F16，因此UTF-8需要3个字节来表示，形如1110xxxx 10xxxxxx 10xxxxxx这种格式。由于UTF-8采用的是变长字符编码，与UTF-16和UTF-32相比，无论是计算字符数，还是执行索引操作效率都不高，因此UTF-8适合在传输数据中使用，可在数据接收完毕后将其转换为UTF-16或UTF-32进行处理，最后再转换回UTF-8(但这转换本身也会有性能损耗)；但UTF-8空间足够大，无字节序问题，且容错性高，局部的字节错误（丢失、增加、改变）不会导致连锁性的错误，因为 UTF-8 的字符边界很容易检测出来阅读全文

posted @ 2017-08-08 09:20 熊猫猛男阅读(1238) 评论(0) 推荐(0) 编辑

熊猫猛男

公告