java程序将GBK字符转成UTF-8编码格式

2023-08-04 22:06:27

UTF-8 编码介绍

UTF-8 编码是一种被广泛应用的编码，这种编码致力于 Java代码

，

目前已经将几种亚洲语言纳入。UTF 代表 UCS Transformation Format.

UTF-8 采用变长度字节来表示字符，理论上最多可以到 6 个字节长度(一个字符六个字节)。

UTF-8 编码兼容了 ASC II(0-127)，也就是说 UTF-8 对于 ASC II 字符的编码是和 ASC II 一样的。

对于超过一个字节长度的字符，才用以下编码规范：

左边第一个字节1的个数表示这个字符编码字节的位数，

例如两位字节字符编码样式为为：110xxxxx 10xxxxxx；

三位字节字符的编码样式为：1110xxxx 10xxxxxx 10xxxxxx.；

以此类推，六位字节字符的编码样式为：1111110x 10xxxxxx 10xxxxxx 10xxxxxx 10xxxxxx 10xxxxxx。

xxx 的值由字符编码的二进制表示的位填入。只用最短的那个足够表达一个字符编码的多字节串。

例如：

Unicode 字符： 00 A9（版权符号） = 1010 1001，

UTF-8 编码为：11000010 10101001 = 0x C2 0xA9;

字符 22 60 (不等于符号) = 0010 0010 0110 0000，

UTF-8 编码为：11100010 10001001 10100000 = 0xE2 0x89 0xA0

Java代码

java程序将GBK字符转成UTF-8编码格式

UTF-8的编码原理和特性：

U+0000~U+007E 1 _ _ _ _ _ _ _ (7bits)

U+0080~U+07FF 1 1 0_ _ _ _ _ 1 0_ _ _ _ _ _ (11bits)

U+0800~U+FFFF 1 1 1 0 _ _ _ _ 1 0 _ _ _ _ _ _ 1 0 _ _ _ _ _ _ (16bits)

继续阅读