300字范文 > java gbk汉字 10进制用java程序将GBK字符转成UTF-8编码格式

java gbk汉字 10进制用java程序将GBK字符转成UTF-8编码格式

时间：2023-05-02 02:51:29

UTF-8 采用变长度字节来表示字符，理论上最多可以到 6 个字节长度(一个字符六个字节)。

UTF-8 编码兼容了 ASC II(0-127)，也就是说 UTF-8 对于 ASC II 字符的编码是和 ASC II 一样的。

对于超过一个字节长度的字符，才用以下编码规范：

左边第一个字节1的个数表示这个字符编码字节的位数，

例如两位字节字符编码样式为为：110xxxxx 10xxxxxx；

三位字节字符的编码样式为：1110xxxx 10xxxxxx 10xxxxxx.；

以此类推，六位字节字符的编码样式为：1111110x 10xxxxxx 10xxxxxx 10xxxxxx 10xxxxxx 10xxxxxx。

xxx 的值由字符编码的二进制表示的位填入。只用最短的那个足够表达一个字符编码的多字节串。

例如：

Unicode 字符： 00 A9(版权符号) = 1010 1001，

UTF-8 编码为：11000010 10101001 = 0x C2 0xA9;

字符 22 60 (不等于符号) = 0010 0010 0110 0000，

UTF-8 编码为：11100010 10001001 10100000 = 0xE2 0x89 0xA0

代码

packagecom.lang.string;

publicclassConverFromGBKToUTF8{

publicstaticvoidmain(String[]args){

try{

ConverFromGBKToUTF8convert=newConverFromGBKToUTF8();

byte[]fullByte=convert.gbk2utf8(chenese);

StringfullStr=newString(fullByte,"UTF-8");

System.out.println("stringfromGBKtoUTF-8byte:"+fullStr);

}catch(Exceptione){

e.printStackTrace();

}

publicbyte[]gbk2utf8(Stringchenese){

charc[]=chenese.toCharArray();

byte[]fullByte=newbyte[3*c.length];

for(inti=0;i

intm=(int)c[i];

Stringword=Integer.toBinaryString(m);

//System.out.println(word);

StringBuffersb=newStringBuffer();

intlen=16-word.length();

//补零

for(intj=0;j

sb.append("0");

}

sb.append(word);

sb.insert(0,"1110");

sb.insert(8,"10");

sb.insert(16,"10");

//System.out.println(sb.toString());

Strings1=sb.substring(0,8);

Strings2=sb.substring(8,16);

Strings3=sb.substring(16);

byteb0=Integer.valueOf(s1,2).byteValue();

byteb1=Integer.valueOf(s2,2).byteValue();

byteb2=Integer.valueOf(s3,2).byteValue();

byte[]bf=newbyte[3];

bf[0]=b0;

fullByte[i*3]=bf[0];

bf[1]=b1;

fullByte[i*3+1]=bf[1];

bf[2]=b2;

fullByte[i*3+2]=bf[2];

}

returnfullByte;

}

UTF-8的编码原理和特性：

U+0000~U+007E 1 _ _ _ _ _ _ _ (7bits)

U+0080~U+07FF 1 1 0_ _ _ _ _ 1 0_ _ _ _ _ _ (11bits)

U+0800~U+FFFF 1 1 1 0 _ _ _ _ 1 0 _ _ _ _ _ _ 1 0 _ _ _ _ _ _ (16bits)

本内容不代表本网观点和政治立场，如有侵犯你的权益请联系我们处理。

网友评论

网友评论仅供其表达个人看法，并不表明网站立场。

java gbk汉字 10进制 用java程序将GBK字符转成UTF-8编码格式

java gbk汉字 10进制用java程序将GBK字符转成UTF-8编码格式