300字范文,内容丰富有趣,生活中的好帮手!
300字范文 > java gbk汉字 10进制 用java程序将GBK字符转成UTF-8编码格式

java gbk汉字 10进制 用java程序将GBK字符转成UTF-8编码格式

时间:2023-05-02 02:51:29

相关推荐

java gbk汉字 10进制 用java程序将GBK字符转成UTF-8编码格式

UTF-8 采用变长度字节来表示字符,理论上最多可以到 6 个字节长度(一个字符六个字节)。

UTF-8 编码兼容了 ASC II(0-127), 也就是说 UTF-8 对于 ASC II 字符的编码是和 ASC II 一样的。

对于超过一个字节长度的字符,才用以下编码规范:

左边第一个字节1的个数表示这个字符编码字节的位数,

例如两位字节字符编码样式为为:110xxxxx 10xxxxxx;

三位字节字符的编码样式为:1110xxxx 10xxxxxx 10xxxxxx.;

以此类推,六位字节字符的编码样式为:1111110x 10xxxxxx 10xxxxxx 10xxxxxx 10xxxxxx 10xxxxxx。

xxx 的值由字符编码的二进制表示的位填入。只用最短的那个足够表达一个字符编码的多字节串。

例如:

Unicode 字符: 00 A9(版权符号) = 1010 1001,

UTF-8 编码为:11000010 10101001 = 0x C2 0xA9;

字符 22 60 (不等于符号) = 0010 0010 0110 0000,

UTF-8 编码为:11100010 10001001 10100000 = 0xE2 0x89 0xA0

代码

packagecom.lang.string;

publicclassConverFromGBKToUTF8{

publicstaticvoidmain(String[]args){

try{

ConverFromGBKToUTF8convert=newConverFromGBKToUTF8();

byte[]fullByte=convert.gbk2utf8(chenese);

StringfullStr=newString(fullByte,"UTF-8");

System.out.println("stringfromGBKtoUTF-8byte:"+fullStr);

}catch(Exceptione){

e.printStackTrace();

}

}

publicbyte[]gbk2utf8(Stringchenese){

charc[]=chenese.toCharArray();

byte[]fullByte=newbyte[3*c.length];

for(inti=0;i

intm=(int)c[i];

Stringword=Integer.toBinaryString(m);

//System.out.println(word);

StringBuffersb=newStringBuffer();

intlen=16-word.length();

//补零

for(intj=0;j

sb.append("0");

}

sb.append(word);

sb.insert(0,"1110");

sb.insert(8,"10");

sb.insert(16,"10");

//System.out.println(sb.toString());

Strings1=sb.substring(0,8);

Strings2=sb.substring(8,16);

Strings3=sb.substring(16);

byteb0=Integer.valueOf(s1,2).byteValue();

byteb1=Integer.valueOf(s2,2).byteValue();

byteb2=Integer.valueOf(s3,2).byteValue();

byte[]bf=newbyte[3];

bf[0]=b0;

fullByte[i*3]=bf[0];

bf[1]=b1;

fullByte[i*3+1]=bf[1];

bf[2]=b2;

fullByte[i*3+2]=bf[2];

}

returnfullByte;

}

}

UTF-8的编码原理和特性:

U+0000~U+007E 1 _ _ _ _ _ _ _ (7bits)

U+0080~U+07FF 1 1 0_ _ _ _ _ 1 0_ _ _ _ _ _ (11bits)

U+0800~U+FFFF 1 1 1 0 _ _ _ _ 1 0 _ _ _ _ _ _ 1 0 _ _ _ _ _ _ (16bits)

本内容不代表本网观点和政治立场,如有侵犯你的权益请联系我们处理。
网友评论
网友评论仅供其表达个人看法,并不表明网站立场。