UTF-8 采用变长度字节来表示字符,理论上最多可以到 6 个字节长度(一个字符六个字节)。
UTF-8 编码兼容了 ASC II(0-127), 也就是说 UTF-8 对于 ASC II 字符的编码是和 ASC II 一样的。
对于超过一个字节长度的字符,才用以下编码规范:
左边第一个字节1的个数表示这个字符编码字节的位数,
例如两位字节字符编码样式为为:110xxxxx 10xxxxxx;
三位字节字符的编码样式为:1110xxxx 10xxxxxx 10xxxxxx.;
以此类推,六位字节字符的编码样式为:1111110x 10xxxxxx 10xxxxxx 10xxxxxx 10xxxxxx 10xxxxxx。
xxx 的值由字符编码的二进制表示的位填入。只用最短的那个足够表达一个字符编码的多字节串。
例如:
Unicode 字符: 00 A9(版权符号) = 1010 1001,
UTF-8 编码为:11000010 10101001 = 0x C2 0xA9;
字符 22 60 (不等于符号) = 0010 0010 0110 0000,
UTF-8 编码为:11100010 10001001 10100000 = 0xE2 0x89 0xA0
代码
packagecom.lang.string;
publicclassConverFromGBKToUTF8{
publicstaticvoidmain(String[]args){
try{
ConverFromGBKToUTF8convert=newConverFromGBKToUTF8();
byte[]fullByte=convert.gbk2utf8(chenese);
StringfullStr=newString(fullByte,"UTF-8");
System.out.println("stringfromGBKtoUTF-8byte:"+fullStr);
}catch(Exceptione){
e.printStackTrace();
}
}
publicbyte[]gbk2utf8(Stringchenese){
charc[]=chenese.toCharArray();
byte[]fullByte=newbyte[3*c.length];
for(inti=0;i
intm=(int)c[i];
Stringword=Integer.toBinaryString(m);
//System.out.println(word);
StringBuffersb=newStringBuffer();
intlen=16-word.length();
//补零
for(intj=0;j
sb.append("0");
}
sb.append(word);
sb.insert(0,"1110");
sb.insert(8,"10");
sb.insert(16,"10");
//System.out.println(sb.toString());
Strings1=sb.substring(0,8);
Strings2=sb.substring(8,16);
Strings3=sb.substring(16);
byteb0=Integer.valueOf(s1,2).byteValue();
byteb1=Integer.valueOf(s2,2).byteValue();
byteb2=Integer.valueOf(s3,2).byteValue();
byte[]bf=newbyte[3];
bf[0]=b0;
fullByte[i*3]=bf[0];
bf[1]=b1;
fullByte[i*3+1]=bf[1];
bf[2]=b2;
fullByte[i*3+2]=bf[2];
}
returnfullByte;
}
}
UTF-8的编码原理和特性:
U+0000~U+007E 1 _ _ _ _ _ _ _ (7bits)
U+0080~U+07FF 1 1 0_ _ _ _ _ 1 0_ _ _ _ _ _ (11bits)
U+0800~U+FFFF 1 1 1 0 _ _ _ _ 1 0 _ _ _ _ _ _ 1 0 _ _ _ _ _ _ (16bits)