java乱码问题分析及解决22

ID：6031857

大小：87.00 KB

页数：9页

时间：2017-12-31

资源描述：

《java乱码问题分析及解决22》由会员上传分享，免费在线阅读，更多相关内容在行业资料-天天文库。

1、java乱码问题分析及解决计算机中，只有二进制的数据，不管数据是在内存中，还是在外部存储设备上。对于我们所看到的字符，也是以二进制数据的形式存在的。不同字符对应二进制数的规则，就是字符的编码。字符编码的集合称为字符集。下面我们来总结下常用字符集1.ASCIIASCII（AmericanStandardCodeforInformationInterchange，美国信息互换标准代码），是基于常用的英文字符的一套电脑编码系统。每一个ASCII码与一个8位（bit）二进制数对应。其最高位是0，相应的十进制数是0～127

2、。例如，数字字符“0”的编码用十进制数表示就是48。另有128个扩展的ASCII码，最高位都是1，由一些图形和画线符号组成。ASCII是现今最通用的单字节编码系统。ASCII用一个字节来表示字符，最多能够表示256种字符。随着计算机的普及，许多国家都将本地的语言符号引入到计算机中，扩展了计算机中字符的范围，于是就出现了各种不同的字符集。ASCII码表请看附录一。2.ISO8859-1因为ASCII码中缺少￡、ü和许多书写其他语言所需的字符，为此，可以通过指定128以后的字符来扩展ASCII码。国际标准组织（ISO

3、）定义了几个不同的字符集，它们是在ASCII码基础上增加了其他语言和地区需要的字符。其中最常用的是ISO8859-1，通常叫做Latin-1。Latin-1包括了书写所有西方欧洲语言不可缺少的附加字符，其中0～127的字符与ASCII码相同。ISO8859另外定义了14个适用于不同文字的字符集（8859-2到8859-15）。这些字符集共享0～127的ASCII码，只是每个字符集都包含了128～255的其他字符。3.GB2312和GBKGB2312是中华人民共和国国家标准汉字信息交换用编码，全称《信息交换用汉字编

4、码字符集－基本集》，标准号为GB2312-80，是一个由中华人民共和国国家标准总局发布的关于简化汉字的编码，通行于中国大陆和新加坡，简称国标码。因为中文字符数量较多，所以采用两个字节来表示一个字符，分别称为高位和低位。为了和ASCII码有所区别，中文字符的每一个字节的最高位都用1来表示。GB2312字符集是几乎所有的中文系统和国际化的软件都支持的中文字符集，也是最基本的中文字符集。它包含了大部分常用的一、二级汉字和9区的符号，其编码范围是高位0xa1-0xfe，低位也是0xa1-0xfe，汉字从0xb0a1开始，

5、结束于0xf7fe。为了对更多的字符和符号进行编码，由前电子部科技质量司和国家技术监督局标准化司于1995年12月颁布了GBK（K是“扩展”的汉语拼音第一个字母）编码规范，在新的编码系统里，除了完全兼容GB2312外，还对繁体中文、一些不常用的汉字和许多符号进行了编码。它也是现阶段Windows和其他一些中文操作系统的默认字符集，但并不是所有的国际化软件都支持该字符集。不过要注意的是GBK不是国家标准，它只是规范。GBK字符集包含了20902个汉字，其编码范围是0x8140-0xfefe。每个国家（或区域）都规定

6、了计算机信息交换用的字符编码集，这就造成了交流上的困难。想像一下，你发送一封中文邮件给一位远在西班牙的朋友，当邮件通过网络发送出去的时候，你所书写的中文字符会按照本地的字符集GBK转换为二进制编码数据，然后发送出去。当你的朋友接收到邮件（二进制数据）后，查看信件时，会按照他所用系统的字符集，将二进制编码数据解码为字符，然而由于两种字符集之间编码的规则不同，导致转换出现乱码。这是因为，在不同的字符集之间，同样的数字可能对应了不同的符号，也可能在另一种字符集中，该数字没有对应符号。为了解决上述问题，统一全世界的字符编

7、码，由Unicode协会制定并发布了Unicode编码。1.UNICODEUnicode（统一的字符编码标准集）使用0～65535的双字节无符号数对每一个字符进行编码。它不仅包含来自英语和其他西欧国家字母表中的常见字母和符号，也包含来自古斯拉夫语、希腊语、希伯来语、阿拉伯语和梵语的字母表。另外还包含汉语和日语的象形汉字和韩国的Hangul音节表。目前已经定义了40000多个不同的Unicode字符，剩余25000个空缺留给将来扩展使用。其中大约20000个字符用于汉字，另外11000左右的字符用于韩语音节。Uni

8、code中0～255的字符与ISO8859-1中的一致。Unicode编码对于英文字符采取前面加“0”字节的策略实现等长兼容。如“a”的ASCII码为0x61，Unicode码就为0x00，0x61。2.UTF-8使用Unicode编码，一个英文字符要占用两个字节，在Internet上，大多数的信息都是用英文来表示的，如果都采用Unicode编码，将会使数据量增加一倍。为

当前文档最多预览五页，下载文档查看全文

侵权申诉



1 1 2 3 4 5 / 9



此文档下载收益归作者所有

当前文档最多预览五页，下载文档查看全文

温馨提示：
1. 部分包含数学公式或PPT动画的文件，查看预览时可能会显示错乱或异常，文件下载后无此问题，请放心下载。
2. 本文档由用户上传，版权归属用户，天天文库负责整理代发布。如果您对本文档版权有争议请及时联系客服。
3. 下载前请仔细阅读文档内容，确认文档内容符合您的需求后进行下载，若出现内容与标题不符可向本站投诉处理。
4. 下载文档时可能由于网络波动等原因无法下载或下载错误，付费完成后未能成功下载的用户请联系客服处理。

java乱码问题分析及解决22

java乱码问题分析及解决22

相关文章

相关标签