深入剖析JSP和Servlet对中文的处理

2016-01-29 12:14 1 1 收藏

深入剖析JSP和Servlet对中文的处理,深入剖析JSP和Servlet对中文的处理

【 tulaoshi.com - Java 】

　　世界上的各地区都有本地的语言。地区差异直接导致了语言环境的差异。在开发一个国际化程序的过程中，处理语言问题就显得很重要了。

　　这是一个世界范围内都存在的问题，所以，Java提供了世界性的解决方法。本文描述的方法是用于处理中文的，但是，推而广之，对于处理世界上其它国家和地区的语言同样适用。

　　汉字是双字节的。所谓双字节是指一个双字要占用两个BYTE的位置（即16位），分别称为高位和低位。中国规定的汉字编码为GB2312，这是强制性的，目前几乎所有的能处理中文的应用程序都支持GB2312。GB2312包括了一二级汉字和9区符号，高位从0xa1到0xfe，低位也是从0xa1到0xfe，其中，汉字的编码范围为0xb0a1到0xf7fe。

　　另外有一种编码，叫做GBK，但这是一份规范，不是强制的。GBK提供了20902个汉字，它兼容GB2312，编码范围为0x8140到0xfefe。GBK中的所有字符都可以一一映射到Unicode 2.0。

　　在不久的将来，中国会颁布另一种标准：GB18030-2000（GBK2K）。它收录了藏、蒙等少数民族的字型，从根本上解决了字位不足的问题。注意：它不再是定长的。其二字节部份与GBK兼容，四字节部分是扩充的字符、字形。它的首字节和第三字节从0x81到0xfe，二字节和第四字节从0x30到0x39。

　　本文不打算介绍Unicode，有兴趣的可以浏览“http://www.unicode.org/”查看更多的信息。Unicode有一个特性：它包括了世界上所有的字符字形。所以，各个地区的语言都可以建立与Unicode的映射关系，而Java正是利用了这一点以达到异种语言之间的转换。

　　在JDK中，与中文相关的编码有：

　　表1　JDK中与中文相关的编码列表
编码名称说明ASCII7位，与ascii7相同ISO8859-18-位，与 8859_1,ISO-8859-1,ISO_8859-1,latin1...等相同GB2312-8016位，与gb2312,gb2312-1980,EUC_CN,euccn,1381,Cp1381, 1383, Cp1383, ISO2022CN,ISO2022CN_GB...等相同GBK与MS936相同，注意：区分大小写UTF8与UTF-8相同GB18030与cp1392、1392相同，目前支持的JDK很少

　　在实际编程时，接触得比较多的是GB2312（GBK）和ISO8859-1。

　　为什么会有“?”号

　　上文说过，异种语言之间的转换是通过Unicode来完成的。假设有两种不同的语言A和B，转换的步骤为：先把A转化为Unicode，再把Unicode转化为B。

　　举例说明。有GB2312中有一个汉字“李”，其编码为“C0EE”，欲转化为ISO8859-1编码。步骤为：先把“李”字转化为Unicode，得到“674E”，再把“674E”转化为ISO8859-1字符。当然，这个映射不会成功，因为ISO8859-1中根本就没有与“674E”对应的字符。

　　当映射不成功时，问题就发生了！当从某语言向Unicode转化时，如果在某语言中没有该字符，得到的将是Unicode的代码“uffffd”（“u”表示是Unicode编码，）。而从Unicode向某语言转化时，如果某语言没有对应的字符，则得到的是“0x3f”（“?”）。这就是“?”的由来。

　　例如：把字符流buf =“0x80 0x40 0xb0 0xa1”进行new String(buf, "gb2312")操作，得到的结果是“ufffdu554a”，再println出来，得到的结果将是“?啊”，因为“0x80 0x40”是GBK中的字符，在GB2312中没有。

　　再如，把字符串String="u00d6u00ecu00e9u0046u00bbu00f9"进行new String (buf.getBytes("GBK"))操作，得到的结果是“3fa8aca8a6463fa8b4”，其中，“u00d6”在“GBK”中没有对应的字符，得到“3f”，“u00ec”对应着“a8ac”，“u00e9”对应着“a8a6”，“0046”对应着“46”（因为这是ASCII字符），“u00bb”没找到，得到“3f”，最后，“u00f9”对应着“a8b4”。把这个字符串println一下，得到的结果是“?ìéF?ù”。看到没？这里并不全是问号，因为GBK与Unicode映射的内容中除了汉字外还有字符，本例就是最好的明证。

　　所以，在汉字转码时，如果发生错乱，得到的不一定都是问号噢！不过，错了终究是错了，50步和100步并没有质的差别。

　　或者会问：如果源字符集中有，而Unicode中没有，结果会如何？回答是不知道。因为我手头没有能做这个测试的源字符集。但有一点是肯定的，那就是源字符集不够规范。在Java中，如果发生这种情况，是会抛出异常的。

　　什么是UTF

　　UTF，是Unicode Text Format的缩写，意为Unicode文本格式。对于UTF，是这样定义的：

　　（1）如果Unicode的16位字符的头9位是0，则用一个字节表示，这个字节的首位是“0”，剩下的7位与原字符中的后7位相同，如“u0034”（0000 0000 0011 0100），用“34” (0011 0100)表示；（与源Unicode字符是相同的）；

　　（2）如果Unicode的16位字符的头5位是0

来源:https://www.tulaoshi.com/n/20160129/1485218.html

上一篇： CSS2盒模型的3D示意图
下一篇：修改Tomcat的主配置文件,增加一个Postgre数据库JDBC连接池

看过《深入剖析JSP和Servlet对中文的处理》的人还看了以下文章更多>>

快速建立Servlet和JSP的运行、调试和编译环境

标签： Java JAVA基础

相信很多刚开始学习Servlet和JSP的朋友都有一个困扰，就是如何快速方便的建立一个Servlet和JSP的运行、调试和编译环境。本人现在正在国外攻读MIT（Master of Information Technology)，现在选修的这一科是WBIS（Web Based Information Systems），其包含了许多种技术，如Java，Perl，CGI，Servlet，ASP，Java Script，JSP，OO，UML等等...

JSP与Servlet之一

标签： Java JAVA基础

JSP和SERVLET到底在应用上有什么区别，很多人搞不清楚。我来胡扯几句吧。简单的说，SUN首先发展出SERVLET，其功能比较强劲，体系设计也很先进，只是，它输出HTML语句还是采用了老的CGI方式，是一句一句输出，所以，编写和修改HTML非常不方便。后来SUN推出了类似于ASP的镶嵌型的JSP，把JSP TAG镶嵌到HTML语句中，这样，就大大简化和方便了网...

JSP/Servlet的URL重定向

标签： Web开发

1.RequestDispatcher.forward() 是在服务器端起作用,当使用forward()时,Servlet engine传递HTTP请求从当前的Servlet or JSP到另外一个Servlet,JSP 或普通HTML文件,也即你的form提交至a.jsp,在a.jsp用到了forward()重定向至b.jsp,此时form提交的所有信息在 b.jsp都可以获得,参数自动传递. 但forward()无法重定向至...

JSP与Servlet之二

标签： Java JAVA基础

为什么要采用这些组件技术呢？因为单纯的ASP/JSP语言是非常低效率执行的，如果出现大量用户点击，纯SCRIPT语言很快就到达了他的功能上限，而组件技术就能大幅度提高功能上限，加快执行速度。另外一方面，纯SCRIPT语言将presentation layer和business layer混在一起，造成修改不方便，并且代码不能重复利用。如果想修改一个地方，经常...

解析Servlet/JSP会话跟踪机制

标签： Web开发

在Web服务器端编程中，会话状态管理是一个经常必须考虑的重要问题。本文分析JSP/Servlet的会话管理机制及其所面临的问题，然后提出了一种改进的会话管理方法。一、Servlet的会话管理机制根据设计，HTTP是一种无状态的协议。它意味着Web应用并不了解有关同一用户以前请求的信息。维持会话状态信息的方法之一是使用Servlet或者JSP容器提供的...

查看更多精彩>>