如果需要统一设置编码

最新推荐文章于 2020-03-20 11:48:19 发布

laingew

最新推荐文章于 2020-03-20 11:48:19 发布

阅读量741

点赞数

文章标签： java

本文链接：https://blog.csdn.net/u014131893/article/details/22536057

版权

　　比较幸运的是UTF-8编码相当有规律，所以可以通过分析传输过来的链接内容，来判断是否是正确的UTF-8字符，如果是，则以UTF-8处理之，如果不是，则使用客户默认编码(比如"GBK")，下面是一个判断是否UTF-8的例子，如果你了解相应规律，就容易理解。

　　public static boolean isValidUtf8(byte[] b,int aMaxCount){

　　intlLen=b.length,lCharCount=0;

　　for(int i=0;i<llen&& p="" lcharcount<amaxcount;++lcharcount){<="">

　　byte lByte=b[i++];//to fast operation, ++ now, ready for the following for(;;)

　　if(lByte>=0) continue;//>=0 is normal ascii

　　if(lByte<(byte)0xc0 || lByte>(byte)0xfd) return false;

　　int lCount=lByte>(byte)0xfc?5:lByte>(byte)0xf8?4

　　:lByte>(byte)0xf0?3:lByte>(byte)0xe0?2:1;

　　if(i+lCount>lLen) return false;

　　for(int j=0;j=(byte)0xc0) return false;

　　}

　　return true;

　　}

　　相应地，一个使用上述方法的例子如下：

　　public static String getUrlParam(String aStr,StringaDefaultCharset)

　　throws UnsupportedEncodingException{

　　if(aStr==null) return null;

　　byte[]lBytes=aStr.getBytes("ISO-8859-1");

　　return new String(lBytes,StringUtil.isValidUtf8(lBytes)?"utf8":aDefaultCharset);

　　}

　　不过，该方法也存在缺陷，如下两方面：

　　没有包括对用户默认编码的识别，这可以根据请求信息的语言来判断，但不一定正确，因为我们有时候也会输入一些韩文，或者其他文字。

　　可能会错误判断UTF-8字符，一个例子是"学习"两个字，其GBK编码是" \xd1\xa7\xcf\xb0",如果使用上述isValidUtf8方法判断，将返回true.可以考虑使用更严格的判断方法，不过估计效果不大。

　　有一个例子可以证明google也遇到了上述问题，而且也采用了和上述相似的处理方法，比如，如果在地址栏中输入"学习",google将无法正确识别，而其他汉字一般能够正常识别。

　　最后，应该补充说明一下，如果不使用rewrite规则，或者通过表单提交数据，其实并不一定会遇到上述问题，因为这时可以在提交数据时指定希望的编码。另外，中文文件名确实会带来问题，应该谨慎使用。

　　6. 其它

　　下面描述一些和编码有关的其他问题。

　　6.1. SecureCRT

　　除了浏览器和控制台与编码有关外，一些客户端也很有关系。比如在使用SecureCRT连接linux时，应该让SecureCRT的显示编码(不同的session,可以有不同的编码设置)和linux的编码环境变量保持一致。否则看到的一些帮助信息，就可能是乱码。

　　另外，mysql有自己的编码设置，也应该保持和SecureCRT的显示编码一致。否则通过SecureCRT执行sql语句的时候，可能无法处理中文字符，查询结果也会出现乱码。

　　对于Utf-8文件，很多编辑器(比如记事本)会在文件开头增加三个不可见的标志字节，如果作为mysql的输入文件，则必须要去掉这三个字符。(用linux的vi保存可以去掉这三个字符)。一个有趣的现象是，在中文windows下，创建一个新txt文件，用记事本打开，输入"连通"两个字，保存，再打开，你会发现两个字没了，只留下一个小黑点。

　　6.2. 过滤器

　　如果需要统一设置编码，则通过filter进行设置是个不错的选择。在filter class中，可以统一为需要的请求或者回应设置编码。参加上述setCharacterEncoding()。这个类apache已经给出了可以直接使用的例子SetCharacterEncodingFilter.

　　6.3. POST和GET

　　很明显，以POST提交信息时，URL有更好的可读性，而且可以方便的使用setCharacterEncoding()来处理字符集问题。但GET方法形成的URL能够更容易表达网页的实际内容，也能够用于收藏。

　　从统一的角度考虑问题，建议采用GET方法，这要求在程序中获得参数是进行特殊处理，而无法使用setCharacterEncoding()的便利，如果不考虑rewrite,就不存在IE的UTF-8问题，可以考虑通过设置URIEncoding来方便获取URL中的参数。

　　6.4. 简繁体编码转换

　　GBK同时包含简体和繁体编码，也就是说同一个字，由于编码不同，在GBK编码下属于两个字。有时候，为了正确取得完整的结果，应该将繁体和简体进行统一。可以考虑将UTF、GBK中的所有繁体字，转换为相应的简体字，BIG5编码的数据，也应该转化成相应的简体字。当然，仍旧以UTF编码存储。

　　例如，对于"语言语言",用UTF表示为"\xE8\xAF\xAD\xE8\xA8\x80 \xE8\xAA\x9E\xE8\xA8\x80",进行简繁体编码转换后应该是两个相同的 "\xE8\xAF\xAD\xE8\xA8\x80>".

laingew

关注

0
点赞
踩
0

收藏

觉得还不错? 一键收藏
0
评论
如果需要统一设置编码

比较幸运的是UTF-8编码相当有规律，所以可以通过分析传输过来的链接内容，来判断是否是正确的UTF-8字符，如果是，则以UTF-8处理之，如果不是，则使用客户默认编码(比如"GBK")，下面是一个判断是否UTF-8的例子，如果你了解相应规律，就容易理解。　　public static boolean isValidUtf8(byte[] b,int aMaxCount){　　intlLen
复制链接

扫一扫