java字符集编码_java字符集和字符编码集

Java系统内的字符以双字节存储,采用unicode(utf-16之一)编码。 (估计jdk后续版本的java字符编码可能提升为4字节,这样可彻底解决东方国家字库问题。) Utf-8是一种标准存储编码格式,用utf-8编码后的字节流具有非常好的纠错和兼容能力。 用utf-8编码(encode)unicode码时不会有信息损失。当然用utf-8解码(decode)utf-8编码的字节流, 生成unicode码时也不会有信息损失。但禁止用utf-8解码非utf-8编码的字节流。总之Utf-8可以编码任何unicode 码, 但只能解码utf-8编码的字节流。 Utf-16和utf-8用法是一样的,仅是一点不同:utf-16是双字节倍数编码,utf-8是单字节倍数编码, 在英文国家里用utf-8和ascii编码后的字节流是一样的,这样有利于系统平稳升级到支持utf-8的系统里, 但系统要升级到支持utf-16就要把所有数据都更新一遍,这显然不能接受。注意:utf-16根据字节排序不同有两种编码 Iso8859-1是西方国家频繁使用的字符编码格式。用iso8859-1编码unicode码中的东方字库部分的字符时统统编码成??, 也就是说:用iso8859-1编码unicode码时信息会有损失。但用iso8859-1解码任意(iso8859-1编码的和非iso8859-1编码的)字符流时, 信息不会有损失,这是因为一个字节中的所有256个字符对iso8859-1都是合法的都是合法的。 有时候在一些linux操作系统和一些应用服务器里,默认的解码方式是iso8859-1,这是大多数乱码的原因。 Gb18030,gbk,gb2312是汉字字符的编码格式,用gb18030(gbk,gb2312和gb18030是同一系列,不过字库要小, 但使用方式是一样的,这里不区分,统统用gb18030)编码unicode码时非中英文的字符会被编码为?, 也就是说,用gb18030只能编码unicode中的中英文字符,其他的字符都会被损失掉。 同样用gb18030解码只能解码gb18030编码的字符流。 Xml文件中 是告诉浏览器要用要用指定的编码格式解码自身这个文件,当然要求浏览器首先要支持这个编码格式(在客户端), jsp页面的字符集是告诉jsp服务器要用要用指定的编码格式解码自身这个jsp文件(在服务器段). 然而在servlet程序中response.setContentType("text/html; charset=GBK"); 是告诉servlet程序用指定编码格式编码(在服务器段) 字符集转换的基本思想很简单,用某种字符编码规则编码,就用什么编码规则解码, 经常出问题的深层次原因是java对字节流未提供编码信息,可以认为这是一个严重的失误。 估计未来的java能提供这样的信息。…待续 涉及编码问题的地方有:java类文件编辑时,java类文件编译时,实施文件,服务器指定, jsp文件内指定,xml(html)内指定,servlet文件指定,资源连接点配置中指定. 不能正常显示原因通常在两个地方:字符集;字库。对于通用的软件, 一般都提供完整的字库支持。所以一般问题是解码不正确。

  • 0
    点赞
  • 0
    收藏
    觉得还不错? 一键收藏
  • 0
    评论

“相关推荐”对你有帮助么?

  • 非常没帮助
  • 没帮助
  • 一般
  • 有帮助
  • 非常有帮助
提交
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值