java读写文件中文乱码问题

作为学计算机的,写程序总会遇到很多头疼的东西,程序中的中文支持就是其中一个很令人无柰的问题。唉,有时只能感慨,谁叫计算机、语言等等都是老外发明的呢,别人的26个字母多easy,写程序、软件也就不会有这么多问题了。我们写程序就不得不考虑中文的问题,用别人的软件英文不好的还得到处找汉化包,看别人的文档,全是英文,写自己的程序,还不得不考虑中文的问题。

我们做一个专家系统的项目,术语太多,写规则,如果全用英文,难理解,考虑到java是unicode,想当然的认为,程序就用中文写了,因此,程序中的函数名、变量名都是中文(虽说这样很难看,不过这些是我们写的一个工具只能生成的代码), 既然要自动生成代码,那肯定要先给出配置了,配置文件是很简单的特定格式的txt文件,这样问题就来了,读配置文件,里面有中文,自动生成java文件,里面有中文。然后就出问题了,在windows下面运行自定义的bat文件,程序能运行起来,但把工程放到eclipse下面,又运行不起来,乱码一大堆,最后形成了eclipse下面编码能运行了,双击bat不能运行;如果双击bat能运行,放在eclipse下面又运行不起来,不利于开发人员。

到底是怎么回事? 或想得好好弄清楚。

(1)Java代码默认以unicode存储。但是在操作系统选用一定的开发环境编辑java文件,却使用操作系统默认的编码方式,从而源文件的编码方式与编辑平台相关。在中文windows平台下开发的源文件,将以GB2312方式编码。 如果要将它以utf-8编码,在编译的时候要指它 -encoding GB2312 ,这样,编译后生成的字节文件编码为UTF-8,其中的硬编码信息也以UTF-8格式存储。

(2) 分析下网上的一个例子:(呵呵,实践出真知,还是真正运行下程序才明白怎么回事)

import java.io.FileInputStream;
import java.io.InputStreamReader;
import java.io.BufferedReader;
public class Decode{
public static void main (String []args) throws Exception{
FileInputStream fis=new FileInputStream("./document.txt"); //文件字节流
InputStreamReader isr=new InputStreamReader(fis,"UTF-8");//字节流和字符流的桥梁,可以指定指定字符格式
String str=null;

//直接读取字符,只要编码问题没问题
int c=0;
while((c=isr.read())!=-1)
System.out.print((char)c); [ 1 ]
System.out.println(" first one______________________________________________________");

//将InputStreamReader 封装到缓冲流中,需要字符编码正确

BufferedReader br=new BufferedReader(isr);
str=br.readLine();
while(str!=null)
{
System.out.println(str);
str=br.readLine();
} [ 2 ]
System.out.println(" second one______________________________________________________");

//使用默认编码的InputStreamReader ,当为ANSI的时候没问题,但是读取UTF-8的时候出错。
BufferedReader br2=new BufferedReader(new InputStreamReader(fis));
str=br2.readLine();
while(str!=null)
{
System.out.println(str); [ 3 ]
str=br2.readLine();
}

System.out.println(" third one______________________________________________________");


}

}

Decode.java : ANSI

document.txt : UTF-8(无BOM)

新建txt文档,复制此处代码,保存到txt中,为Decode.java, 可以用nodtpad++看到采用ANSI编码,这里ANSI是和系统的默认字符集相关的,中文winodws下为GB2312, 运 行 javac Decode.java, OK; 然后运行java Decode: 【1】【2】正确输出中文,【3】输出乱码

Decode.java :ANSI

document.txt :ANSI

【1】【2】输出乱码 ,【3】正确输出中文

Decode.java :UTF-8(无BOM) document.txt :utf-8(无bom)

javac Decode.java 有警告,编码的GBK不可映射。 java Decode: 【1】【2】正确输出,【3】输出乱码

Decode.java :UTF-8(无BOM) document.txt:ANSI

javac Decode.java有警告,编码的GBK不可映射 java Decode: 【1】【2】输出乱码,【3】正确输出

从实际运行的结果可以看出,1、当java文件编码为ANSI时,如果要读取的文件采用UTF-8编码,需要指明 new InputStreamReader(fis,"UTF-8"), 这样才能正确读取UTF-8编码的中文,如果不指定,默认的InputStreamReader采用默认的字符集,这时就是ANSI了,无法读出UTF-8编码的文件。但如果要读取的文件和java文件都一样采用默认的编码,刚可以用InputStreamReader的默认字符集。 2、当在Eclipse中为工程指定属性UTF-8后,我们的java源文件会采用UTF-8编码,这时读取的文件如果为ANSI,则采用InputStreamReaderr的默认字符集。 3、到至读放流后,按字节读取,刚需要文件的编码与读入时设定的编码相同。

  • 0
    点赞
  • 1
    收藏
    觉得还不错? 一键收藏
  • 0
    评论

“相关推荐”对你有帮助么?

  • 非常没帮助
  • 没帮助
  • 一般
  • 有帮助
  • 非常有帮助
提交
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值