资源文件及native2ascii应用

最新推荐文章于 2012-10-12 15:40:25 发布

iteye_14323

最新推荐文章于 2012-10-12 15:40:25 发布

阅读量107

点赞数

分类专栏： appfuse 文章标签： AIX IBM DOS Windows JDK

appfuse 专栏收录该内容

19 篇文章 0 订阅

订阅专栏

1，原理

Property 文件中，使用的编码方式根据机器本身的设置可能是GBK或者UTF-8。而在Java程序中读取Property文件的时候使用的是Unicode编码方式，这种编码方式不同会导致中文乱码。因此需要将Property文件中的中文字符转化成Unicode编码方式才能正常显示中文。

2，解决办法

Java提供了专门的工具对Property文件进行Unicode转化，这种工具就是native2ascii，它在JDK安装环境的bin目录下。

native2ascii 工具将带有本机编码字符（非拉丁 1 和非单一码字符）的文件转换成带有Unicode编码字符的文件。

假设需要转化的属性文件为：D:\src\resources.properties（含有中文字符）

转化后的属性文件为：D:\classes\resources.properties（中文字符统一转化为Unicode）

那么使用如下命令
JAVA_HOME\bin\native2ascii -encoding GBK D:\src\resources.properties D:\classes\resources.properties

就能将含有中文字符的属性文件转化成单一Unicode编码方式的属性文件。中文乱码自然会被解决。

背景：在做Java开发的时候，常常会出现一些乱码，或者无法正确识别或读取的文件，比如常见的validator验证用的消息资源（properties）文件就需要进行Unicode重新编码。原因是java默认的编码方式为Unicode，而我们的计算机系统编码常常是GBK等编码。需要将系统的编码转换为java正确识别的编码问题就解决了。

1、native2ascii简介：native2ascii 是sun java sdk提供的一个工具。用来将别的文本类文件（比如*.txt,*.ini,*.properties,*.java等等）编码转为Unicode编码。为什么要进行转码，原因在于程序的国际化。Unicode编码的定义：Unicode（统一码、万国码、单一码）是一种在计算机上使用的字符编码。它为每种语言中的每个字符设定了统一并且唯一的二进制编码，以满足跨语言、跨平台进行文本转换、处理的要求。1990年开始研发，1994年正式公布。随着计算机工作能力的增强，Unicode也在面世以来的十多年里得到普及。（声明：Unicode编码定义来自互联网）。

2、获取native2ascii：安装了jdk后，假如你是在windows上安装，那么在jdk的安装目录下，会有一个bin目录，其中native2ascii.exe正是。

3、native2ascii的命令行的命名格式：
native2ascii -[options] [inputfile [outputfile]]

说明：

-[options]：表示命令开关，有两个选项可供选择
-reverse：将Unicode编码转为本地或者指定编码，不指定编码情况下，将转为本地编码。
-encoding encoding_name：转换为指定编码，encoding_name为编码名称。
[inputfile [outputfile]]
inputfile：表示输入文件全名。
outputfile：输出文件名。如果缺少此参数，将输出到控制台。

4、最佳实践：首先将JDK的bin目录加入系统变量path。在盘下建立一个test目录，在test目录里建立一个zh.txt文件，文件内容为：“熔岩”，打开“命令行提示符”，并进入C:\test目录下。下面就可以按照说明一步一步来操作，注意观察其中编码的变化。

A：将zh.txt转换为Unicode编码，输出文件到u.txt
native2ascii zh.txt u.txt
打开u.txt，内容为“\u7194\u5ca9”。

B：将zh.txt转换为Unicode编码，输出到控制台

C:\test>native2ascii zh.txt
\u7194\u5ca9
可以看到，控制台输出了“\u7194\u5ca9”。

C：将zh.txt转换为ISO8859-1编码，输出文件到i.txt
native2ascii -encoding ISO8859-1 zh.txt i.txt
打开i.txt文件，内容为“\u00c8\u00db\u00d1\u00d2”。

D：将u.txt转换为本地编码，输出到文件u_nv.txt
native2ascii -reverse u.txt u_nv.txt
打开u_nv.txt文件，内容为“熔岩”。

E：将u.txt转换为本地编码，输出到控制台
C:\test>native2ascii -reverse u.txt
熔岩
可以看到，控制台输出了“熔岩”。

F：将i.txt转换为本地编码，输出到i_nv.txt
native2ascii -reverse i.txt i_nv.txt
打开i_nv.txt文件，内容为“\u00c8\u00db\u00d1\u00d2”。发现转码前后完全一样的。也就是说，等于没有转，或者说思想糊涂，对命名没有理解。。

G：将i.txt转换为GBK编码，输出到i_gbk.txt
native2ascii -reverse -encoding GBK i.txt i_gbk.txt
打开i_gbk.txt文件，内容为“\u00c8\u00db\u00d1\u00d2”。发现转码前后完全一样的。也就是说，等于没有转，或者说思想糊涂，对命名没有理解。

H：将u_nv.txt转码到本地编码GBK，输出到控制台
C:\test>native2ascii -reverse -encoding ISO8859-1 i.txt
熔岩
从这个结果看，目标达到到了，编码i.txt为ISO8859-1，转为本地编码后内容为“熔岩”。从这里应该意识到，native2ascii -reverse命令中-encoding指定的编码为源文件的编码格式。而在native2ascii 命令中-encoding指定的编码为（生成的）目标文件的编码格式。这一点非常的重要！切记！！

继续探索，新建文件12a.txt，内容“12axyz”。看看纯字母数字的编码又如何。

I：将纯字母数字的文本文件12a.txt转换为Unicode编码
native2ascii 12a.txt 12a_nv.txt
打开12a_nv.txt文件，内容为“12axyz”。
继续测试，转为ISO8859-1编码看看
C:\test>native2ascii -encoding ISO8859-1 12a.txt
12axyz
结果还是没有转码。
从结果可以得出结论：对于纯数字和字母的文本类型件，转码前后的内容是一样的。

native2ascii - Native-to-ASCII Converter

Converts a file with native-encoded characters (characters which are non-Latin 1 and non-Unicode) to one with Unicode-encoded characters.

SYNOPSIS

native2ascii [options] [inputfile [outputfile]]

DESCRIPTION

The Java compiler and other Java tools can only process files which contain Latin-1 and/or Unicode-encoded (\udddd notation) characters. native2ascii converts files which contain other character encodings into files containing Latin-1 and/or Unicode-encoded charaters.
If outputfile is omitted, standard output is used for output. If, in addition, inputfile is omitted, standard input is used for input.

OPTIONS

-reverse

Perform the reverse operation: convert a file with Latin-1 and/or Unicode encoded characters to one with native-encoded characters.

-encoding encoding_name

Specify the encoding name which is used by the conversion procedure. The default encoding is taken from System property file.encoding. The encoding_name string must be a string taken from the first column of the table below.

-------------------------------------------------------------

Converter        Description                                    
Class 
-------------------------------------------------------------

8859_1           ISO 8859-1          
8859_2           ISO 8859-2                             
8859_3           ISO 8859-3                                 
8859_4           ISO 8859-4                         
8859_5           ISO 8859-5                                    
8859_6           ISO 8859-6                                 
8859_7           ISO 8859-7                                     
8859_8           ISO 8859-8                                   
8859_9           ISO 8859-9                                     
Big5             Big5, Traditional Chinese                    
CNS11643         CNS 11643, Traditional Chinese                 
Cp037            USA, Canada(Bilingual, French), Netherlands,
                               Portugal, Brazil, Australia    
Cp1006           IBM AIX Pakistan (Urdu)                     
Cp1025           IBM Multilingual Cyrillic: Bulgaria, Bosnia,   
                               Herzegovinia, Macedonia(FYR) 
Cp1026           IBM Latin-5, Turkey                        
Cp1046           IBM Open Edition US EBCDIC                 
Cp1097           IBM Iran(Farsi)/Persian                   
Cp1098           IBM Iran(Farsi)/Persian (PC)                
Cp1112           IBM Latvia, Lithuania                        
Cp1122           IBM Estonia                               
Cp1123           IBM Ukraine                               
Cp1124           IBM AIX Ukraine                           
Cp1125           IBM Ukraine (PC)                       
Cp1250           Windows Eastern European          
Cp1251           Windows Cyrillic                    
Cp1252           Windows Latin-1                         
Cp1253           Windows Greek                       
Cp1254           Windows Turkish                   
Cp1255           Windows Hebrew                            
Cp1256           Windows Arabic                               
Cp1257           Windows Baltic                                 
Cp1258           Windows Vietnamese                          
Cp1381           IBM OS/2, DOS People's Republic of China (PRC)  
Cp1383           IBM AIX People's Republic of China (PRC)        
Cp273            IBM Austria, Germany                            
Cp277            IBM Denmark, Norway                            
Cp278            IBM Finland, Sweden                          
Cp280            IBM Italy                                      
Cp284            IBM Catalan/Spain, Spanish Latin America       
Cp285            IBM United Kingdom, Ireland                   
Cp297            IBM France                                  
Cp33722          IBM-eucJP - Japanese (superset of 5050)        
Cp420            IBM Arabic                                    
Cp424            IBM Hebrew                                     
Cp437            MS-DOS United States, Australia, New Zealand,  
                               South Africa 
Cp500            EBCDIC 500V1                                 
Cp737            PC Greek                                     
Cp775            PC Baltic                                
Cp838            IBM Thailand extended SBCS                  
Cp850            MS-DOS Latin-1                           
Cp852            MS-DOS Latin-2
Cp855            IBM Cyrillic
Cp857            IBM Turkish                                  
Cp860            MS-DOS Portuguese                            
Cp861            MS-DOS Icelandic                               
Cp862            PC Hebrew                                    
Cp863            MS-DOS Canadian French                       
Cp864            PC Arabic                                    
Cp865            MS-DOS Nordic                                
Cp866            MS-DOS Russian                               
Cp868            MS-DOS Pakistan                               
Cp869            IBM Modern Greek                             
Cp870            IBM Multilingual Latin-2                      
Cp871            IBM Iceland                                
Cp874            IBM Thai                                    
Cp875            IBM Greek                                      
Cp918            IBM Pakistan(Urdu)                            
Cp921            IBM Latvia, Lithuania (AIX, DOS)                
Cp922            IBM Estonia (AIX, DOS)                        
Cp930            Japanese Katakana-Kanji mixed with 4370 UDC,    
                               superset of 5026 
Cp933            Korean Mixed with 1880 UDC, superset of 5029    
Cp935            Simplified Chinese Host mixed with 1880 UDC,  
                               superset of 5031 
Cp937            Traditional Chinese Host miexed with 6204 UDC,   
                               superset of 5033 
Cp939            Japanese Latin Kanji mixed with 4370 UDC, 
                               superset of 5035 
Cp942            Japanese (OS/2) superset of 932            
Cp948            OS/2 Chinese (Taiwan) superset of 938     
Cp949            PC Korean                         
Cp950            PC Chinese (Hong Kong, Taiwan)       
Cp964            AIX Chinese (Taiwan)                  
Cp970            AIX Korean                    
EUCJIS           JIS, EUC Encoding, Japanese         
GB2312           GB2312, EUC encoding, Simplified Chinese  
GBK              GBK, Simplified Chinese                 
ISO2022CN        ISO 2022 CN, Chinese                         
ISO2022CN_CNS    CNS 11643 in ISO-2022-CN form, T. Chinese   
ISO2022CN_GB     GB 2312 in ISO-2022-CN form, S. Chinese 
ISO2022KR        ISO 2022 KR, Korean                      
JIS              JIS, Japanese                        
JIS0208          JIS 0208, Japanese                    
KOI8_R           KOI8-R, Russian                    
KSC5601          KS C 5601, Korean  
MS874            Windows Thai        
MacArabic        Macintosh Arabic        
MacCentralEurope Macintosh Latin-2     
MacCroatian      Macintosh Croatian   
MacCyrillic      Macintosh Cyrillic       
MacDingbat       Macintosh Dingbat      
MacGreek         Macintosh Greek              
MacHebrew        Macintosh Hebrew          
MacIceland       Macintosh Iceland        
MacRoman         Macintosh Roman     
MacRomania       Macintosh Romania             
MacSymbol        Macintosh Symbol                        
MacThai          Macintosh Thai             
MacTurkish       Macintosh Turkish       
MacUkraine       Macintosh Ukraine      
SJIS             Shift-JIS, Japanese       
UTF8             UTF-8

iteye_14323

关注

0
点赞
踩
0

收藏

觉得还不错? 一键收藏
0
评论
资源文件及native2ascii应用

1，原理 Property 文件中，使用的编码方式根据机器本身的设置可能是GBK或者UTF-8。而在Java程序中读取Property文件的时候使用的是Unicode编码方式，这种编码方式不同会导致中文乱码。因此需要将Property文件中的中文字符转化成Unicode编码方式才能正常显示中文。 2，解决办法 Java提供了专门的工具对Property文件进行Unicode转化...
复制链接

扫一扫