Java处理文件BOM头的方式推荐

最新推荐文章于 2022-10-23 21:24:12 发布

liuzx32

最新推荐文章于 2022-10-23 21:24:12 发布

阅读量2.7k

点赞数

HTML 同时被 3 个专栏收录

29 篇文章 0 订阅

订阅专栏

DOM

4 篇文章 0 订阅

订阅专栏

BOM

3 篇文章 0 订阅

订阅专栏

背景：

java普通的文件读取方式对于bom是无法正常识别的。使用普通的InputStreamReader，如果采用的编码正确，那么可以获得正确的字符，但bom仍然附带在结果中，很容易导致数据处理出错。另外，对于存在BOM头的文件，无法猜测它使用的编码。

目标：实现一种方式，可对BOM头进行捕捉和过滤

方案一、使用apache的工具类，以BOMStream为例：

BOMStream，api参考：http://commons.apache.org/io/apidocs/org/apache/commons/io/input/BOMInputStream.html

该类的构造方式：
BOMInputStream bomIn = new BOMInputStream(in) ; //仅能检测到UTF8的bom，且在流中exclude掉bom
BOMInputStream bomIn = new BOMInputStream(in, include); //同上，且指定是否包含bom
# 也可以指定检测多种编码的bom，但目前仅支持UTF-8/UTF-16LE/UTF-16BE三种，对于UTF32之类不支持。
BOMInputStream bomIn = new BOMInputStream(in, ByteOrderMark.UTF_16LE, ByteOrderMark.UTF_16BE);
# 有用的方法：
bomIn.hasBOM()、hasBOM(ByteOrderMask.**)可用于判断当前流中是否检测到了bom。
#读取文件示例：

[java]view plaincopy 
   
 FileInputStream fis = new FileInputStream(file);  
   //可检测多种类型，并剔除bom  
   BOMInputStream bomIn = new BOMInputStream(in, false,ByteOrderMark.UTF-8, ByteOrderMark.UTF_16LE, ByteOrderMark.UTF_16BE);  
   String charset = "utf-8";  
   //若检测到bom，则使用bom对应的编码  
   if(bomIn.hasBOM()){  
      charset = bomIn.bs.getBOMCharsetName();  
   }  
   InputStreamReader reader = new InputStreamReader(bomIn, charset);  
   ...  

方案二、使用一个更强大点的工具类（可以支持UTF-8/UTF-16LE/UTF-16BE/UTF-32LE/UTF-32BE）：

参考地址：http://koti.mbnet.fi/akini/java/unicodereader/，下载其中两个文件：UnicodeStream和UnicodeReader

以UnicodeReader为例：

[java]view plaincopy 
   
 FileInputStream fis = new FileInputStream(file);  
 UnicodeReader ur = new UnicodeReader(fis, "utf-8");  
 BufferedReader br = new BufferedReader(ur);  
 ...