java bom 文件读取_Java处理文件BOM头的方式推荐

最新推荐文章于 2021-07-20 15:49:39 发布

weixin_39832643

最新推荐文章于 2021-07-20 15:49:39 发布

阅读量583

点赞数 1

文章标签： java bom 文件读取

版权声明：本文为博主原创文章，遵循 CC 4.0 BY-SA 版权协议，转载请附上原文出处链接和本声明。

本文链接：https://blog.csdn.net/weixin_39832643/article/details/114141569

版权

背景：

java普通的文件读取方式对于bom是无法正常识别的。

使用普通的InputStreamReader，如果采用的编码正确，那么可以获得正确的字符，但bom仍然附带在结果中，很容易导致数据处理出错。

另外，对于存在BOM头的文件，无法猜测它使用的编码。

目标：

实现一种方式，可对BOM头进行捕捉和过滤

解决方案有二：

一、使用apache的工具类，以BOMStream为例：

该类的构造方式：

BOMInputStream bomIn = new BOMInputStream(in) //仅能检测到UTF8的bom，且在流中exclude掉bom

BOMInputStream bomIn = new BOMInputStream(in, include); //同上，且指定是否包含

也可以指定检测多种编码的bom，但目前仅支持UTF-8/UTF-16LE/UTF-16BE三种，对于UTF32之类不支持。

BOMInputStream bomIn = new BOMInputStream(in, ByteOrderMark.UTF_16LE, ByteOrderMark.UTF_16BE);

有用的方法：

bomIn.hasBOM()、hasBOM(ByteOrderMask.**)可用于判断当前流中是否检测到了bom。

读取文件示例：

FileInputStream fis = newFileInputStream(file);//可检测多种类型，并剔除bom

BOMInputStream bomIn = new BOMInputStream(in, false,ByteOrderMark.UTF-8, ByteOrderMark.UTF_16LE, ByteOrderMark.UTF_16BE);

String charset= "utf-8";//若检测到bom，则使用bom对应的编码

if(bomIn.hasBOM()){

charset=bomIn.bs.getBOMCharsetName();

}

InputStreamReader reader= newInputStreamReader(bomIn, charset);

...

二、使用一个更强大点的工具类(可以支持UTF-8/UTF-16LE/UTF-16BE/UTF-32LE/UTF-32BE)：

以UnicodeReader为例：

FileInputStream fis = newFileInputStream(file);

UnicodeReader ur= new UnicodeReader(fis, "utf-8");

BufferedReader br= newBufferedReader(ur);

...

相较于Apache的工具类，这里的UnicodeReader 支持更多的BOM编码。

源码解读：

UnicodeReader 通过PushbackInputStream+InputStreamReader实现BOM的自动检测和过滤读取；

当没有检测到BOM时，pushback流将回退，并采用构造函数传入的编码进行读取。

否则使用BOM对应的编码进行读取。

相对来说，第二种方式更加轻量和强大；另外也更加透明，可以随便修改源码来实现自己的需求。

weixin_39832643

关注

1
点赞
踩
2

收藏

觉得还不错? 一键收藏
0
评论
复制链接

分享到 QQ

分享到新浪微博

扫一扫

评论

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。