一)需求
很多情况下我们需要知道字节流的编码,比如
1) 使用编辑器打开文本文件的时候,编辑器需要识别文本文件的各种编码
2) 上传文件后,分析上传文件字节流需要知道它的编码
二)探讨
不过C#目前还没有现成的函数能够获取,经过和同事的探讨,发现UTF8文件都有一个3字节的头,为“EF BB BF”(称为BOM--Byte Order Mark),判断这个头信息不就可以解决了吗?代码如下:
//判断上传的文件的编码是否是UTF8,buff为上传文件的字节流
enc = Encoding.UTF8;
testencbuff = enc.GetPreamble();
if(fileLength>testencbuff.Length && testencbuff[0] == buff[0] && testencbuff[1]==buff[1] && testencbuff[2]==buff[2])
{
// 是 UTF8编码
string buffString = enc.GetString(buff);
}
不过后来发现,不是所有的UTF8编码的文件都有BOM信息,那如何解决呢?
三)最终的方案
没有BOM信息只有通过逐个字节比较的方式才能解决。幸好已经有人解决这个问题了。推荐大家看:
http://de