字节流编码获取原来这么复杂

最新推荐文章于 2024-03-20 15:55:51 发布

xjbclz

最新推荐文章于 2024-03-20 15:55:51 发布

阅读量1.7k

点赞数

分类专栏： C/C++

C/C++ 专栏收录该内容

134 篇文章 5 订阅 ¥9.90 ¥99.00

订阅专栏

超级会员免费看

本文探讨了在C#中如何确定字节流的编码，特别是针对UTF8编码是否带有BOM的问题。通过检查字节流的前三个字节来判断是否为UTF8带BOM编码，但并非所有UTF8文件都有BOM。当遇到无BOM的UTF8文件时，提出了通过逐个字节比较的解决方案，并引用了相关资源进行详细阐述。

摘要由CSDN通过智能技术生成

一）需求
很多情况下我们需要知道字节流的编码，比如
1) 使用编辑器打开文本文件的时候，编辑器需要识别文本文件的各种编码
2) 上传文件后，分析上传文件字节流需要知道它的编码

二）探讨
不过C#目前还没有现成的函数能够获取，经过和同事的探讨，发现UTF8文件都有一个3字节的头，为“EF BB BF”(称为BOM--Byte Order Mark)，判断这个头信息不就可以解决了吗？代码如下：

//判断上传的文件的编码是否是UTF8，buff为上传文件的字节流
    enc     = Encoding.UTF8;
    testencbuff   = enc.GetPreamble();
    if(fileLength>testencbuff.Length && testencbuff[0] == buff[0] && testencbuff[1]==buff[1] && testencbuff[2]==buff[2])
    {
        // 是 UTF8编码
        string buffString = enc.GetString(buff);
    }
不过后来发现，不是所有的UTF8编码的文件都有BOM信息，那如何解决呢？

三）最终的方案
没有BOM信息只有通过逐个字节比较的方式才能解决。幸好已经有人解决这个问题了。推荐大家看：
http://dev.csdn.net/Develop/article/10/10961.shtm
http://dev.csdn.net/Develop/article/10/10962.shtm
这里判断所有的编码，基本上都是通过字节比较的方式。java代码很容易移植到.NET上，下面是UTF8判断部分的C#代码：

int utf8_probability(byte[] rawtext)
{
   int score = 0;
   int i, rawtextlen = 0;
   int goodbytes = 0, asciibytes = 0;

// Maybe also use UTF8 Byte Order Mark: EF BB BF

   // Check to see if characters fit into acceptable ranges
   rawtextlen = rawtext.Length;
   for (i = 0; i < rawtextlen; i++)
   {
    if ((rawtext[i] & (byte)0x7F) == rawtext[i])
    { // _disibledevent="http://dev.csdn.net/Develop/article/10/article/10/10961.shtm">http://dev.csdn.net/Develop/article/10/article/10/10961.shtm
Hello Unicode ——JAVA的中文处理学习笔记
http://www.chedong.com/tech/hello_unicode.html

出处：http://blog.csdn.net/zdg/archive/2005/01/29/272643.aspx