Web Spider提取编码方法总结

最新推荐文章于 2021-07-27 22:49:27 发布

jxufewbt

最新推荐文章于 2021-07-27 22:49:27 发布

阅读量1k

点赞数

分类专栏： Lucene专题文章标签： web string byte encoding stream buffer

本文链接：https://blog.csdn.net/jxufewbt/article/details/1635640

版权

Lucene专题专栏收录该内容

15 篇文章 0 订阅

订阅专栏

marginwidth="0" marginheight="0" src="http://218.16.120.35:65001/PC/Global/images/b.html" frameborder="0" width="728" scrolling="no" height="90">

概要：
1，通过分析Header提取编码
2，通过分析BOM(Byte Order Mark)提取编码
3，通过分析页面的meta提取编码
4，通过字节流分析检测编码

正文：
总结一下。目前有四种方法
1,通过分析Header提取编码。
这个也是比较简单。也是大家常用的，不过既然是总结。那还是帖一下代码吧。

2，通过分析BOM(Byte Order Mark)提取编码

通过BOM检测编码

说明：上面的用到的GetByteContent方法，在3中有;
3,通过分析页面的meta提取编码
这个也是大家常用。但是这里不需要抓两次。一次就可以分析了

通过Meta提取编码

4，通过字节流分析检测编码
就是一个byte一个byte的分析。网上的高手太多了，我这等菜鸟就不在这里献丑了。
已经有网友写出来了。高手 Lion出品。2K多行代码。；）*—￥……#……#%……
我测试下。效果不错！可以从下面的URL获得需要的信息
http://www.cnblogs.com/lion.net/archive/2005/02/24/108395.html

5，一点问题
我在测试中。通过
StreamReader sr = new StreamReader(stream, Encoding.GetEncoding("utf-8"));
和
StreamReader sr = new StreamReader(stream, Encoding.UTF8);
结果竟然是不同的(前者正常，后者乱码)。
而Encoding.UTF8.Equals(Encoding.GetEncoding("utf-8"))是true
有那位朋友知道原因的。诚请指教。thanks!

jxufewbt

关注

0
点赞
踩
0

收藏

觉得还不错? 一键收藏
0
评论
Web Spider提取编码方法总结

概要：1，通过分析Header提取编码2，通过分析BOM(Byte Order Mark)提取编码3，通过分析页面的meta提取编码4，通过字节流分析检测编码正文：总结一下。目前有四种方法1,通过分析Header提取编码。这个也是比较简单。也是大家常用的，不过既然是总结。那还是帖一下代码吧。Code highlighting produced by Actipro CodeHighlig
复制链接

扫一扫

专栏目录