数据抓取问题之URL特殊字符（如ѐ）

最新推荐文章于 2020-12-29 23:14:56 发布

东东东雷

最新推荐文章于 2020-12-29 23:14:56 发布

阅读量778

点赞数

分类专栏：抓取文章标签：搜索

本文链接：https://blog.csdn.net/u011845742/article/details/43017217

版权

抓取专栏收录该内容

0 篇文章 0 订阅

订阅专栏

在信息化时代飞速发展的时候，大数据，搜索等也全面发展，网络爬虫已是遍地都是，但是数据抓取也会在处理上需要注意的。

下面描述以下问题：

当抓取的URL里出现特殊的字符，如非ASCII的法文：ѐ ，你会发现程序界面会出现错误：

可是当你在你的浏览器里直接输入这个URL时确实可以访问的！！！

是什么情况呢？怎么解决呢？

答案是程序解码时把 ѐ 解错了……当然找不到界面了。

1、首先想到的是把 ѐ 直接转码替换，可是当你用统一编码 UTF-8时注意了，这只能对单独的这一个字符的解决办法。

比如你先编码 ѐ 为 %D1%90 然后替换当然可以成功的……

URL url = new URL(url.replace("ѐ","%D1%90"));

2、其实还有另一种解决办法的：

就是无论有没有特殊字符我们都进行统一编码。但是也有一个问题的，那就是不能把 “/” "//" 也进行编码。

那就只对后面的子URL进行编码.

String Surl = "/xxxx/caffѐ";                                                       //把 URL 分开处理 保护好"//"
Surl = URLEncoder.encode(Surl.replace("/"," "), "utf-8");                         //保护 "/" 
Surl = Surl.replace("+","/");
Url url = new URL("http://www.aaa.com"+Surl);			                   //拼成完整的URL
BufferedReader br = new BufferedReader(new InputStreamReader(Murl.openStream()));  //接下来自己的操作
if(br.readLine()!=null){
    …………
}

这样我觉得我的URL 里的问题就解决了。

有问题欢迎讨论……