抓取网页内容空格变成?的解决办法

网页里面的空格是 转义过的。 抓下来出现了乱码"????",所以要单独对 处理。不然会变成?,虽然肉眼看见的是空格。

解决办法有以下几种:

1.因为????的ascii码是63,对应的二进制是111111,然后空格的ascii是32,对应的二进制是100000,先进行右移操作在+1得到byte,值为32,即空格的ascii码,

 

然后直接转成char就得到了空格,右移运算也可以直接改为&运算,即为by = (byte) (by & 100000);

注意:原有的?号也会被转成空格。

public static String changeStr(String s) {

    StringBuffer sb = new StringBuffer(1024);

    if(s == null)

        return "";

    byte[] b = s.getBytes();

    for (byte by : b) {

        if (by == 63) //是?才转

            by = (byte) (by & 100000);//by = (byte) ((by >> 1) + 1);

        sb.append((char)by);

    }

    return sb.toString();

}

 

2.把那个字符拷贝,用java的replace方法替换掉就可以了。

3.String dsp= 抓取的内容;

dsp = new String(dsp.getBytes(),"GBK").replace('?', ' ').replace(' ', ' ');//前面这个是全角空格

System.out.println(dsp);(中文会变成乱码)

4.因为HttpResponse输出的时候,getWriter的print方法使用了系统默认的编码方式,把格式又搞坏了。只要把response编码设置setCharacterEncoding()为目标页面的编码就可以了。(未测试)

  • 0
    点赞
  • 0
    收藏
    觉得还不错? 一键收藏
  • 0
    评论

“相关推荐”对你有帮助么?

  • 非常没帮助
  • 没帮助
  • 一般
  • 有帮助
  • 非常有帮助
提交
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值