(转)获取HTML页面内容后格式化显示的办法

29 篇文章 0 订阅
17 篇文章 0 订阅

获取html页面内容的方法有很多了,一般都是连接上以后取得页面的内容,然后进行分析。一般用JDK里面提供的  URL和URLConnection 类,就可以实现;当然,也可以用其他工具来实现,比如 httpunit(用这个有时候会有问题,如果页面里面有反盗链的设置或者其他一些有问题的代码,很可能就连接不上了)。 如果单纯只是想得到页面的内容,用JDK里面提供的类就足够。

得到了页面内容以后,怎么显示在我们自己的页面上面呢?特别是要显示在TEXTAREA这样的区域里面就会有点点麻烦。

因为我们获得的内容里面有html标记和javascript标记,或者css标记。

如果直接把这些内容打印出来,或者直接放到TEXTAREA里面,就会报错。。怎么来解决?

一般大家都会想到用字符串来替换,比如 把"<"替换成"[" 等等,或者用正则表达式,来过滤这些标记。

其实有一直很简单方法,就是把得到的页面内容放在<div></div>中间,例如:

<div id="content" style="display:none;">
.........
</div>

然后用javascript来取content,

function show()
{
 form1.content.value = document.getElementById("content").innerText;
}

这样就自动过滤了那些烦人的标记了哦!!

 

  • 0
    点赞
  • 0
    收藏
    觉得还不错? 一键收藏
  • 0
    评论

“相关推荐”对你有帮助么?

  • 非常没帮助
  • 没帮助
  • 一般
  • 有帮助
  • 非常有帮助
提交
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值