perl 处理HTML

perlhtml

1 perl代码中的web处理

1.1 常用模块

Mojo::UserAgent WWW::Mechanize anyevent::http LWP

1.2 基本过程

扒站最基本的:经过一个网页,把页面上的链接都解析出来放到一个数组里,把页面 上的表单解析出来放到一个散列里,并且hidden字段自动填好,你只需填剩下的字段。 下面,把我用到的最基本的东西总结在下面:

1.3 获取并解析网页

使用LWP::Simple模块的get方法下载网页

然后使用HTML::FormatText创建新的格式器

格式器只能处理已解析的HTML,所以我们使用HTML::TreeBuilder解析HTML

已经解析的HTML位于$treebuilder对象中,所以在这个对象上使formatter 对象的format方法,把网页的格式设置为普通文本,并输出。

 1:  use LWP::Simple;
 2:  use HTML::Treebuilder;
 3:  use HTML::FormatText;
 4:  
 5:  $html = get("http://www.cpan.org/");  
 6:  $formatter = HTML::FormatText->new;
 7:  $tree_builder =HTML::TreeBuilder->new;
 8:  $tree_builder->parse($html);
 9:  $text = $formatter->format($tree_builder);
10:  print $text;

上面的方法是perl技术内幕中提到的方法。

Date: 2013-05-12 16:44:00 CST

Author: gaorongchao

Org version 7.8.11 with Emacs version 24

Validate XHTML 1.0
  • 1
    点赞
  • 0
    收藏
    觉得还不错? 一键收藏
  • 0
    评论

“相关推荐”对你有帮助么?

  • 非常没帮助
  • 没帮助
  • 一般
  • 有帮助
  • 非常有帮助
提交
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值