百度百科爬虫PHP

最近用PHP实现了一个简单的爬虫程序,爬的是百度百科,但是只可以爬一些词条,不能爬全部的.

<?php
header("Content-type: text/html; charset=utf-8"); 
//接受前台数据
$data_id=$_POST['data_id'];
$url="http://baike.baidu.com/item/".$data_id;
//var_dump($url);
$ch = curl_init();
curl_setopt($ch, CURLOPT_URL,$url);
curl_setopt($ch, CURLOPT_RETURNTRANSFER, TRUE);
$html = curl_exec($ch);
curl_close($ch);
//var_dump($html);
//匹配指定div中间的内容
$isMatched = preg_match('/<div class="para" label-module="para">(.*?)<\/div>/', $html, $matches);
//var_dump($isMatched, $matches);
//去除所有HTML标签
$data=preg_replace('{<(S*?)[^>]*>.*?|<.*? />}','',$matches);
//echo isset($data[0])?$data[0]:'未搜索到...';
$string=implode('',$matches);//数组转化为字符串 ''表示以此为胶合符
//var_dump($string);
$result=strip_tags($string);//字符串操作函数 去除HTML和PHP标签 
echo $result;
?>
其实主要就是会用php的curl函数,得到页面,然后用正则表达式和字符串函数匹配出你想要的内容。

在此,本人去学习了正则表达式基本内容后才成功的做出来,粘出来的是后台处理,前台页面就不展示了

  • 1
    点赞
  • 2
    收藏
    觉得还不错? 一键收藏
  • 0
    评论

“相关推荐”对你有帮助么?

  • 非常没帮助
  • 没帮助
  • 一般
  • 有帮助
  • 非常有帮助
提交
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值