php抓取html元素内容采集网页

最新推荐文章于 2023-05-17 00:13:48 发布

乾坤借码

最新推荐文章于 2023-05-17 00:13:48 发布

阅读量1.7k

点赞数 1

分类专栏：笔记文章标签：爬虫 php jquery

原文链接：https://download.csdn.net/download/lthaha/7936029?spm=1001.2101.3001.5697

版权

笔记专栏收录该内容

2 篇文章 0 订阅

订阅专栏

网页抓取就像搜索引擎一个可以去自动抓取其它服务器上的内容了,下面我整理的几个php常用做法,大家一起来看看.

抓取某一个网页中的内容,需要对DOM树进行解析,找到指定节点后,再抓取我们需要的内容,过程有点繁琐,LZ总结了几种常用的、易于实现的网页抓取方式,如果熟悉JQuery选择器,这几种框架会相当简单.

一、Ganon

项目地址:http://code.google.com/p/ganon/

文档:http://code.google.com/p/ganon/w/list

测试:抓取我的网站首页所有class属性值是focus的div元素,并且输出class值class, "

n";

}

二、phpQuery

项目地址:http://code.google.com/p/phpquery/

文档:https://code.google.com/p/phpquery/wiki/Manual

测试:抓取我网站首页的article标签元素，然后出书其下h2标签的html值find(‘h2’)->html()."

}

三、Simple-Html-Dom

项目地址:http://simplehtmldom.sourceforge.net/

文档:http://simplehtmldom.sourceforge.net/manual.htm

测试:抓取我网站首页的所有链接find(‘img’) as $element)

// echo $element->src . ‘’;

//找到所有链接

foreach($html->find(‘a’) as $element)

echo $element->href . ‘’;

四、Snoopy

项目地址:http://code.google.com/p/phpquery/

文档:http://code.google.com/p/phpquery/wiki/Manual

测试:抓取我的网站首页

fetch($url); //获取所有内容
echo $snoopy->results; //显示结果

// echo $snoopy->fetchtext ;//获取文本内容(去掉html代码)

// echo $snoopy->fetchlinks($url) ;//获取链接

// $snoopy->fetchform ;//获取表单

五、手动编写爬虫

如果编写能力ok,可以手写一个网页爬虫,实现网页抓取,网上有千篇一律的介绍此方法的文章,LZ就不赘述了,有兴趣了解的,可以百度 php 网页抓取.

本文地址：

相关资源: php抓取html元素内容采集网页

乾坤借码

关注

1
点赞
踩
0

收藏

觉得还不错? 一键收藏
0
评论
php抓取html元素内容采集网页

网页抓取就像搜索引擎一个可以去自动抓取其它服务器上的内容了,下面我整理的几个php常用做法,大家一起来看看.抓取某一个网页中的内容,需要对DOM树进行解析,找到指定节点后,再抓取我们需要的内容,过程有点繁琐,LZ总结了几种常用的、易于实现的网页抓取方式,如果熟悉JQuery选择器,这几种框架会相当简单.一、Ganon项目地址:http://code.google.com/p/ganon/文档:http://code.google.com/p/ganon/w/list测试:抓取我的网站首页所有cla
复制链接

扫一扫