垂直爬虫的代码实现比较简单,主要是两方面:
1. 限定url,一般是通过正则匹配
2.限定内容,比如列表页面只要抓取详细页面的url,详细页面只要抓取特定内容,一般都是用css 选择器或者xpath的库取匹配内容
垂直爬虫的技术难点没有全网爬出那么多,主要要解决的是反爬的问题.
针对性的做几个项目的垂直爬虫,你就慢慢形成了你自己的垂直爬虫框架,有了自己的任务管理,数据集存储,基本的数据处理器,实现了一些通用的采集器,这样有新需求的时候就比较简单了,对于垂直采集来说就是设置设置URL规则,写些解析页面的脚本代码.
作者:吴亮弟
链接:https://www.zhihu.com/question/39012828/answer/79334790
来源:知乎
著作权归作者所有。商业转载请联系作者获得授权,非商业转载请注明出处。