本人大三真皮沙发又来了,继上次写了一个爬取捞月狗直播的爬虫后,笔者觉得自己有必要写一个原创的爬虫小框架。可是大家都知道,一个成熟的框架是十分困难的,所以笔者就尝试了不同的数据的抓取方法。在不同的方法中,找到最方便最快捷的爬虫方式。
在上次的爬虫中,抓取的数据主要用到的是第三方的Beautifulsoup库,然后对每一个具体的数据在网页中的selecter来找到它,每一个类别便有一个select方法。对网页有过接触的都知道很多有用的数据都放在一个共同的父节点上,只是其子节点不同。在上次爬虫中,每一类数据都要从其父类(包括其父节点的父节点)上往下寻找ROI数据所在的子节点,这样就会使爬虫很臃肿,因为很多数据有相同的父节点,每次都要重复的找到这个父节点。这样的爬虫效率很低。
因此,笔者在上次的基础上,改进了一下爬取的策略,笔者以实例来描述。
</