技术博客-集搜客爬虫

集搜客网络爬虫

本周对集搜客爬虫软件进行了学习与运用。先是摸清软件的用法与功能,之后对Anmazon网站进行数据采集的实践。

采集列表数据

采集列表时,可以看到多条结构相同的信息,我们把一条信息称为一个样例,例如,表格中的每一行就是一个样例,又如,百度搜索结果中的每个结果也是一个样例。具有两个样例以上的网页,做样例复制映射就能把整个列表都采集下来。进入Amazon主页后,有类似表格一样的商品陈列,此页的每一个商品都是一个样例。我们初步目标就是爬取每一个商品的名字以及价格。

目标网址:
https://www.amazon.co.uk/Best-Sellers-Kitchen-Home/zgbs/kitchen/ref=zg_bs_nav_0

打开GS爬虫浏览器,输入网址并Enter,加载出网页后再点击“定义规则”按钮,可以看到一个浮窗显示出来,称为工作台,在上面定义规则;在工作台中输入主题名,可以点击“查重”看看名字是否被占用。
在浏览器窗口双击要采集的内容在点击的时候下方会有内容所对应的节点,在弹出小窗中输入标签名,打勾确认或Enter,即完成了一个标注操作。首次标注还要输入整理箱名称。这也是标签与网页信息建立映射关系的过程。

   主题名是指采集数据的行动名称
   整理箱名则是你在网页上爬取样例的总称。

样例复制

设置完成后点击测试,只有进行标注的商品信息被爬取而我们的目的是所有商品。规则不够完善,软件无法继续爬取。功能运用样例复制。网页的商品格式一致,我们需要设置出样例复制的“第一个”与“第二个”。软件就能在网页爬取多个同类型样例。
举例:我们爬取一个商品的名字与价格,同样第二个商品也是需要同样的信息,我们将第一个商品的名字设置为样例复制“第一个”将第二个商品的名字设置为样例复制“第二个”。第一个商品与第二个商品会被红蓝色的框标记,证明设置成功。打开测试可以看到 本网页所有同样式的样例都被爬取。
此时我们的目标还没有完成,因为我们只是爬取了第一页的商品信息。后续页码的商品都没有爬取。思考,这时需要给规则设立翻页功能。才能爬取后续页面的样例信息。

翻页采集

翻页区与翻页标记:我们平时浏览的购物网站商品种类繁多一个页面是装不下的,在下方就会有页码数。多出的商品就会在后续的页码中。下面的页码就是翻页区,页数后的“下一页”就是翻页标记。
我们将网页拉至底部看到页码数与下一页,点击将整个页码与下一页进行标记,找到下面的节点右键设置为翻页区。思考有了翻页区是不是大功告成?错!软件还没有只能到这一步。我们需要给它一个记号,翻页标记。我们除了点击页码切换到下一页,我们还可以只点击“下一页”也能完成换页。这个下一页就是我们的翻页标记,设置完后程序运行到底部碰到翻页区的翻页标记就会继续往下进行。

总结

爬虫的关键在与规则的设定,不仅要对同类型的样例进行样例复制的操作,还要对爬取过程遇到的阻碍进行攻克例如翻页。。等。爬虫的数据量一般很大,我们不会在爬取过程去看每条样例,既费时又费力。所以这需要我们更谨慎的去设立规则,去保证其数据完整性。

  • 1
    点赞
  • 3
    收藏
    觉得还不错? 一键收藏
  • 0
    评论
提供的源码资源涵盖了Java应用等多个领域,每个领域都包含了丰富的实例和项目。这些源码都是基于各自平台的最新技术和标准编写,确保了在对应环境下能够无缝运行。同时,源码中配备了详细的注释和文档,帮助用户快速理解代码结构和实现逻辑。 适用人群: 适合毕业设计、课程设计作业。这些源码资源特别适合大学生群体。无论你是计算机相关专业的学生,还是对其他领域编程感兴趣的学生,这些资源都能为你提供宝贵的学习和实践机会。通过学习和运行这些源码,你可以掌握各平台开发的基础知识,提升编程能力和项目实战经验。 使用场景及目标: 在学习阶段,你可以利用这些源码资源进行课程实践、课外项目或毕业设计。通过分析和运行源码,你将深入了解各平台开发的技术细节和最佳实践,逐步培养起自己的项目开发和问题解决能力。此外,在求职或创业过程中,具备跨平台开发能力的大学生将更具竞争力。 其他说明: 为了确保源码资源的可运行性和易用性,特别注意了以下几点:首先,每份源码都提供了详细的运行环境和依赖说明,确保用户能够轻松搭建起开发环境;其次,源码中的注释和文档都非常完善,方便用户快速上手和理解代码;最后,我会定期更新这些源码资源,以适应各平台技术的最新发展和市场需求。 所有源码均经过严格测试,可以直接运行,可以放心下载使用。有任何使用问题欢迎随时与博主沟通,第一时间进行解答!

“相关推荐”对你有帮助么?

  • 非常没帮助
  • 没帮助
  • 一般
  • 有帮助
  • 非常有帮助
提交
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值