数据挖掘 | 零代码采集房源数据,支持自动翻页、数据排重等

1 前言

城市规划、商业选址等应用场景中经常会对地区房价、地域价值进行数据分析,其中地区楼盘房价是分析数据中重要的信息参考点,一些互联网网站上汇聚了大量房源信息,通过收集此类数据,能够对地区房价的分析提供参考依据。

如何收集此类数据呢,互联网上提供了众多工具或代码,然后对于普通用户均有较高的使用门槛,并且需要调试用户体验不太理想,工作量也较大。

下面以目标网址为例:

上海楼盘网,上海新房一手房,上海房产网信息网,新开楼盘在售上海楼盘信息 - 安居客

为解决此类用户需求痛点,本着“所见所得”的设计理念,小O历时半年时间,重新对小O网兜软件进行重构,摈弃原有的使用思路,提升软件功能的同时,更加提升软件应用的灵活性,力求为用户提供更加实用的网页信息收集软件,这个过程中,反复测试,适配多种类型网页,面对及其复杂的网页内容结构,反复修改功能,再多次自我使用、测试、颠覆的状态中,终于发布新版本 0231,功能上超越之前版本,更加灵活可配置。

复杂功能和易用性有时难两全,软件在使用操作方面仍然有一定的门槛,好在软件也提供了数据模板功能,通过下载配置好的模板,用户可以跳过配置直接启动采集(不断扩充模板...),希望新版能够满足您数据采集上的需求,助力提升工作效率。

下文将以采集二手房源信息为例,带领大家感受软件功能。

本文操作流程概览

2 操作步骤

下载软件

登录官网 www.gis9.com ,首页往下滚动,下载【小O网兜】。

软件无需安装,下载后直接运行,可能会被防火墙或者软件管家之类的软件拦截,请将软件添加到信任列表里。

软件启动后进入主界面如图,请注册登录后使用软件。

新建任务

点击软件左上方网格球图标,打开任务向导窗口,可以新建和打开xop扩展名的任务文件。

当然,也可以直接从模板库中下载模板。

注意:任务文件保存着采集目标网页、采集的数据等信息,请妥善保存好。

本例子选择新建采集任务,设置任务文件保存目录,软件打开空的任务界面。如下图

打开目标网址,并新建采集规则,自动创建一组采集动作。

配置任务

依次配置每个动作的参数

【打开页面】

-- 该动作是让浏览器打开目标网址。

切换至动作参数,将当前网址复制到网址集合参数项里。如下图,点击批量生成后,会在列表页中新增网址记录。

【扫描页面】

-- 自动扫描页面所有元素,此动作无需配置。

如果目标页面带有向下滚动加载数据,可将超时参数设置大些,以便让程序自动将页面向下滚动,加载更多数据。

  • 滚动幅度:控制页面向下滚动的速度,值越大则越快。
  • 运行超时:控制页面滚动时长,可适当调大。

【读取数据】

-- 该动作从页面读取数据并保存至表格中。

  • (一) 点击【数据表】,弹出界面配置,新建存储表,默认会有一个表存储数据。如有需求,可以新建新表存储数据。

  • (二) 在读取数据Tab页中,点击数据块 / 新建菜单,新建读取数据块,如下图依次选择保存字段。对照页面设置需要采集的字段。

  • (三) 配置字段采集的数据,如下图,依次点击,使用[选择元素],在页面上右键选中目标元素,定位到[网页树]节点,在节点右键菜单,选[设置字段目标元素],设置目标元素至选中的字段。

  • (四) 选中[读数据块1],上图中 1 位置,需设置读取数据块和数据行。

  • (五) 点击字段,在页面下方有取值预览,调整参数获得想要的数据结果。
  • -- 设置参数[目标元素],在网页树选中节点,右键菜单,设置目标元素。
  • -- 设置取值参数,对值进行处理,预览值显示在下方。

  • (六) 点击表格,在页面下方能预览所有表格数据,页面中数据正确预览在表格中。

【翻页动作】

-- 设置翻页动作,执行后页面会自动翻页,提供多种方式翻页

查找和设置目标元素设置同上

设置翻页页码

  1. 点下一页按钮:设置下一页翻页,设置下一页目标元素,每次模拟翻页,可设置翻页执行次数。
  2. 逐个页码:设置页码翻页,设置翻页元素和页码,在页码中找到元素后执行翻页。

设置完成后, 可点击动作鼠标右键,单步执行该动作,验证页码是否翻页。

至此所有动作均配置完成。

执行任务

可挨个动作点击右键,执行单步,逐一执行动作。

也可以点击执行(循环),循环执行多有动作。下图,程序会进行运行直到结束。

异常情况,运行期间可能会出现异常情况,

1、 网页反扒,需要人工点击,此时可能会导致动作执行失效,人工点击验证后,再从任务点击右键继续循环执行。

2、 目标元素为找到,导致无法翻页。

导出数据

执行完毕后,打开【数据表】窗口,对采集数据进行处理后,导出CSV文件,可应用再其他软件中。

导出前,可对数据进行简单处理

--- 删除重复记录:选择 页码URL和标题作为唯一值进行排重

--- 导出数据:将表格数据导出CSV文件,可在EXCEL软件中打开表格。

到此就是小O网兜复制网页信息的全过程,感兴趣的朋友可登陆官网下载软件。

3 小结

小O网兜除了提供模板任务供用户直接下载并采集数据,也提供自定义配置功能,由用户自助式实现采集流程。本文以房源数据为例,介绍采集房源数据的操作流程,通过本文用户能够掌握房源数据采集任务的配置过程,满足中介、科研机构、高校研究等用户自定义采集需求。小O网兜提供开放式、可视化、配置化的采集功能,能够采集绝大多数网页的列表数据和自动翻页操作,实现无人留守自动采集。

后续作者还将继续对标其他优秀同类软件,新增更多操作简便、实用、易用的软件功能。

  • 0
    点赞
  • 0
    收藏
    觉得还不错? 一键收藏
  • 0
    评论

“相关推荐”对你有帮助么?

  • 非常没帮助
  • 没帮助
  • 一般
  • 有帮助
  • 非常有帮助
提交
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值