简易数据分析
卤蛋实验室
公众号@卤蛋实验室,有问题可关注提问,每天都会在线答疑
展开
-
️ 后羿采集器——最良心的爬虫软件
2020 年如果让我推荐一款大众向的数据采集软件,那一定是后裔采集器了。和我之前推荐的 web scraper 相比,如果说 web scraper 是小而精的瑞士军刀,那后裔采集器就是大而全的重型武器,基本上可以解决所有的数据爬取问题。下面我们就来聊聊,这款软件的优秀之处。一、产品特点1.跨平台后羿采集器是一款桌面应用软件,支持三大操作系统:Linux、Windows 和 Mac,可以直接在官网上免费下载。2.功能强大后羿采集器把采集工作分为两种类型:智能模式和流程图模式。智能模式就是.原创 2020-07-27 09:13:49 · 11091 阅读 · 1 评论 -
Web Scraper 高级用法——使用 CouchDB 存储数据 | 简易数据分析 18
这是简易数据分析系列的第 18 篇文章。原文链接:https://www.cnblogs.com/web-scraper/p/web-scraper-couchdb.html利用 web scraper 抓取数据的时候,大家一定会遇到一个问题:数据是乱序的。在之前的教程里,我建议大家利用 Excel 等工具对数据二次加工排序,但还是存在部分数据无法排序的情况。其实解决数据乱序的方法也有,那...原创 2020-04-15 23:02:02 · 737 阅读 · 0 评论 -
Web Scraper 高级用法——利用正则表达式筛选文本信息 | 简易数据分析 17
这是简易数据分析系列的第 17 篇文章。原文首发于博客园:Web Scraper 高级用法——利用正则表达式筛选文本信息学习了这么多课,我想大家已经发现了,web scraper 主要是用来爬取文本信息的。在爬取的过程中,我们经常会遇到一个问题:网页上的数据比较脏,我们只需要里面的一部分信息。比如说要抓取 电影的评价人数,网页中抓到的原始数据是 1926853人评价,但是我们期望只抓取数字...原创 2020-03-18 11:39:02 · 1059 阅读 · 0 评论 -
Web Scraper 高级用法——抓取属性信息 | 简易数据分析 16
这是简易数据分析系列的第 16 篇文章。文章首发于博客园:web scraper 高级用法——抓取属性信息。今天我们讲一个用的较少的 Web Scraper 功能——抓取属性信息。网页在展示信息的时候,除了我们看到的内容,其实还有很多隐藏的信息。我们拿豆瓣电影250举个例子:电影图片正常显示的时候是这个样子:如果网络异常,图片加载失败,就会显示图片的默认文案,这个文案其实就是这个图片...原创 2020-03-04 22:31:04 · 1364 阅读 · 0 评论 -
Web Scraper 高级用法——CSS 选择器的使用 | 简易数据分析 15
这是简易数据分析系列的第 15 篇文章。原文首发于博客园:简易数据分析 15 | Web Scraper 高级用法——CSS 选择器的使用年末事情比较忙,很久不更新了,后台一直有读者催更,我看了一些读者给我的私信,发现一些通用的问题,所以单独写篇文章,介绍一些 Web Scraper 的进阶用法。今天我们就来学习一些 CSS 选择器的知识,辅助 Web Scraper 更好的定位要选择的元...原创 2020-03-04 22:29:44 · 735 阅读 · 0 评论 -
Web Scraper 翻页——利用 Link 选择器翻页 | 简易数据分析 14
这是简易数据分析系列的第 14 篇文章。本文首发于博客园:Web Scraper 翻页——利用 Link 选择器翻页今天我们还来聊聊 Web Scraper 翻页的技巧。这次的更新是受一位读者启发的,他当时想用 Web scraper 爬取一个分页器分页的网页,却发现我之前介绍的分页器翻页方法不管用。我研究了一下才发现我漏讲了一种很常见的翻页场景。在 web scraper 翻页——分页器...原创 2019-11-29 22:05:37 · 393 阅读 · 0 评论 -
简易数据分析 11 | Web Scraper 抓取表格数据
这是简易数据分析系列的第 11 篇文章。原文首发于博客园。今天我们讲讲如何抓取网页表格里的数据。首先我们分析一下,网页里的经典表格是怎么构成的。First Name 所在的行比较特殊,是一个表格的表头,表示信息分类2-5 行是表格的主体,展示分类内容经典表格就这些知识点,没了。下面我们写个简单的表格 Web Scraper 爬虫。1.制作 Sitemap我们今天的练手网站是...原创 2019-09-01 18:20:01 · 1199 阅读 · 0 评论 -
简易数据分析 10 | Web Scraper 翻页——抓取「滚动加载」类型网页
这是简易数据分析系列的第 10 篇文章。原文首发于博客园:简易数据分析 10。**友情提示:**这一篇文章的内容较多,信息量比较大,希望大家学习的时候多看几遍。我们在刷朋友圈刷微博的时候,总会强调一个『刷』字,因为看动态的时候,当把内容拉到屏幕末尾的时候,APP 就会自动加载下一页的数据,从体验上来看,数据会源源不断的加载出来,永远没有尽头。我们今天就是要讲讲,如何利用 Web Scr...原创 2019-08-14 08:33:18 · 902 阅读 · 0 评论 -
简易数据分析 09 | Web Scraper 自动控制抓取数量 & Web Scraper 父子选择器
这是简易数据分析系列的第 9 篇文章。今天我们说说 Web Scraper 的一些小功能:自动控制 Web Scraper 抓取数量和 Web Scraper 的父子选择器。如何只抓取前 100 条数据?如果跟着上篇教程一步一步做下来,你会发现这个爬虫会一直运作,根本停不下来。网页有 1000 条数据,他就会抓取 1000 条,有 10W 条,就会抓取 10W 条。如果我们的需求很小,只想...原创 2019-08-07 08:44:46 · 510 阅读 · 0 评论 -
简易数据分析 06 | 如何导入别人已经写好的 Web Scraper 爬虫
这是简易数据分析系列的第 6 篇文章。原文首发于博客园:简易数据分析 06上两期我们学习了如何通过 Web Scraper 批量抓取豆瓣电影 TOP250 的数据,内容都太干了,今天我们说些轻松的,讲讲 Web Scraper 如何导出导入 Sitemap 文件。前面也没有说,SItemap 是个什么东西,其实它就是我们操作 Web Scraper 后生成的爬虫文件,相当于 python ...原创 2019-07-18 08:09:35 · 244 阅读 · 0 评论 -
简易数据分析 07 | Web Scraper 抓取多条内容
这是简易数据分析系列的第 7 篇文章。在第 4 篇文章里,我讲解了如何抓取单个网页里的单类信息;在第 5 篇文章里,我讲解了如何抓取多个网页里的单类信息;今天我们要讲的是,如何抓取多个网页里的多类信息。这次的抓取是在简易数据分析 05的基础上进行的,所以我们一开始就解决了抓取多个网页的问题,下面全力解决如何抓取多类信息就可以了。我们在实操前先把逻辑理清:上几篇只抓取了一类元素:电影...原创 2019-07-24 21:28:59 · 638 阅读 · 0 评论 -
简易数据分析 03 | 浏览器中那些不为人知的使用技巧
原文首发于博客园:简易数据分析 03。这是简易数据分析系列的第 3 篇文章。上文我们安装了 Web Scraper 插件,我相信对于大部分人来说还是很简单的,这篇文章我们说些不一样的内容,讲讲浏览器里那些不被大多数人所知的骚操作。作为普通的使用者,大家用浏览器就是查阅信息,浏览网页。但在开发者的眼里,Chrome 浏览器提供了非常强大的开发能力。通过这篇文章的学习,大家可以掌握一些浏览器开...原创 2019-06-29 19:48:32 · 230 阅读 · 0 评论 -
简易数据分析 02 | Web Scraper 的下载与安装
这是简易数据分析系列的第 2 篇文章。原文首发于博客园:简易数据分析 02。上篇说了数据分析在生活中的重要性,从这篇开始,我们就要进入分析的实战内容了。数据分析数据分析,没有数据怎么分析?所以我们首先要学会采集数据。我调研了很多采集数据的软件,综合评定下来发现最好用的还是 Web Scraper,这是一款 Chrome 浏览器插件。![](https://image-1255652541...原创 2019-06-29 19:46:30 · 365 阅读 · 0 评论 -
简易数据分析 01 | 为什么我们要学习数据分析?
这是简易数据分析系列的第 1 篇文章。为什么叫简易数据分析?第 1 个原因是本教程面向纯小白用户,不写代码不写公式,迈出数据分析的第一步。第 2 个原因是生活中很多的数据分析场合,都是很轻量的,不需要上 Python 爬虫、高并发架构,机器学习等重武器,一个浏览器再加一个 Excel 就足够了:比如说某门课程论文交稿只有几天了,急需快速爬取数据进行数据分析,这时候临阵磨枪学习 Pyth...原创 2019-06-29 19:43:16 · 246 阅读 · 0 评论 -
简易数据分析 05 | Web Scraper 翻页——控制链接批量抓取数据
这是简易数据分析系列的第 5 篇文章。原文首发于博客园:Web Scraper 翻页——控制链接批量抓取数据上篇文章我们爬取了豆瓣电影 TOP250 前 25 个电影的数据,今天我们就要在原来的 Web Scraper 配置上做一些小改动,让爬虫把 250 条电影数据全部爬取下来。前面我们同时说了,爬虫的本质就是找规律,当初这些程序员设计网页时,肯定会依循一些规则,当我们找到规律时,就可以...原创 2019-07-09 22:12:48 · 714 阅读 · 0 评论 -
简易数据分析 04 | Web Scraper 初尝--抓取豆瓣高分电影
这是简易数据分析系列的第 4 篇文章。原文首发于博客园:简易数据分析 04。今天我们开始数据抓取的第一课,完成我们的第一个爬虫。因为是刚刚开始,操作我会讲的非常详细,可能会有些啰嗦,希望各位不要嫌弃啊:)有人之前可能学过一些爬虫知识,总觉得这是个复杂的东西,什么 HTTP、HTML、IP 池,在这里我们都不考虑这些东西。一是小的数据量根本不需要考虑,二是这些乱七八糟的东西根本没有说到爬虫的...原创 2019-07-04 07:58:20 · 523 阅读 · 0 评论