用Excel做一次数据分析（二）——一次简单的分析

最新推荐文章于 2021-07-26 18:50:04 发布

weixin_43576422

最新推荐文章于 2021-07-26 18:50:04 发布

阅读量554

点赞数 1

分类专栏：数据分析数据库文章标签： python 数据分析

本文链接：https://blog.csdn.net/weixin_43576422/article/details/107959403

版权

本文是Excel数据分析系列的第二部分，重点介绍了数据清洗和初步分析的步骤。首先明确了分析目的，例如了解数据分析师的薪资水平、地区需求和工作经验影响。接着详细讲述了数据预处理，包括检查缺失值、处理脏数据、删除重复项，以及数据转换，特别是薪水字段的单位统一和工作经验、学历的处理。最后，通过数据透视表分析了薪酬分布、工作经验与学历对薪资的影响，强调了明确分析目的和数据清洗的重要性。

摘要由CSDN通过智能技术生成

接上一篇：用Excel做一次数据分析（一）——爬取前程无忧（51job）的招聘信息
得到了数据（截止2020-8-12）后，接下来可以开始数据清洗和分析的工作了：

总体步骤：

数据获取——这里用python爬取前程无忧的招聘信息；

明确分析目的——你拿这数据要得到什么信息，解决什么问题；

观察数据——各个数据字段的含义，中英文释义；

数据清洗——无效值、缺失值、重复值处理，数据结构是否一致等；

分析过程——围绕目的展开分析；

制作可视化——做图表做可视化报告

一、明确目的

数据分析的大忌是不知道分析的方向和目的，拿着一堆数据不知所措。数据用来解决什么问题？

是进行汇总统计制作成报表？

是进行数据可视化，作为一张信息图？

是验证某一类业务假设？

是希望提高某一个指标的KPI？

要知道一切数据分析都是以业务为核心目的，所以要找到业务问题的思考点。关于找到问题的切入点，之前数据分析思维篇讲过。永远不要妄图在一堆数据中找结论，目标在前，数据在后，哪怕是把数据做个平均值比较，也比没有方向好。每一步尝试都会引发进一步思考，比如为什么这个值这么低，原因在哪里，这个差异波动有何规律……

所以，分析前不妨先来看一下我们爬的数据：
在这里插入图片描述
比如我想成为一名数据分析师，可能会关注的是：

目前数据分析师的平均薪资水平如何，薪资的区间分布如何

各地区对分析工程师的需求量是多少，哪些地区设岗最多。

不同年限的分析工程师薪资差异如何，3年后我差不多是什么样的价位？

薪水较高的公司有哪些？

带着这样的问题，那我们的分析就有了方向，后续则是将目标拆解为实际分析展示的过程

探索数据

大概看一下数据全不全，各个字段的含义，单位（量纲）、格式是否一致，是否有空值？
各个字段含义：
岗位名称、公司名称、工作地点、薪水、工作经历和学历最低要求、公司类型、公司规模、公司领域
在这里插入图片描述

数据预处理

数据预处理一般包括数据清洗、数据变换、数据集成、数据归约、离散化等：
（1）数据清洗
一般包括无效值、缺失值、重复值处理；
数据是否有乱码，错位现象；
数据口径问题，两张表的关联ID名是否一致；
还有是否有统一的标准或命名，如公司名全写或缩写的区分。
（2）数据转换则是将数据规整为统一格式处理。
（3）数据集成主要是指多种数据源汇集到一起，放入一个数据仓库的过程，主要有实体识别、冗余属性识别、数据值冲突等
（4）数据归约是保证原始信息不丢失的情况下，减少分析使用的数据量，常使用方式是维归约

接下来进行数据清洗。