【好书推荐】Python数据挖掘：入门、进阶与实用案例分析

在下小吉.

已于 2023-10-22 16:24:02 修改

阅读量1.5k

点赞数 83

分类专栏：送书活动文章标签： python 数据挖掘开发语言

于 2023-10-13 15:15:30 首次发布

送书活动专栏收录该内容

13 篇文章 1 订阅

订阅专栏

文章目录

🌺摘要：
🎄案例背景
🎄分析目标
🎄分析过程
🎄数据预处理
🎆好书推荐
🍔彩蛋

🌺摘要：

本案例将主要结合自动售货机的实际情况，对销售的历史数据进行处理，利用pyecharts库、Matplotlib库进行可视化分析，并对未来4周商品的销售额进行预测，从而为企业制定相应的自动售货机市场需求分析及销售建议提供参考依据。更多详细内容请参考《Python数据挖掘：入门进阶与实用案例分析》一书。
在这里插入图片描述

🎄案例背景

近年来，随着我国经济技术的不断提升，自动化机械在人们日常生活中扮演着越来越重要的角色，更多的被应用在不同的领域。而作为新的一种自动化零售业态，自动售货机在日常生活中应用越来越广泛。自动售货机销售产业在走向信息化、合理化同时，也面临着高度同质化、成本上升、毛利下降等诸多困难与问题，这也是大多数企业所会面临到的问题。

为了提高市场占有率和企业的竞争力，某企业在广东省某8个市部署了376台自动售货机，但经过一段时间后，发现其经营状况并不理想。而如何了解销售额、订单数量与自动售货机数量之间的关系，畅销或滞销的商品又有哪些，自动售货机的销售情况等，已成为该企业亟待解决的问题。

🎄分析目标

获取了该企业某6个月的自动售货机销售数据，结合销售背景进行分析，并可视化展现销售现状，同时预测未来一段时间内的销售额，从而为企业制定营销策略提供一定的参考依据。

🎄分析过程

在这里插入图片描述

🎄数据预处理

⭐清洗数据

1.1 合并订单表并处理缺失值

由于订单表的数据是按月份分开存放的，为了方便后续对数据进行处理和可视化，所以需要对订单数据进行合并处理。同时，在合并订单表的数据后，为了了解订单表的缺失数据的基本情况，需要进行缺失值检测。合并订单表并进行缺失值检测，操作结果如图所示。
在这里插入图片描述
由操作结果可知，合并后的订单数据有350867条记录，且订单表中含有缺失值的记录总共有279条，其数量相对较少，可直接使用删除法对其中的缺失值进行处理。

合并订单表、查看缺失值并处理缺失值，如代码清单1所示。

代码清单1 合并订单表、查看缺失值并处理缺失值

import pandas as pd

 

# 读取数据

data4 = pd.read_csv('../data/订单表2018-4.csv', encoding='gbk')

data5 = pd.read_csv('../data/订单表2018-5.csv', encoding='gbk')

data6 = pd.read_csv('../data/订单表2018-6.csv', encoding='gbk')

data7 = pd.read_csv('../data/订单表2018-7.csv', encoding='gbk')

data8 = pd.read_csv('../data/订单表2018-8.csv', encoding='gbk')

data9 = pd.read_csv('../data/订单表2018-9.csv', encoding='gbk')

# 合并数据

data = pd.concat([data4, data5, data6, data7, data8, data9], ignore_index=True)

print('订单表合并后的形状为', data.shape)

# 缺失值检测

print('订单表各属性的缺失值数目为：\n', data.isnull().sum())

1.2 增加“市”属性

为了满足后续的数据可视化需求，需要在订单表中增加“市”属性，操作结果如图所示
在这里插入图片描述

# 从省市区属性中提取市的信息，并创建新属性

data['市'] = data['省市区'].str[3: 6]

print('经过处理后的数据前5行为：\n', data.head())

data = data.dropna(how='any')  # 删除缺失值

1.3 处理订单表中的“商品详情”属性

通过浏览订单表数据发现，在“商品详情”属性中存在有异名同义的情况，即两个名称不同的值所代表的实际意义是一致的，如“脉动青柠X1;”“脉动青柠x1;”等。因为此情况会对后面的分析结果造成一定的影响，所以需要对订单表中的“商品详情”属性进行处理，增加“商品名称”属性，如代码清单3所示。

代码清单3 处理订单表中的“商品详情”属性

# 定义一个需剔除字符的列表error_str

error_str = [' ', '(', ')', '（', '）', '0', '1', '2', '3', '4', '5', '6',

             '7', '8', '9', 'g', 'l', 'm', 'M', 'L', '听', '特', '饮', '罐',

             '瓶', '只', '装', '欧', '式', '&', '%', 'X', 'x', ';']

# 使用循环剔除指定字符

for i in error_str:

    data['商品详情'] = data['商品详情'].str.replace(i, '')

# 新建“商品名称”属性，用于新数据的存放

data['商品名称'] = data['商品详情']

1.4 处理“总金额（元）”属性

此外，当浏览订单表数据时，发现在“总金额（元）”属性中，存在极少订单的金额很小，如0、0.01等。在现实生活中，这种记录存在的情况极少，且这部分数据不具有分析意义。因此，在本案例中，对订单的金额小于0.5的记录进行删除处理，操作结果如图所示
在这里插入图片描述
由操作结果可知，删除前的数据行列数目为(350617, 17)，删除后的数据行列数目为(350450, 17)。

删除“总金额（元）”属性中订单的金额较少的记录如代码清单4所示。

代码清单4 删除“总金额（元）”属性中订单的金额较少的记录

# 删除金额较少的订单前的数据行列数目

print(data.shape)

# 删除金额较少的订单后的数据行列数目

data = data[data['总金额（元）'] >= 0.5]

print(data.shape)

⭐属性选择

因为订单表中的“手续费（元）”“收款方”“软件版本”“省市区”“商品详情”“退款金额（元）”等属性对本案例的分析没有意义，所以需要对其进行删除处理，选择合适的属性，操作的结果如图所示。
在这里插入图片描述

# 对于订单表数据选择合适的属性

data = data.drop(['手续费（元）', '收款方', '软件版本', '省市区', '商品详情', '退款金额（元）'], axis=1)

print('选择后，数据属性为：\n', data.columns.values)

⭐属性规约

在订单表“下单时间”属性中含有的信息量较多，并且存在概念分层的情况，需要对属性进行数据规约，提取需要的信息。提取相应的“小时”属性和“月份”属性，进一步泛化“小时”属性为“下单时间段”属性，规则如下：

Ø当小时≤5时，为“凌晨”；

Ø当5＜小时≤8时，为“早晨”；

Ø当8＜小时≤11时，为“上午”；

Ø当11＜小时≤13时，为“中午”；

Ø当13＜小时≤16时，为“下午”；

Ø当16＜小时≤19时，为“傍晚”；

Ø当19＜小时≤24，为“晚上”。

# 将时间格式的字符串转换为标准的时间格式

data['下单时间'] = pd.to_datetime(data['下单时间'])

data['小时'] = data['下单时间'].dt.hour  # 提取时间中的小时

data['月份'] = data['下单时间'].dt.month  # 提取时间中的月份

data['下单时间段'] = 'time'  # 新增“下单时间段”属性，并将其初始化为time

exp1 = data['小时'] <= 5  # 判断小时是否小于等于5

# 若条件为真，则时间段为凌晨

data.loc[exp1, '下单时间段'] = '凌晨'

# 判断小时是否大于5且小于等于8

exp2 = (5 < data['小时']) & (data['小时'] <= 8)

# 若条件为真，则时间段为早晨

data.loc[exp2, '下单时间段'] = '早晨'

# 判断小时是否大于8且小于等于11

exp3 = (8 < data['小时']) & (data['小时'] <= 11)

# 若条件为真，则时间段为上午

data.loc[exp3, '下单时间段'] = '上午'

# 判断小时是否小大于11且小于等于13

exp4 = (11 < data['小时']) & (data['小时'] <= 13)

# 若条件为真，则时间段为中午

data.loc[exp4, '下单时间段'] = '中午'

# 判断小时是否大于13且小于等于16

exp5 = (13 < data['小时']) & (data['小时'] <= 16)

# 若条件为真，则时间段为下午

data.loc[exp5, '下单时间段'] = '下午'

# 判断小时是否大于16且小于等于19

exp6 = (16 < data['小时']) & (data['小时'] <= 19)

# 若条件为真，则时间段为傍晚

data.loc[exp6, '下单时间段'] = '傍晚'

# 判断小时是否大于19且小于等于24

exp7 = (19 < data['小时']) & (data['小时'] <= 24)

# 若条件为真，则时间段为晚上

data.loc[exp7, '下单时间段'] = '晚上'

data.to_csv('../tmp/order.csv', index=False, encoding = 'gbk')

🎆好书推荐

在这里插入图片描述

《Python数据挖掘：入门、进阶与实用案例分析》是一本以项目实战案例为驱动的数据挖掘著作，它能帮助完全没有Python编程基础和数据挖掘基础的读者快速掌握Python数据挖掘的技术、流程与方法。在写作方式上，与传统的“理论与实践结合”的入门书不同，它以数据挖掘领域的知名赛事“泰迪杯”数据挖掘挑战赛（已举办10届）和“泰迪杯”数据分析技能赛（已举办5届）（累计1500余所高校的10余万师生参赛）为依托，精选了11个经典赛题，将Python编程知识、数据挖掘知识和行业知识三者融合，让读者在实践中快速掌握电商、教育、交通、传媒、电力、旅游、制造等7大行业的数据挖掘方法。

本书不仅适用于零基础的读者自学，还适用于教师教学，为了帮助读者更加高效地掌握本书的内容，本书提供了以下10项附加价值：
（1）建模平台：提供一站式大数据挖掘建模平台，免配置，包含大量案例工程，边练边学，告别纸上谈兵
（2）视频讲解：提供不少于600分钟Python编程和数据挖掘相关教学视频，边看边学，快速收获经验值
（3）精选习题：精心挑选不少于60道数据挖掘练习题，并提供详细解答，边学边练，检查知识盲区
（4）作者答疑：学习过程中有任何问题，通过“树洞”小程序，纸书拍照，一键发给作者，边问边学，事半功倍
（5）数据文件：提供各个案例配套的数据文件，与工程实践结合，开箱即用，增强实操性
（6）程序代码：提供书中代码的电子文件及相关工具的安装包，代码导入平台即可运行，学习效果立竿见影
（7）教学课件：提供配套的PPT课件，使用本书作为教材的老师可以申请，节省备课时间
（8）模型服务：提供不少于10个数据挖掘模型，模型提供完整的案例实现过程，助力提升数据挖掘实践能力
（9）教学平台：泰迪科技为本书提供的附加资源提供一站式数据化教学平台，附有详细操作指南，边看边学边练，节省时间
（10）就业推荐：提供大量就业推荐机会，与1500+企业合作，包含华为、京东、美的等知名企业

通过学习本书，读者可以理解数据挖掘的原理，迅速掌握大数据技术的相关操作，为后续数据分析、数据挖掘、深度学习的实践及竞赛打下良好的技术基础。

购买链接 https://item.jd.com/13814157.html

🍔彩蛋

⭐ 《Python数据挖掘：入门、进阶与实用案例分析》免费包邮送2本！
⭐活动时间：截止到 2023-10-20 20:00:00
⭐ 抽奖方式：利用程序进行抽奖。
⭐参与方式：关注博主、点赞、收藏、评论区进行高质量评论（不少于10个字），即可参加抽奖活动
⭐本次活动一共赠3本，评论区抽取3位小伙伴免费送出！！

在这里插入图片描述