数据挖掘工具pandas（十）离散化处理

最新推荐文章于 2023-01-06 11:17:12 发布

TFATS

最新推荐文章于 2023-01-06 11:17:12 发布

阅读量550

点赞数

分类专栏： python常用工具库 pandas 文章标签： python 数据分析

本文链接：https://blog.csdn.net/TFATS/article/details/106351717

版权

python常用工具库同时被 2 个专栏收录

53 篇文章 6 订阅

订阅专栏

pandas

13 篇文章 2 订阅

订阅专栏

一，什么是数据的离散化

连续属性的离散化就是将连续属性的值域上，将值域划分为若干个离散的区间，最后用不同的符号或整数值代表落在每个子区间中的属性值。

二，qcut()

import pandas as pd
import numpy as np
from matplotlib import pyplot as plt

# 构造数据
temp = pd.DataFrame(np.random.normal(0,100,(500,505)))
stock_list = ["股票"+ str(i) for i in range(temp.shape[0])]
date = ["第"+ str(i)+"天" for i in range(temp.shape[1])]
temp.index = stock_list
temp.columns = date

# 取出单列数据
p_change = temp["第1天"]

# 利用plt画图
# p_change.hist(bins=80)
# plt.show()

# 使用qcut自动分组；10为共分成组的数量
a = pd.qcut(p_change,10)

# 返回值使用value_counts()得到 每组数据的区间；每组的个数（基本相等）
print(a.value_counts())

三，cut()

import pandas as pd
import numpy as np
from matplotlib import pyplot as plt

# 构造数据
temp = pd.DataFrame(np.random.normal(0,100,(500,505)))
stock_list = ["股票"+ str(i) for i in range(temp.shape[0])]
date = ["第"+ str(i)+"天" for i in range(temp.shape[1])]
temp.index = stock_list
temp.columns = date

# 取出单列数据
p_change = temp["第1天"]

# 利用plt画图
# p_change.hist(bins=80)
# plt.show()

# 使用cut自己进行分组,使用自己定义的组距进行分组
bins = [-500,-100,-7,-5,-3,0,3,5,7,100,500]
a = pd.cut(p_change,bins)
print(a)
print(a.value_counts())

四，变成哑变量矩阵

import pandas as pd
import numpy as np
from matplotlib import pyplot as plt

# 构造数据
temp = pd.DataFrame(np.random.normal(0,100,(500,505)))
stock_list = ["股票"+ str(i) for i in range(temp.shape[0])]
date = ["第"+ str(i)+"天" for i in range(temp.shape[1])]
temp.index = stock_list
temp.columns = date

# 取出单列数据
p_change = temp["第1天"]

# 利用plt画图
# p_change.hist(bins=80)
# plt.show()

# 使用cut自己进行分组,使用自己定义的组距进行分组
bins = [-500,-100,-7,-5,-3,0,3,5,7,100,500]
a = pd.cut(p_change,bins)
print(a)
# prefix为展示列名称前的文字
print(pd.get_dummies(a,prefix="rise"))

TFATS

关注

0
点赞
踩
1

收藏

觉得还不错? 一键收藏
0
评论
数据挖掘工具pandas（十）离散化处理

一，什么是数据的离散化连续属性的离散化就是将连续属性的值域上，将值域划分为若干个离散的区间，最后用不同的符号或整数值代表落在每个子区间中的属性值。二，qcut()import pandas as pdimport numpy as npfrom matplotlib import pyplot as plt# 构造数据temp = pd.DataFrame(np.random.normal(0,100,(500,505)))stock_list = ["股票"+ str(i) for i
复制链接

扫一扫