在数据分析中,通常需要把连续的数据离散化或拆分成多个区间(bin),这就需要用到cut()或qcut()函数。
一,cut函数
把值切分成离散的区间,有三种切分方式,第一种方式是制定区间的数量,把连续值平均切分;第二种方式是以标量值序列指定各个区间的边界值;第三种方式是以IntervalIndex 精确指定各个区间,区间之间不允许重叠。
pandas.cut(x, bins, right=True, labels=None, retbins=False, precision=3, include_lowest=False)
参数注释:
- x:array-like
- bins:如果是整数,表示切分区间的数量;如果是整数序列(从小到大),表示通过元素指定各个区间的边界;如果是IntervalIndex,表示精确指定各个区间。
- right:是否包含区间的右边界
- labels:为每一个区间指定一个标签
- retbins:是否返回bins(切分的区间的边界)
- precision:指定区间标签(bin label)的精度,通常是对浮点数标签来说,指定小数点后的位数
- include_lowest:指定第一个区间是否包含最低值
cut函数返回的是Categori