【ML】pandas 处理数据中的非数字列

数据集

鸢尾花数据集:https://www.kaggle.com/datasets/himanshunakrani/iris-dataset

数据处理

查看数据的前几行

import numpy as np 
import pandas as pd 

origin_data = pd.read_csv("/kaggle/input/iris-dataset/iris.csv")
origin_data.head()

输出:

sepal_lengthsepal_widthpetal_lengthpetal_widthspecies
05.13.51.40.2setosa
14.93.01.40.2setosa
24.73.21.30.2setosa
34.63.11.50.2setosa
45.03.61.40.2setosa

查看非数字列的数据分布

origin_data.loc[:,'species'].value_counts()

输出:

setosa        50
versicolor    50
virginica     50
Name: species, dtype: int64

这里我们知道去重后一共有三种数据,接下来我们将每个类型换为数字。

替换非数字列为数字列

data = origin_data.replace({'species':{'setosa':1,'versicolor':2,'virginica':3}})
  • 0
    点赞
  • 1
    收藏
    觉得还不错? 一键收藏
  • 0
    评论
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值