写在最前面:
正确的代码直接看最后哈,前面是我瞎摸的过程。
本想直接之间用apply,取身份证前17位,除10取余,再除2取余。再判断结果是0还是1,是0就是女性,是1就是男性。
代码1:
import pandas as pd
data = pd.read_csv('文件路径')
data['sex'] = data['LICENSE_ID'].apply(lambda r : (int(r[:17]))%10%2)
运行报错:TypeError: 'float' object is not subscriptable
查了些别人相同的错误,觉得可能是apply传入的是索引,不是字符串,所以不能r[:17]
代码2:
def getsex(x):
x = data['LICENSE_ID']
a = (int(x[16:17]))%2
if a&1:
return 'male'
else:
return 'female'
data['sex'] = data['LICENSE_ID'].apply(getsex)
结果全是female,apply依次传入的是LICENSE_ID列中的值的索引,但是x = data[..]没有用到传进去的值呀...所以全是female可以理解!
为了搞清apply传入的究竟是什么
代码:3
def getsex(x):
return str(x)
data['sex'] = data['LICENSE_ID'].apply(getsex)
def getsex(x):
return type(x)
data['sex'] = data['LICENSE_ID'].apply(getsex)
第一个全是身份证,第二个全是<class 'str'>。嗯!这确实和普通的str不一样啊!查了一下,遍历字符串列表时都是这样。好像有点眉目apply是怎么遍历的了。
要解决的问题就是怎么把这个<class 'str'>类型的变成str类型。查了一下,说python中每种数据类型都是一个类的实例,我就理解成这的x,i都是类对象吧。试了一下,在循环里面,就是这类型。出了循环就不是了。
但是?apply就是遍历啊,懵逼了,这也改不了啊。
等等, 如果是<class 'str'>和str的问题,那么一般的列表的用i[数字:数字]不就打印不出来了。又试了一下,诶?看来问题不是这个啊!哈哈,白忙活了。
考虑可能int里面的问题?写下面的代码,运行结果还是TypeError: 'float' object is not subscriptable,看来是apply的原因,不能这样用。它这个具体源代码是什么我不清楚,所以我也改不了。不用apply了,换种方法。
代码4:
def getsex(x):
c = x[16:17]
a = (int(c))%2
if a&1:
return 'male'
else:
return 'female'
data['sex'] = data['LICENSE_ID'].apply(getsex)
换个遍历的方法...
代码5:还是一样的问题。。。呃,还有一个问题这样改具体的某一值也是不对的。
for a,b in data.iterrows():
i = 0
c = b['LICENSE_ID']
d = c[16:17]
if int(d)%2 == 0 :
data.iloc[i][45] = 'female'
i += 1
else:
data.iloc[i][45] = 'male'
i += 1
然后翻人家写的忽然发现series有个str属性!我傻眼了。
代码6:顺利解出!!
import pandas as pd
data = pd.read_csv('路径')
data['第17位数'] = data['LICENSE_ID'].str[16:17]
def getsex(x):
a = float(x)
#这里试过int,但是不能转成int,不太清楚为啥,有时间再研究研究
if a%2 == 0:
return 'female'
else:
return 'male'
data['sex'] = data['第17位数'].apply(getsex)
data_female = data[data['sex'] == 'female']
data_male = data[data['sex'] == 'male']
data_female.to_csv('存储文件',index = None,encoding = 'utf-8_sig' )
data_male.to_csv('存储文件',index = None,encoding = 'utf-8_sig' )
一些话:
这里面还有挺多不懂的。我其实不太清楚apply具体是怎么源代码是怎么实现的,只知道它的功能,所以我写出来的代码会稀奇古怪的。文中我的理解也很有可能有误。错误的地方,如果有大佬看到了一定要请您帮我指出来,谢谢!
我刚开始自学Python,这个东西是老师让我做做看的,我目前还在基础入门中......一个人学总感觉在摸爬滚打,如果有小伙伴一起就太好了。
反复折腾后总结出两点:
1.多了解原理,了解源代码,不过这点需要耗费大量时间。
2.多搜方法。可能有自己不知道的属性。很方便。