[Python] Pandas批量处理身份证信息,判别男性和女性

写在最前面:

正确的代码直接看最后哈,前面是我瞎摸的过程。

        本想直接之间用apply,取身份证前17位,除10取余,再除2取余。再判断结果是0还是1,是0就是女性,是1就是男性。

代码1:

import pandas as pd
data = pd.read_csv('文件路径')
data['sex'] = data['LICENSE_ID'].apply(lambda r : (int(r[:17]))%10%2)

        运行报错:TypeError: 'float' object is not subscriptable

        查了些别人相同的错误,觉得可能是apply传入的是索引,不是字符串,所以不能r[:17]

代码2:

def getsex(x):
    x = data['LICENSE_ID']
    a = (int(x[16:17]))%2
    if a&1:
        return 'male'
    else:
        return 'female'
data['sex'] = data['LICENSE_ID'].apply(getsex)

        结果全是female,apply依次传入的是LICENSE_ID列中的值的索引,但是x = data[..]没有用到传进去的值呀...所以全是female可以理解!

        为了搞清apply传入的究竟是什么

代码:3

def getsex(x):
    return str(x)
data['sex'] = data['LICENSE_ID'].apply(getsex)

def getsex(x):
    return type(x)
data['sex'] = data['LICENSE_ID'].apply(getsex)

        第一个全是身份证,第二个全是<class 'str'>。嗯!这确实和普通的str不一样啊!查了一下,遍历字符串列表时都是这样。好像有点眉目apply是怎么遍历的了。

         要解决的问题就是怎么把这个<class 'str'>类型的变成str类型。查了一下,说python中每种数据类型都是一个类的实例,我就理解成这的x,i都是类对象吧。试了一下,在循环里面,就是这类型。出了循环就不是了。

        但是?apply就是遍历啊,懵逼了,这也改不了啊。

       等等, 如果是<class 'str'>和str的问题,那么一般的列表的用i[数字:数字]不就打印不出来了。又试了一下,诶?看来问题不是这个啊!哈哈,白忙活了。

         考虑可能int里面的问题?写下面的代码,运行结果还是TypeError: 'float' object is not subscriptable,看来是apply的原因,不能这样用。它这个具体源代码是什么我不清楚,所以我也改不了。不用apply了,换种方法。

代码4:

def getsex(x):
    c = x[16:17]
    a = (int(c))%2
    if a&1:
        return 'male'
    else:
        return 'female'
data['sex'] = data['LICENSE_ID'].apply(getsex)

换个遍历的方法...

代码5:还是一样的问题。。。呃,还有一个问题这样改具体的某一值也是不对的。

for a,b in data.iterrows():
    i = 0
    c = b['LICENSE_ID']
    d = c[16:17]
    if int(d)%2 == 0 :
        data.iloc[i][45] = 'female'
        i += 1
    else:
        data.iloc[i][45] = 'male'
        i += 1

然后翻人家写的忽然发现series有个str属性!我傻眼了。

代码6:顺利解出!!

import pandas as pd
data = pd.read_csv('路径')
data['第17位数'] = data['LICENSE_ID'].str[16:17]
def getsex(x):
    a = float(x)
#这里试过int,但是不能转成int,不太清楚为啥,有时间再研究研究
    if a%2 == 0:
        return 'female'
    else:
        return 'male'
data['sex'] = data['第17位数'].apply(getsex)
data_female = data[data['sex'] == 'female']
data_male = data[data['sex'] == 'male']
data_female.to_csv('存储文件',index = None,encoding = 'utf-8_sig' )
data_male.to_csv('存储文件',index = None,encoding = 'utf-8_sig' )

一些话:

        这里面还有挺多不懂的。我其实不太清楚apply具体是怎么源代码是怎么实现的,只知道它的功能,所以我写出来的代码会稀奇古怪的。文中我的理解也很有可能有误。错误的地方,如果有大佬看到了一定要请您帮我指出来,谢谢!

        我刚开始自学Python,这个东西是老师让我做做看的,我目前还在基础入门中......一个人学总感觉在摸爬滚打,如果有小伙伴一起就太好了。

        反复折腾后总结出两点:

        1.多了解原理,了解源代码,不过这点需要耗费大量时间。

        2.多搜方法。可能有自己不知道的属性。很方便。

    

评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值