[Python] Pandas批量处理身份证信息，判别男性和女性

Mediocrity_Cui

已于 2022-11-09 11:02:32 修改

阅读量2.8k

点赞数 6

分类专栏：数据处理文章标签： Python 身份证性别判断 apply Series.str

于 2022-05-24 22:15:36 首次发布

本文链接：https://blog.csdn.net/Kaneki0001/article/details/124952889

版权

数据处理专栏收录该内容

2 篇文章 0 订阅

订阅专栏

写在最前面：

正确的代码直接看最后哈，前面是我瞎摸的过程。

本想直接之间用apply，取身份证前17位，除10取余，再除2取余。再判断结果是0还是1，是0就是女性，是1就是男性。

代码1：

import pandas as pd
data = pd.read_csv('文件路径')
data['sex'] = data['LICENSE_ID'].apply(lambda r : (int(r[:17]))%10%2)

运行报错：TypeError: 'float' object is not subscriptable

查了些别人相同的错误，觉得可能是apply传入的是索引，不是字符串，所以不能r[:17]

代码2：

def getsex(x):
    x = data['LICENSE_ID']
    a = (int(x[16:17]))%2
    if a&1:
        return 'male'
    else:
        return 'female'
data['sex'] = data['LICENSE_ID'].apply(getsex)

结果全是female，apply依次传入的是LICENSE_ID列中的值的索引，但是x = data[..]没有用到传进去的值呀...所以全是female可以理解！

为了搞清apply传入的究竟是什么

代码：3

def getsex(x):
    return str(x)
data['sex'] = data['LICENSE_ID'].apply(getsex)

def getsex(x):
    return type(x)
data['sex'] = data['LICENSE_ID'].apply(getsex)

第一个全是身份证，第二个全是<class 'str'>。嗯！这确实和普通的str不一样啊！查了一下，遍历字符串列表时都是这样。好像有点眉目apply是怎么遍历的了。

要解决的问题就是怎么把这个<class 'str'>类型的变成str类型。查了一下，说python中每种数据类型都是一个类的实例，我就理解成这的x，i都是类对象吧。试了一下，在循环里面，就是这类型。出了循环就不是了。

但是？apply就是遍历啊，懵逼了，这也改不了啊。

等等，如果是<class 'str'>和str的问题，那么一般的列表的用i[数字:数字]不就打印不出来了。又试了一下，诶？看来问题不是这个啊！哈哈，白忙活了。

考虑可能int里面的问题？写下面的代码，运行结果还是TypeError: 'float' object is not subscriptable，看来是apply的原因，不能这样用。它这个具体源代码是什么我不清楚，所以我也改不了。不用apply了，换种方法。

代码4：

def getsex(x):
    c = x[16:17]
    a = (int(c))%2
    if a&1:
        return 'male'
    else:
        return 'female'
data['sex'] = data['LICENSE_ID'].apply(getsex)

换个遍历的方法...

代码5：还是一样的问题。。。呃，还有一个问题这样改具体的某一值也是不对的。

for a,b in data.iterrows():
    i = 0
    c = b['LICENSE_ID']
    d = c[16:17]
    if int(d)%2 == 0 :
        data.iloc[i][45] = 'female'
        i += 1
    else:
        data.iloc[i][45] = 'male'
        i += 1

然后翻人家写的忽然发现series有个str属性！我傻眼了。

代码6：顺利解出！！

import pandas as pd
data = pd.read_csv('路径')
data['第17位数'] = data['LICENSE_ID'].str[16:17]
def getsex(x):
    a = float(x)
#这里试过int，但是不能转成int，不太清楚为啥，有时间再研究研究
    if a%2 == 0:
        return 'female'
    else:
        return 'male'
data['sex'] = data['第17位数'].apply(getsex)
data_female = data[data['sex'] == 'female']
data_male = data[data['sex'] == 'male']
data_female.to_csv('存储文件',index = None,encoding = 'utf-8_sig' )
data_male.to_csv('存储文件',index = None,encoding = 'utf-8_sig' )

一些话：

这里面还有挺多不懂的。我其实不太清楚apply具体是怎么源代码是怎么实现的，只知道它的功能，所以我写出来的代码会稀奇古怪的。文中我的理解也很有可能有误。错误的地方，如果有大佬看到了一定要请您帮我指出来，谢谢！

我刚开始自学Python，这个东西是老师让我做做看的，我目前还在基础入门中......一个人学总感觉在摸爬滚打，如果有小伙伴一起就太好了。

反复折腾后总结出两点：

1.多了解原理，了解源代码，不过这点需要耗费大量时间。

2.多搜方法。可能有自己不知道的属性。很方便。