引言
在一次建模比赛中,我手头里的原始数据中有一个“地址描述”地段,如下:
地址描述
广州国际采购中心1401
上海市长宁区金钟路658弄5号楼5楼
徐汇区虹漕路461号58号楼5楼
济南市历下区和平路34号轻骑院内东二层山东朵拉
这样的地址描述字段过于随意,很难使用,但是看这些字符串的样子似乎又可以提取出其所在的省、市和区,即使只能够提取出区或者市,如果我们有一个省、市和区的归属数据库的话,应该也能够将剩下的信息映射出来,如果自己写的话肯定很麻烦,还要去网上找数据库,于是我做了一个可以复用的python模块,一条命令就可以将上面的“地址描述”字段转换成如下的样子:
省
市
区
广东省
广州市
上海市
上海市
长宁区
上海市
上海市
徐汇区
山东省
济南市
历下区
模块安装
目前支持python3
pip install cpca
常见安装问题:
在 windows 上可能会出现类似如下问题
Building wheel for pyahocorasick (setup.py) ... error
先去下载 Microsoft Visual C++ Build Tools,安装完成后,再重新使用 pip install cpca 安装,即可解决问题
Github地址
如果觉得这个模块对你有帮助的话,请给个