python提取中文地址中乡镇名_使用python提取中文地址描述中的省市区信息

本文介绍了一个Python模块cpca,用于从中文地址中提取省市区信息。通过示例展示了如何使用该模块进行地址转换,并提到了分词模式和全文模式,以及如何在地图上绘制地址分布。
摘要由CSDN通过智能技术生成

引言

在一次建模比赛中,我手头里的原始数据中有一个“地址描述”地段,如下:

地址描述

广州国际采购中心1401

上海市长宁区金钟路658弄5号楼5楼

徐汇区虹漕路461号58号楼5楼

济南市历下区和平路34号轻骑院内东二层山东朵拉

这样的地址描述字段过于随意,很难使用,但是看这些字符串的样子似乎又可以提取出其所在的省、市和区,即使只能够提取出区或者市,如果我们有一个省、市和区的归属数据库的话,应该也能够将剩下的信息映射出来,如果自己写的话肯定很麻烦,还要去网上找数据库,于是我做了一个可以复用的python模块,一条命令就可以将上面的“地址描述”字段转换成如下的样子:

广东省

广州市

上海市

上海市

长宁区

上海市

上海市

徐汇区

山东省

济南市

历下区

模块安装

目前支持python3

pip install cpca

Github地址

如果觉得这个模块对你有帮助的话,请给个star啊

基本功能

分词模式

本模块中最主要的方法是cpca.transform,该方法可以输入任意的可迭代类型(如list,pandas的Series类型等),然后将其转换为一个DataFrame,下面演示一个最为简单的使用方法:

location_str = ["徐汇区虹漕路461号58号楼5楼"

  • 0
    点赞
  • 2
    收藏
    觉得还不错? 一键收藏
  • 0
    评论
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值