排序:
默认
按更新时间
按访问量

构建决策树对于流失用户进行分类

    最近被分配到商业分析组配合商业分析师对流失掉的客户进行研究。我最先接到的任务是根据客服部门记录的客户的流失原因,对于这些客户的流失原因做分类。商业分析师给我提供了23个类别,要求我把客户都分到这些类中。最开始我企图通过建立关键词规则,比如包含某些单词或者不包含某些单词,但是实际上发现分类的...

2018-07-30 17:36:17

阅读数:145

评论数:0

pandas数据清洗(1)

import pandas as pd import numpy as np data = pd.read_excel('EDA.xlsx') data.head()//此数据纯属捏造,不代表任何事实   序号 民族 ZCQ_JY10800_2.0_c...

2018-07-13 17:51:57

阅读数:85

评论数:0

Python获取城市美食、地铁、中小学、商场及超市信息

from bs4 import BeautifulSoup from urllib import request import pandas as pd import numpy as np import urllib.parse as urp import time import json l...

2018-07-05 15:03:37

阅读数:277

评论数:0

房源对应地铁站的直线距离计算

import pandas as pd import numpy as np class Distance: def __init__(self,data): assert ('name' in data.columns) and ('longitude' in data....

2018-06-22 13:19:52

阅读数:35

评论数:0

房源匹配最近地铁站

最近有一个新的城市准备上线,我们作为基础数据组需要收集很多基本信息。其中很重要的一个字段就是房源的最近地铁站和与地铁的距离为多少,这对于租户来说,是影响租房与否以及愿意支付价格的重要因素。class MatchSubway: def __init__(self,data1,data2): ...

2018-06-21 10:40:57

阅读数:81

评论数:0

Python爬虫获取小区经纬度以及获取结构化的地址

    通过小区名称利用百度api可以获取小区的地址以及经纬度,但是由于api返回的值中的地址形式不同,所以可以首先利用小区名称进行一轮爬虫,获取小区的经纬度,然后再利用经纬度Reverse到小区的结构化的地址。另外小区名称如果是'...号‘,可以在爬虫开始之前在’号‘之后加一个’院‘,得到的精确...

2018-06-13 13:51:41

阅读数:582

评论数:2

从百度地图api获取地铁站经纬度

class GetInfo: def __init__(self,df): import pandas assert type(df) == pandas.core.frame.DataFrame and ('city' in df.columns) and...

2018-06-12 12:06:33

阅读数:378

评论数:0

从China Webmaster上收集房地产网站排名、网址和简介

    今天工程师要求我从China Webmaster上收集排名前200名的房地产网站的排名、网址和简介以及评分信息。在完成任务之后我把程序重新优化了一下,写成了一个类,方便下次重复使用。最终的返回结果是一个pandas中的dataframe,可以写成excel。class Rank: ...

2018-06-11 17:38:52

阅读数:152

评论数:0

Python爬虫获取楼盘信息

    在一家线上租房的公司已经实习两周了。作为实习生,所以日常的工作主要是收集和整理全国各小区的信息,比如小区的建成年代,是否有电梯,小区的门牌数等。因为我不太喜欢用复制粘贴这种效率低的工作方式,所以写了一个简单的Python程序,相对那些高端爬虫比较简单,但是还挺管用。通过以下的代码可以爬取网...

2018-05-25 12:06:50

阅读数:252

评论数:0

提示
确定要删除当前文章?
取消 删除
关闭
关闭