来源:韦玮老师课堂笔记
python数据分析和数据挖掘
1、挖掘相关模块简介
数据导入,利用pandas:csv excel mysql html txt
txt
1\查看表格信息
2\先下载本地网页,或在在线网页直接读取表格
#导入sqlserver https://www.cnblogs.com/kowloon/p/7245488.html
mysql
import pymysql
conn=pymysql.connect(host,user,password,db)
sql="select * from myhexun"
k=pda.read_sql(sql,conn)
csv是一种常见数据存储格式,基本的数据都可以转为这种,通过pandas导入
i=pad.read_csv("文件地址")
i.describe()#数字的只有3行
2、对已知数据进行分析,提取有价值信息,比如平均数,标准差
数据挖掘,对大量数据进行分析挖掘,得到一些未知,有价值的信息,比如网站用户行为:啤酒和尿不湿,信息的个性化推送,疾病与症状以及疾病与药物
过程:
1、定义目标,获取数据(爬虫或统计网站下载),数据探索,数据预处理
2、数据清洗,集中,规范化,精简),挖掘建模(分类,聚类,关联,预测),模型评价与发布
3、数据处理实战
import numpy as nn
#创建数组格式
#numpy.array([元素1,元素2,...,元素n])
x=numpy.array(["a","9"]) #一维数组
y=numpy.array([[1,2,3,4],[1,2,3,4],…]) #二维数组
x.sort() #排序sort()
y.sort() #对数组里进行排序
y1=y.max() #取最大值最小值
y2=y.min()
x1=x[1:3] #数组[起始下标:最终下标+1] #切片
import pandas as pda
"series 某串数字 1个series数字
DataFrame 数据框,类似表格
series 是一个类数组的数据结构,同时带有标签(lable)或者说索引(index)
dataFrame 数据框,类似表格
import pandas as pda
"series 是一个类数组的数据结构,同时带有标签(lable)或者说索引(index)
dataFrame 数据框,类似表格 "
pad.Series([8,9,2,1],index=["one","two","three","four"])
c=pda.DataFrame([[5,6,2,3],[8,4,1,3]],columns=["one","two","three","four"]);
d.head(2)#头部数据,默认前五行
d.tail(2)#默认后五行
d.describle()#得出数据情况
i.sort_values(by="1/21/0").describe()
count #计数
mean #平均数
std #标准差
min #最小值
25% #每一列的分位数,将一个随机变量的概率分布范围分为几个等份的数值点
50% #中分位数
d.T #转置