python数据分析和数据挖掘基础

最新推荐文章于 2024-03-15 15:26:53 发布

Endone1314

最新推荐文章于 2024-03-15 15:26:53 发布

阅读量326

点赞数

分类专栏： Python数据分析

Python数据分析专栏收录该内容

1 篇文章 0 订阅

订阅专栏

来源：韦玮老师课堂笔记

python数据分析和数据挖掘

1、挖掘相关模块简介

数据导入，利用pandas:csv excel mysql html txt

txt

1\查看表格信息
2\先下载本地网页，或在在线网页直接读取表格

n=pda.read_table("本地路径")

#导入sqlserver https://www.cnblogs.com/kowloon/p/7245488.html

mysql
import pymysql
conn=pymysql.connect(host,user,password,db）
sql="select * from myhexun"

k=pda.read_sql(sql,conn)

csv是一种常见数据存储格式，基本的数据都可以转为这种，通过pandas导入
i=pad.read_csv("文件地址")
i.describe()#数字的只有3行

2、对已知数据进行分析，提取有价值信息，比如平均数，标准差
数据挖掘，对大量数据进行分析挖掘，得到一些未知，有价值的信息，比如网站用户行为：啤酒和尿不湿，信息的个性化推送，疾病与症状以及疾病与药物

过程：

1、定义目标，获取数据（爬虫或统计网站下载），数据探索，数据预处理

2、数据清洗，集中，规范化，精简），挖掘建模（分类，聚类，关联，预测），模型评价与发布

3、数据处理实战

import numpy as nn
#创建数组格式
#numpy.array([元素1,元素2,...,元素n]) 
x=numpy.array(["a","9"])     #一维数组
y=numpy.array([[1,2,3,4],[1,2,3,4],…])  #二维数组

x.sort()  #排序sort()
y.sort() #对数组里进行排序

y1=y.max() #取最大值最小值
y2=y.min()

x1=x[1:3] #数组[起始下标:最终下标+1] #切片

import pandas as pda
"series 某串数字 1个series数字
 DataFrame 数据框，类似表格


series 是一个类数组的数据结构，同时带有标签（lable）或者说索引（index）
 dataFrame 数据框，类似表格

import pandas as pda
"series 是一个类数组的数据结构，同时带有标签（lable）或者说索引（index）
 dataFrame 数据框，类似表格 "

pad.Series([8,9,2,1],index=["one","two","three","four"])
c=pda.DataFrame([[5,6,2,3],[8,4,1,3]],columns=["one","two","three","four"]);
d.head(2)#头部数据，默认前五行
d.tail(2)#默认后五行
d.describle()#得出数据情况
i.sort_values(by="1/21/0").describe()

count #计数
mean  #平均数
std   #标准差
min   #最小值
25%   #每一列的分位数,将一个随机变量的概率分布范围分为几个等份的数值点
50%   #中分位数
d.T #转置

Endone1314

关注

0
点赞
踩
0

收藏

觉得还不错? 一键收藏
0
评论
python数据分析和数据挖掘基础

来源：韦玮老师课堂笔记python数据分析和数据挖掘1、挖掘相关模块简介数据导入，利用pandas:csv excel mysql html txttxt1\查看表格信息2\先下载本地网页，或在在线网页直接读取表格n=pda.read_table("本地路径")#导入sqlserver https://www.cnblogs.com/kowloon/p/7245488.htmlmysqli...
复制链接

扫一扫