python数据分析和数据挖掘基础

来源:韦玮老师课堂笔记

python数据分析和数据挖掘



1、挖掘相关模块简介

    数据导入,利用pandas:csv excel mysql html txt


txt

1\查看表格信息
2\先下载本地网页,或在在线网页直接读取表格

n=pda.read_table("本地路径")

#导入sqlserver https://www.cnblogs.com/kowloon/p/7245488.html

mysql
import pymysql
conn=pymysql.connect(host,user,password,db)
sql="select * from myhexun"

k=pda.read_sql(sql,conn)


csv是一种常见数据存储格式,基本的数据都可以转为这种,通过pandas导入
i=pad.read_csv("文件地址")
i.describe()#数字的只有3行


2、对已知数据进行分析,提取有价值信息,比如平均数,标准差
    数据挖掘,对大量数据进行分析挖掘,得到一些未知,有价值的信息,比如网站用户行为:啤酒和尿不湿,信息的个性化推送,疾病与症状以及疾病与药物

    过程:

    1、定义目标,获取数据(爬虫或统计网站下载),数据探索,数据预处理

    2、数据清洗,集中,规范化,精简),挖掘建模(分类,聚类,关联,预测),模型评价与发布


3、数据处理实战

import numpy as nn
#创建数组格式
#numpy.array([元素1,元素2,...,元素n]) 
x=numpy.array(["a","9"])     #一维数组
y=numpy.array([[1,2,3,4],[1,2,3,4],…])  #二维数组

x.sort()  #排序sort()
y.sort() #对数组里进行排序

y1=y.max() #取最大值最小值
y2=y.min()

x1=x[1:3] #数组[起始下标:最终下标+1] #切片
import pandas as pda
"series 某串数字 1个series数字
 DataFrame 数据框,类似表格


series 是一个类数组的数据结构,同时带有标签(lable)或者说索引(index)
 dataFrame 数据框,类似表格

import pandas as pda
"series 是一个类数组的数据结构,同时带有标签(lable)或者说索引(index)
 dataFrame 数据框,类似表格 "

pad.Series([8,9,2,1],index=["one","two","three","four"])
c=pda.DataFrame([[5,6,2,3],[8,4,1,3]],columns=["one","two","three","four"]);
d.head(2)#头部数据,默认前五行
d.tail(2)#默认后五行
d.describle()#得出数据情况
i.sort_values(by="1/21/0").describe()

count #计数
mean  #平均数
std   #标准差
min   #最小值
25%   #每一列的分位数,将一个随机变量的概率分布范围分为几个等份的数值点
50%   #中分位数
d.T #转置


  • 0
    点赞
  • 0
    收藏
    觉得还不错? 一键收藏
  • 0
    评论
92讲视频课+16大项目实战+课件源码  为什么学习数据分析?       人工智能、大数据时代有什么技能是可以运用在各种行业的?数据分析就是。      从海量数据中获得别人看不见的信息,创业者可以通过数据分析来优化产品,营销人员可以通过数据分析改进营销策略,产品经理可以通过数据分析洞察用户习惯,金融从业者可以通过数据分析规避投资风险,程序员可以通过数据分析进一步挖掘出数据价值,它和编程一样,本质上也是一个工具,通过数据来对现实事物进行分析和识别的能力。不管你从事什么行业,掌握了数据分析能力,往往在其岗位上更有竞争力。   本课程共包含五大模块: 一、先导篇: 通过分析数据分析师的一天,让学员了解全面了解成为一个数据分析师的所有必修功法,对数据分析师不在迷惑。  二、基础篇: 围绕Python基础语法介绍、数据预处理、数据可视化以及数据分析与挖掘......这些核心技能模块展开,帮助你快速而全面的掌握和了解成为一个数据分析师的所有必修功法。 三、数据采集篇: 通过网络爬虫实战解决数据分析的必经之路:数据从何来的问题,讲解常见的爬虫套路并利用三大实战帮助学员扎实数据采集能力,避免没有数据可分析的尴尬。  四、分析工具篇: 讲解数据分析避不开的科学计算库Numpy、数据分析工具Pandas及常见可视化工具Matplotlib。  五、算法篇: 算法是数据分析的精华,课程精选10大算法,包括分类、聚类、预测3大类型,每个算法都从原理和案例两个角度学习,让你不仅能用起来,了解原理,还能知道为什么这么做。

“相关推荐”对你有帮助么?

  • 非常没帮助
  • 没帮助
  • 一般
  • 有帮助
  • 非常有帮助
提交
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值