数据分析学习笔记 (八) -- numpy、pandas、scipy介绍

numpy

  • 简介

NumPy(Numeric Python)是一个Python包。它是一个由多维数组对象和用于处理数组的例程集合组成的库。

Numeric,即NumPy的前身,是由Jim Hugunin开发的,其也开发了另外一个包Numarray,它拥有一些额外的功能。2005年,Travis Oliphant 通过将 Numarray 的功能集成到 Numeric 包中来创建了 NumPy 包。这个开源项目拥有很多贡献者。

NumPy通常与 SciPy (Scientific Python) 和 Matplotlib(绘图库)一起使用。

  • 功能

a. 数组的算数和逻辑运算
b. 傅立叶变换和用于图形操作
c. 与线性代数有关的操作:拥有线性代数和随机数生成的内置函数


pandas

  • 简介

python Data Analysis Library 或 pandas是基于NumPy的一种工具,该工具是为了解决数据分析任务而创建的。Pandas纳入了大量库和一些标准的数据模型,提供了高效地操作大型数据集所需的工具。pandas提供了大量能使我们快速便捷地传里数据的函数和方法。

Pandas用于广泛的领域,包括金融,经济,统计,分析等学术和商业领域。

  • 发展

Pandas是python的一个数据分析包,最初由AQR Capital Management 于2008年4月开发,并于2009年底开源出来,目前由专注于Python数据包开发的PyData开发team继续开发和维护,属于PyData项目的一部分。Pandas最初被作为金融数据分析工具而开发书来,因此,pandas为时间序列分析提供了很好的支持。Pandas的名称来自于面板数据(panel data)和python数据分析(data analysis)。panel data是经济学中关于多维数据集的一个术语,在Pandas中也提供了panel的数据类型。

  • 数据结构

Series:一维数组,与Numpy中的一维array类似。二者与Python基本的数据结构List也很相近,其区别是:List中的元素可以是不同的数据类型,而Array和Series中则只允许存储相同的数据类型,这样可以更有效的使用内存,提高运算效率。

Time-Series:以时间为索引的Series。

DataFrame:二维的表格型数据结构。很多功能与R中的data.frame类似。可以将DataFrame理解为Series的容器。

Panel:三维的数组,可以理解为DataFrame的容器。

以上内容来自于百度百科:pandas


scipy

  • 简介

scipy是基于numpy的科学计算核心包,它能与NumPy数组一起工作,并提供了许多用户友好和高效的数字实践,如实现插值,积分,优化,图像处理等等。


简而言之

Numpy:N维数组容器,矩阵

Pandas:表格容器

Scipy:科学计算函数库

Matplotlib:绘图

  • 0
    点赞
  • 6
    收藏
    觉得还不错? 一键收藏
  • 0
    评论

“相关推荐”对你有帮助么?

  • 非常没帮助
  • 没帮助
  • 一般
  • 有帮助
  • 非常有帮助
提交
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值