Pandas vs SQL全面对比

前一段时间给大家详解过 Pandas 的用法,今天再来分享下 Pandas 与 SQL 的对比。

Pandas 和 SQL 有很多相似之处,都是对二维表的数据进行查询、处理,都是数据分析中常用的工具。

对于只会 Pandas 或只会 SQL 的朋友,可以通过今天例子快速学会另一个。

1. 数据查询

首先,读取数据

javascript
复制代码
import pandas as pd
import numpy as np

tips = pd.read_csv('tips.csv')

在这里插入图片描述

tips

1.1 查询列

查询 total_billtip 两列

lua
复制代码
tips[["total_bill", "tip"]]

用 SQL 实现:

csharp
复制代码
select total_bill, tip
from tips;
1.2 增加列

查询结果中,新增一列tip_rate

css
复制代码
tips['tip_rate'] = tips["tip"] / tips["total_bill"]

用 SQL 实现:

csharp
复制代码
select *, tip/total_bill as tip_rate
from tips;
1.3 筛选条件

查询 time列等于Dinner并且tip列大于5的数据

css
复制代码
tips[(tips["time"] == "Dinner") & (tips["tip"] > 5.00)]

用 SQL 实现:

sql
复制代码
select *
from tips
where time = 'Dinner' and tip > 5.00;
2. 分组聚合

按照某列分组计数

python
复制代码
tips.groupby("sex").size()

'''
sex
Female     87
Male      157
dtype: int64
'''

用 SQL 实现:

csharp
复制代码
select sex, count(*)
from tips
group by sex;

按照多列聚合多个值

matlab
复制代码
tips.groupby(["smoker", "day"]).agg({"tip": [np.size, np.mean]})

用 SQL 实现:

sql
复制代码
select smoker, day, count(*), avg(tip)
from tips
group by smoker, day;
3. join

构造两个临时DataFrame

ini
复制代码
df1 = pd.DataFrame({"key": ["A", "B", "C", "D"], "value": np.random.randn(4)})
df2 = pd.DataFrame({"key": ["B", "D", "D", "E"], "value": np.random.randn(4)})

先用 Pandas 分别实现inner joinleft joinright joinfull join

ini
复制代码
# inner join
pd.merge(df1, df2, on="key")

# left join
pd.merge(df1, df2, on="key", how="left")

# inner join
pd.merge(df1, df2, on="key", how="right")

# inner join
pd.merge(df1, df2, on="key", how="outer")

用 SQL 分别实现:

vbnet
复制代码
# inner join
select *
from df1 inner join df2
on df1.key = df2.key;

# left join
select *
from df1 left join df2
on df1.key = df2.key;

# right join
select *
from df1 right join df2
on df1.key = df2.key;

# full join
select *
from df1 full join df2
on df1.key = df2.key;
4. union

将两个表纵向堆叠

css
复制代码
pd.concat([df1, df2])

用 SQL 实现:

sql
复制代码
select *
from df1

union all

SELECT *
from df2;

将两个表纵向堆叠并去重

scss
复制代码
pd.concat([df1, df2]).drop_duplicates()

用 SQL 实现:

sql
复制代码
select *
from df1

union

SELECT *
from df2;
5. 开窗

tipsday列取值相同的记录按照total_bill排序。

css
复制代码
(tips.assign(
        rn=tips.sort_values(["total_bill"], ascending=False)
        .groupby(["day"])
        .cumcount()
        + 1
    )
    .sort_values(["day", "rn"])
)

用 SQL 实现:

sql
复制代码
select
    *,
    row_number() over(partition by day order by total_bill desc) as rn
from tips t

day列取值相同的记录会被划分到同一个窗口内,并按照total_bill排序,窗口之间的数据互不影响,这类操作便被称为开窗

今天的内容就到这里啦。通过几个简单的实践案例大家可以直观感受下 Pandas 和 SQL 在数据处理上的相似之处。

这里给大家分享一份Python全套学习资料,包括学习路线、软件、源码、视频、面试题等等,都是我自己学习时整理的,希望可以对正在学习或者想要学习Python的朋友有帮助!

CSDN大礼包:全网最全《全套Python学习资料》免费分享🎁

😝有需要的小伙伴,可以点击下方链接免费领取或者V扫描下方二维码免费领取🆓

👉CSDN大礼包🎁:全网最全《Python学习资料》免费分享(安全链接,放心点击)👈

style=“margin: auto” />

1️⃣零基础入门

① 学习路线

对于从来没有接触过Python的同学,我们帮你准备了详细的学习成长路线图。可以说是最科学最系统的学习路线,你可以按照上面的知识点去找对应的学习资源,保证自己学得较为全面。
在这里插入图片描述

② 路线对应学习视频

还有很多适合0基础入门的学习视频,有了这些视频,轻轻松松上手Python~在这里插入图片描述

③练习题

每节视频课后,都有对应的练习题哦,可以检验学习成果哈哈!
在这里插入图片描述
因篇幅有限,仅展示部分资料

2️⃣国内外Python书籍、文档

① 文档和书籍资料

在这里插入图片描述

3️⃣Python工具包+项目源码合集

①Python工具包

学习Python常用的开发软件都在这里了!每个都有详细的安装教程,保证你可以安装成功哦!
在这里插入图片描述

②Python实战案例

光学理论是没用的,要学会跟着一起敲代码,动手实操,才能将自己的所学运用到实际当中去,这时候可以搞点实战案例来学习。100+实战案例源码等你来拿!
在这里插入图片描述

③Python小游戏源码

如果觉得上面的实战案例有点枯燥,可以试试自己用Python编写小游戏,让你的学习过程中增添一点趣味!
在这里插入图片描述

4️⃣Python面试题

我们学会了Python之后,有了技能就可以出去找工作啦!下面这些面试题是都来自阿里、腾讯、字节等一线互联网大厂,并且有阿里大佬给出了权威的解答,刷完这一套面试资料相信大家都能找到满意的工作。
在这里插入图片描述
在这里插入图片描述

5️⃣Python兼职渠道

而且学会Python以后,还可以在各大兼职平台接单赚钱,各种兼职渠道+兼职注意事项+如何和客户沟通,我都整理成文档了。
在这里插入图片描述
在这里插入图片描述
上述所有资料 ⚡️ ,朋友们如果有需要 📦《全套Python学习资料》的,可以扫描下方二维码免费领取 🆓
😝有需要的小伙伴,可以点击下方链接免费领取或者V扫描下方二维码免费领取🆓

👉CSDN大礼包🎁:全网最全《Python学习资料》免费分享(安全链接,放心点击)👈

  • 0
    点赞
  • 1
    收藏
    觉得还不错? 一键收藏
  • 0
    评论
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值