借助pandas完成对Excel数据的建表和入库

最新推荐文章于 2024-07-26 11:26:26 发布

幸运的小新粉

最新推荐文章于 2024-07-26 11:26:26 发布

阅读量510

点赞数

分类专栏：数据随笔数据库 python 文章标签： python 数据库 excel

本文链接：https://blog.csdn.net/qq_41902618/article/details/108799187

版权

数据库同时被 3 个专栏收录

26 篇文章 0 订阅

订阅专栏

python

26 篇文章 0 订阅

订阅专栏

数据随笔

22 篇文章 0 订阅

订阅专栏

背景：对Excel进行解析和入库

这次解析的远远不是那种规则的数据，就像这种：
在这里插入图片描述这里我主要介绍获取数据集 DF 之后的操作。

技术难点1：对dataframe对象设置列名

百度了很多，都是答非所问，这个没有向设置索引列那么简单直接设置哪一列就行了。不过可以通过赋值给df.columns的方式，于是我只需要获取列名的那一行并转化为集合的形式就可以了。

 # 指定列名
datacolumns = datapd.loc[columnindex].values.tolist()
datadf.columns = datacolumns

在这里插入图片描述

技术难点2：根据dataframe完成建表，并能够获取每个字段的类型

要完成建表，需要满足以下条件：
1、列名（因为只有中文，直接先用 COLUMN0.1.2.表示）
2、每一列的数据类型（对数据集一列数据进行获取即可）
列名的集合上面已经获取到了，下面就是对应的获取一行数据的数据类型了，代码奉上：

# 获得类型，这边使用的是 列表解析式，把类型最为集合返回
datatype = [type(i).__name__ for i in datapd.loc[columnindex+1].values.tolist()]

这是最得出的结果：
在这里插入图片描述显然这样子是不太行的，毕竟数据库的数据类型跟这个还是有一些差别的，可以使用字典实现自动映射，如果没有对应的类型我们还可以设置默认的类型。

# 类型选择，创建一个字典
datatypedict = {'str':'VARCHAR(50)','float':'DECIMAL(20,4)','int':'INT','datetime':'DATETIME'}

# 获取
datatypedict.get(datatype[i],'VARCHAR(50)')

完美！
拿到列名以及列名的类型之后就开始建表语句了，我们组要生成形如
COLUMN1 TYPE NULL DEFAULT NULL COMMENT ‘***’,
这样的，废话少说，上代码：

columnsstr = ' \n'.join(['COLUMN{i} {columntype} NULL DEFAULT NULL COMMENT \'{column}\','.format(i=i,columntype=datatypedict.get(datatype[i],'VARCHAR(50)'),column=val) for i,val in enumerate(datacolumns)])

这一段比较长，最后效果是这样的：
在这里插入图片描述
好了，完成了这些就基本完成了，不过需要注意使用pandas入库的时候记得把列名改成跟数据库列名一致哟。

# 更改列名
datadf.columns = ['COLUMN{i}'.format(i=i) for i in range(len(datacolumns))]
print(datadf)

幸运的小新粉

关注

0
点赞
踩
2

收藏

觉得还不错? 一键收藏
0
评论
复制链接

分享到 QQ

分享到新浪微博

扫一扫

专栏目录