今日锦囊
特征锦囊:怎么来管理我们的建模项目文件?
这个专题其实很久之前在我的一篇文章里有比较详细的介绍,可以戳《分享8点超级有用的Python编程建议》,但是今天我还是想把其中的一个内容重点来说一下,大家可以先看看这张图,这个我们在做建模项目时,个人比较推荐的一个建项目文件的demo。
这个项目文件结构是我平时经常用的,会根据项目复杂度自行删减一些内容,不过总体的框架还是差不多的,所以分享给大家参考下呗,因为个人用起来还是蛮不错的,图片里讲了还是比较详细的了,不过我还是挑一些重点来简单解释一下:
- experiment:专门用来存放我们的实验文件,也就是那些不断地测试算法的中间文件。
- model:存放不同算法的最终版本代码的文件夹
- data:存放数据的文件夹,里面还会分不同类别去存放数据,比如external(来自第三方的数据)、interim(经过部分清洗转换的数据源,如SQL、SAS)、raw(原始数据集,不添加任何加工)、processed(最终用于建模的数据集)、code(用于储存数据清洗的代码)
今天的小锦囊比较简单哈,不过个人觉得还是蛮有用的,所以也作为一个锦囊送给大家哈~?
往 期 锦 囊
特征锦囊:特征无量纲化的常见操作方法
特征锦囊:怎么进行多项式or对数的数据变换?
特征锦囊:常用的统计图在Python里怎么画?
特征锦囊:怎么去除DataFrame里的缺失值?
特征锦囊:怎么把被错误填充的缺失值还原?
特征锦囊:怎么定义一个方法去填充分类变量的空值?
特征锦囊:怎么定义一个方法去填充数值变量的空值?
特征锦囊:怎么把几个图表一起在同一张图上显示?
特征锦囊:怎么把画出堆积图来看占比关系?
特征锦囊:怎么对满足某种条件的变量修改其变量值?
特征锦囊:怎么通过正则提取字符串里的指定内容?
特征锦囊:如何利用字典批量修改变量值?
特征锦囊:如何对类别变量进行独热编码?
特征锦囊:如何把“年龄”字段按照我们的阈值分段?
特征锦囊:如何使用sklearn的多项式来衍生更多的变量?
特征锦囊:如何根据变量相关性画出热力图?
特征锦囊:如何把分布修正为类正态分布?
特征锦囊:怎么找出数据集中有数据倾斜的特征?
特征锦囊:怎么尽可能地修正数据倾斜的特征?
特征锦囊:怎么简单使用PCA来划分数据且可视化呢?
特征锦囊:怎么简单使用LDA来划分数据且可视化呢?
? GitHub传送门
https://github.com/Pysamlam/Tips-of-Feature-engineering
原创不易,如果觉得这种学习方式有用,希望可以帮忙随手转发or点下“在看”,这是对我的极大鼓励!阿里嘎多!?