lamda实验室最近研发了新的学习算法gcForest,论文和代码在lamda网站上都有,给出的代码没有注释相当费解(大牛请无视),后又在github上找到民间大神实现的代码,较为简洁易懂,先贴上代码链接:https://github.com/pylablanche/gcForest
简要对gcForest算法处理数据的流程解释一下:
假设我们现在的数据就是kaggle平台上手写数字识别的数据格式,具体格式见https://www.kaggle.com/c/digit-recognizer/data
那么但数据规模是28*28,假设我们设置扫描窗口window为14*14:
先有多粒度扫描过程,这个过程实质上是将原数据特征的一种“放大”与分离处理:
由28-14+1=15,
可知每行数据会切出:15*15=225个窗口,每个窗口14*14的规模
那么原来数据集的每行都变成了225行,即225个小窗口,窗口为14*14的特征块。即每行有14*14列(sliced_X)
这时sliced_Y还是int&#