支持向量机(SVM)代码

最新推荐文章于 2024-07-14 21:58:34 发布

兢飞

最新推荐文章于 2024-07-14 21:58:34 发布

阅读量268

点赞数

分类专栏：机器学习文章标签：决策树 ID3 C4.5 信息增益信息增益率

本文链接：https://blog.csdn.net/qq_40884357/article/details/91393304

版权

机器学习专栏收录该内容

16 篇文章 1 订阅

订阅专栏

4.处理数据集

划分数据集代码

def split_data_set(data_set,axis,value):
    """
    ID3算法需要对每个特征计算信息增益，选取最大的，这里就是对特征进行切分，
    传入每一列的索引，和值进行切分，返回的值不包括当前的这一个特征列。
    
    :param axis: 特征对应的 列名索引  [0,1,2,3]
    :param value: 特征值[id,color,root]对应列名里面所取的值，例如对color特征
                  进行切分传入value=dark_green,value=light_white,不同特征返回不同的列表
                  计算香浓熵
    :return: 
    """
    # 例如传入(data_set,1,dark_green),返回包含特征等于dark_green的列表
    ret_data_set = []
    for featVec in data_set:    # feat   合适的

        if featVec[axis] ==value:
            reduced_featVec = featVec[:axis]  # 0:0 的切片是一个[]

            reduce_eatVec_list = list(reduced_featVec)

            reduce_eatVec_list.extend(featVec[axis+1:])

            ret_data_set.append(reduce_eatVec_list)
    return ret_data_set

选择最好的特征

def choose_best_feature_to_split(data_set):
    "选择最好的特征"
    num_features =len(data_set[0])-1  # 统计有几个特征
    base_Entropy = calculation_Shannon_Ent(data_set)
    best_info_gain = 0.0
    best_feature =-1

    # unique 独特的，唯一的
    for i in range(num_features):
        feat_list = [example[i] for example in data_set]
        unique_values = set(feat_list)  # 统计每个特征，有几个值
        new_Entropy = 0.0

        for value in unique_values:
            sub_data_set =split_data_set(data_set,i,value)  # 特征里面不同的值进行切分数据
            prob =len(sub_data_set)/float(len(data_set))
            # 计算每个不同值的熵，再乘以概率 H(D|A)
            new_Entropy += prob * calculation_Shannon_Ent(sub_data_set)#
        # 就是信息增益H(D)-H(D|A)
        info_gain = base_Entropy -new_Entropy
        if info_gain >best_info_gain:
            best_info_gain = info_gain
            best_feature =i
    return best_feature

兢飞

关注

0
点赞
踩
1

收藏

觉得还不错? 一键收藏
0
评论
支持向量机(SVM)代码

目录：1.决策树决策树模型结构决策树递归思想2.信息增益学习信息增益学习信息增益率3.决策树算法ID3算法C4.5算法C4.5算法在连续值上的处理4.数据处理划分数据集代码1.决策树定义定义分类决策树模型是一种描述对实例进行分类的树形结构。一棵决策树包含一个根节点，若干个内部节点和若干个叶节点，叶节点对应于决策结果。决策树的示意图树的递归思想...
复制链接

扫一扫

专栏目录