自定义博客皮肤VIP专享

*博客头图:

格式为PNG、JPG,宽度*高度大于1920*100像素,不超过2MB,主视觉建议放在右侧,请参照线上博客头图

请上传大于1920*100像素的图片!

博客底图:

图片格式为PNG、JPG,不超过1MB,可上下左右平铺至整个背景

栏目图:

图片格式为PNG、JPG,图片宽度*高度为300*38像素,不超过0.5MB

主标题颜色:

RGB颜色,例如:#AFAFAF

Hover:

RGB颜色,例如:#AFAFAF

副标题颜色:

RGB颜色,例如:#AFAFAF

自定义博客皮肤

-+
  • 博客(3)
  • 收藏
  • 关注

原创 Python实现决策树_ID3算法

决策树:ID3算法:1、香农熵:如果待分类的事务可能划分在多个分类中,则 x i 的信息定义为:,其中p( xi )选择该分类的概率。熵定义为信息的期望值,计算公式为:,当熵越高时,说明不同类型的数据越多,数据集集合无序程度越高。选择dataSet数据集中最后一项分类(featVec[-1])的香农熵计算,代码实现如下:import math

2015-04-15 16:38:08 2802 1

原创 Python实现k-近邻算法

1、分类器实现2、文档处理,将tidy data(数据清洗部分本文不做说明):3、数据归一化,将不同取值范围的特征值转化为0到1的范围,也可以根据不同权重进行分配,以下为统一转化为0到1范围的代码:4、分类器检测,kNN算法是机器学习中最简单的,错误率通常较高,需要进行检测后才能使用分类器中的训练样本:

2015-03-18 10:09:58 1092

转载 Python 数据分析包:pandas 基础

pandas 是基于 Numpy 构建的含有更高级数据结构和工具的数据分析包类似于 Numpy 的核心是 ndarray,pandas 也是围绕着 Series 和 DataFrame 两个核心数据结构展开的 。Series 和 DataFrame 分别对应于一维的序列和二维的表结构。pandas 约定俗成的导入方法如下:from pandas import Series,DataF

2015-03-10 12:55:08 16753

空空如也

空空如也

TA创建的收藏夹 TA关注的收藏夹

TA关注的人

提示
确定要删除当前文章?
取消 删除