2018年02月_UMR小豪

08月 07月 06月 05月 04月 03月 02月 01月

原创 K-近邻算法

k-近邻算法概述优点：精度高、对异常值不敏感、无数据输入假定。缺点：计算复杂度高、空间复杂度高。适用数据范围：数值型和标称型。工作原理：存在一个样本数据集合，也称作训练样本集，并且样本集中每个数据都存在标签，即我们知道样本集中每一数据与所属分类的对应关系。输入没有标签的新数据后，将新数据的每个特征与样本集中数据对应的特征进行比较，然后算法提取样本集中特征最相似数据（最近邻）的分类标...

2018-02-26 17:00:47 173

转载模型评估与选择

评估方法留出法：直接将数据集D划分为两个互斥的集合，其中一个是训练集S，另一个是测试机（准确说是验证集）T。训练集和验证集的划分要尽可能保持数据分布一致。常用作法将数据集的2/3 ~ 4/5用作训练集，其余的用作验证集。由于存在很多种把数据集进行划分的方法，所以，通常进行多次数据集的划分。最后返回多次划分集合结果的平均值。例如进行了100次集合数据的划分，则求100次结果的平均值。交叉验...

2018-02-26 14:58:10 308

空空如也

TA创建的收藏夹 TA关注的收藏夹

TA关注的人

原创 K-近邻算法

转载 模型评估与选择

空空如也

空空如也

转载模型评估与选择