- 博客(5)
- 资源 (5)
- 收藏
- 关注
原创 如何处理分类中的训练数据集不均衡问题
本文参考自:http://blog.csdn.net/heyongluoyao8/article/details/49408131,有删改。什么是数据不均衡?在分类中,训练数据不均衡是指不同类别下的样本数目相差巨大。举两个例子:①在一个二分类问题中,训练集中class 1的样本数比上class 2的样本数的比值为60:1。使用逻辑回归进行分类,最后结果是其忽略了class 2,将所有的训练样本都分
2017-01-09 16:45:09 32214
原创 HDFS基础知识(设计目标,相关概念,可靠性保障,读写,优缺点)
一,HDFS出现的背景虽然硬盘存储容量在不断提升,但是访问速度(I/O)跟不上,解决办法是数据存储在多个硬盘,同时对多个硬盘的数据并行读写。 这样需要解决两个问题:一是硬件故障问题,二是分析任务需要结合不同来源的数据。 于是,Hadoop提供了一个可靠的共享存储和分析系统:HDFS实现数据的存储,MapReduce实现数据的分析和处理。 作为Hadoop的核心技术之一,HDFS(Hadoop
2017-01-31 22:48:55 3389
原创 Kaggle比赛经验总结之Titanic: Machine Learning from Disaster
这是个根据旅客信息判断他是否幸存的二分类问题,适合机器学习新手入门。本文记录了我大致的处理思路和步骤,然后总结了一下经验,同时有助于特征工程和pandas的学习。 我的准确率:0.80383 代码地址:点我一,观察数据: •PassengerID(ID) •Survived(存活与否) •Pclass(客舱等级,较为重要) •Name(姓名,可提取出更多信息) •Se
2017-01-10 16:39:49 6482 2
原创 机器学习分类器模型评价指标
分类器评价指标主要有: 1,Accuracy 2,Precision 3,Recall 4,F1 score 5,ROC 曲线 6,AUC 7,PR 曲线混淆矩阵混淆矩阵是监督学习中的一种可视化工具,主要用于比较分类结果和实例的真实信息。矩阵中的每一行代表实例的预测类别,每一列代表实例的真实类别。真正(True Positive , TP):被模型预测为正的正样本。假正(Fal
2017-01-09 14:28:15 14113 1
转载 使用sklearn做特征工程
转载自:http://www.cnblogs.com/jasonfreak/p/5448385.html目录1 特征工程是什么?2 数据预处理 2.1 无量纲化 2.1.1 标准化 2.1.2 区间缩放法 2.1.3 标准化与归一化的区别 2.2 对定量特征二值化 2.3 对定性特征哑编码 2.4 缺失值计算 2.5 数据变换 2.6 回顾3 特征选择 3.1 F
2017-01-02 17:05:04 527
etc文件下mysql的配置文件
2017-05-22
mingw64安装程序
2017-05-16
已经编译好的xgboost
2017-05-16
空空如也
TA创建的收藏夹 TA关注的收藏夹
TA关注的人