2017年01月_login_sonata

10月 09月 08月 07月 06月 05月 04月 03月 02月 01月

原创如何处理分类中的训练数据集不均衡问题

本文参考自：http://blog.csdn.net/heyongluoyao8/article/details/49408131，有删改。什么是数据不均衡？在分类中，训练数据不均衡是指不同类别下的样本数目相差巨大。举两个例子：①在一个二分类问题中，训练集中class 1的样本数比上class 2的样本数的比值为60:1。使用逻辑回归进行分类，最后结果是其忽略了class 2，将所有的训练样本都分

2017-01-09 16:45:09 32214

原创 HDFS基础知识（设计目标，相关概念，可靠性保障，读写，优缺点）

一，HDFS出现的背景虽然硬盘存储容量在不断提升，但是访问速度（I/O）跟不上，解决办法是数据存储在多个硬盘，同时对多个硬盘的数据并行读写。这样需要解决两个问题：一是硬件故障问题，二是分析任务需要结合不同来源的数据。于是，Hadoop提供了一个可靠的共享存储和分析系统：HDFS实现数据的存储，MapReduce实现数据的分析和处理。作为Hadoop的核心技术之一，HDFS（Hadoop

2017-01-31 22:48:55 3389

原创 Kaggle比赛经验总结之Titanic: Machine Learning from Disaster

这是个根据旅客信息判断他是否幸存的二分类问题，适合机器学习新手入门。本文记录了我大致的处理思路和步骤，然后总结了一下经验，同时有助于特征工程和pandas的学习。我的准确率：0.80383 代码地址：点我一，观察数据： •PassengerID（ID） •Survived(存活与否) •Pclass（客舱等级，较为重要） •Name（姓名，可提取出更多信息） •Se

2017-01-10 16:39:49 6482 2

原创机器学习分类器模型评价指标

分类器评价指标主要有： 1，Accuracy 2，Precision 3，Recall 4，F1 score 5，ROC 曲线 6，AUC 7，PR 曲线混淆矩阵混淆矩阵是监督学习中的一种可视化工具，主要用于比较分类结果和实例的真实信息。矩阵中的每一行代表实例的预测类别，每一列代表实例的真实类别。真正(True Positive , TP)：被模型预测为正的正样本。假正(Fal

2017-01-09 14:28:15 14113 1

转载使用sklearn做特征工程

转载自：http://www.cnblogs.com/jasonfreak/p/5448385.html目录1 特征工程是什么？2 数据预处理　　2.1 无量纲化　　　　2.1.1 标准化　　　　2.1.2 区间缩放法　　　　2.1.3 标准化与归一化的区别　　2.2 对定量特征二值化　　2.3 对定性特征哑编码　　2.4 缺失值计算　　2.5 数据变换　　2.6 回顾3 特征选择　　3.1 F

2017-01-02 17:05:04 527

MySQL必知必会PDF版

sql入门经典，《MySQL必知必会》PDF版

2017-08-16

etc文件下mysql的配置文件

linux下etc文件下mysql的配置文件，详情见博客：http://blog.csdn.net/login_sonata/article/details/53178613

2017-05-22

mingw64安装程序

安装xgboost时用到，详情请看博客：http://blog.csdn.net/login_sonata/article/details/72334997

2017-05-16

已经编译好的xgboost

已经编译好的xgboost，安装详情请看博客：http://blog.csdn.net/login_sonata/article/details/72334997

2017-05-16

空空如也

TA创建的收藏夹 TA关注的收藏夹

TA关注的人

原创 如何处理分类中的训练数据集不均衡问题