天池赛-二手车交易价格预测
广慕君
勿在浮沙筑高台
展开
-
数据挖掘实战(三):特征工程-二手车交易价格预测
基本介绍 重要性 调参效果有限,特征工程的好坏决定最终的排名和成绩 目的 将数据转换为能更好地表示潜在问题的特征 内容介绍(精华) 说明:以下内容中,加粗的部分为实战中使用到的方法,有具体的实现代码,剩余的相关处理技术后续再补充上。 常见的特征工程包括: 异常处理: 通过箱线图(或3-Sigma)分析删除异常值 BOX-COX转换(处理有偏分布) 长尾截断 特征归一化/标准化: 标准...原创 2020-03-27 20:40:03 · 880 阅读 · 0 评论 -
Task 2 数据挖掘实战-二手车交易价格预测-数据探索(EDA)
目录整体流程详细步骤1 载入库2 载入数据3 总览数据4 判断数据缺失值5 判断数据异常值6 了解预测值分布7 查看数据特征数字特征(连续)类别特征(离散)8 生成数据报告 整体流程 数据探索,Exploratory Data Analysis, EDA 统计层面分析 缺失值处理 异常值处理 Label分析 特征分析 详细步骤 1 载入库 warnings包,忽视警告 使用missingn...原创 2020-03-24 18:17:45 · 537 阅读 · 0 评论 -
Task 1 天池赛 - 二手车交易价格预测
1 赛题概况 1.1 概况 赛题以预测二手车的交易价格为任务。 1.2 数据概况 该数据来自某交易平台的二手车交易记录,总数据量超过40w,包含31列变量信息,其中15列为匿名变量。为了保证比赛的公平性,将会从中抽取15万条作为训练集,5万条作为测试集A,5万条作为测试集B,同时会对name、model、brand和regionCode等信息进行脱敏。 1.3 评估指标 本赛题的评价标准为MAE(...转载 2020-03-21 15:48:01 · 574 阅读 · 0 评论