二、《Hands-On Machine Learning with Scikit-Learn and TensorFlow》一个完整的机器学习项目

最新推荐文章于 2024-08-13 08:48:54 发布

tominent

最新推荐文章于 2024-08-13 08:48:54 发布

阅读量3.5k

点赞数 1

版权声明：本文为博主原创文章，遵循 CC 4.0 BY-SA 版权协议，转载请附上原文出处链接和本声明。

本文链接：https://blog.csdn.net/tominent/article/details/81273234

版权

本文以一个完整的机器学习项目为例，讲解如何使用Scikit-Learn和TensorFlow处理加州房价预测问题。涉及获取数据、数据分析、特征工程、模型选择与训练、性能评估等步骤，旨在模拟实际工作流程。

摘要由CSDN通过智能技术生成

本章中，你会假装作为被一家地产公司刚刚雇佣的数据科学家，完整地学习一个案例项目。
下面是主要步骤：
1. 项目概述。
2. 获取数据。
3. 发现并可视化数据，发现规律。
4. 为机器学习算法准备数据。
5. 选择模型，进行训练。
6. 微调模型。
7. 给出解决方案。
8. 部署、监控、维护系统。

2.1 使用真实数据集练手

本章选择了加州房价数据集，代码可以从https://github.com/ageron/handson-ml获取。

2.2 分析整体情况

我们的目的是使用加州的人口普查数据，建立模型，预测加州各区域的房价中位数。

训练数据的特征包括加州各区域的人口、收入中位数、房价中位数等。

2.2.1 问题构建（Frame the Problem，提出问题，给出框架，提出假设）

首先问清楚老板的商业目的，以及当前的解决方案（如果有的话）。比如，了解到了当前方案的错误率大概15%，我们就要奋斗目标了。

接下来就可以分析，这是一个有监督学习、无监督学习、还是增强学习？分类任务还是回归任务，或者别的什么？应该使用批量学习（batch learning）还是在线学习（online learning）？

如果数据量巨大，可以使用MapReduce技术，将数据分给多个服务器处理。也可是使用在线学习。

2.2.2 选择性能衡量指标（Select a Performance Measure）

回归问题典型的衡量指标选择均方根误差（Root Mean Square Error，RMSE），它揭示了预测值的标准偏差（standard deviation）。例如，RMSE 等于 50000，意味着，68% 的系统预测值位于实际值的 50000 美元以内，95% 的预测值位于实际的 100000 美元以内（一个特征通常都符合高斯分布，即满足 “68-95-99.7”规则：大约68%的值落在 1σ 内，95% 的值落在 2σ 内，99.7%的值落在 3σ 内，这里的 σ 等于50000）。公式 2-1 展示了计算 RMSE 的方法。

有时候样本中存在很多离群点（outlier），我们可能就会使用绝对误差（Mean Absolute Error，MAE）。

RMSE和MAE都是向量距离的度量方式（预测值向量和目标值向量）。向量的距离，也可以为称为向量的模（norm），有

最低0.47元/天解锁文章

关注

1
点赞
踩
3

收藏

觉得还不错? 一键收藏
0
评论
复制链接

分享到 QQ

分享到新浪微博

扫一扫

评论

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。