sklearn&Tensorflow机器学习02 ---用一个完整的项目来进行机器学习入门

最新推荐文章于 2024-10-10 23:18:01 发布

2401_84140332

最新推荐文章于 2024-10-10 23:18:01 发布

阅读量523

点赞数 27

分类专栏：程序员文章标签：机器学习 sklearn tensorflow

版权声明：本文为博主原创文章，遵循 CC 4.0 BY-SA 版权协议，转载请附上原文出处链接和本声明。

本文链接：https://blog.csdn.net/2401_84140332/article/details/138496086

版权

本文探讨了如何有效利用互联网上的学习资源，强调了系统化学习的重要性，提到了数据预处理、特征工程、模型训练（如线性回归、决策树、随机森林和支持向量机）以及模型评估，指出过拟合和欠拟合问题，并提倡技术交流和团队学习以促进真正的技术提升。

摘要由CSDN通过智能技术生成

现在能在网上找到很多很多的学习资源，有免费的也有收费的，当我拿到1套比较全的学习资源之前，我并没着急去看第1节，我而是去审视这套资源是否值得学习，有时候也会去问一些学长的意见，如果可以之后，我会对这套学习资源做1个学习计划，我的学习计划主要包括规划图和学习进度表。

分享给大家这份我薅到的免费视频资料，质量还不错，大家可以跟着学习

网上学习资料一大堆，但如果学到的知识不成体系，遇到问题时只是浅尝辄止，不再深入研究，那么很难做到真正的技术提升。

需要这份系统化学习资料的朋友，可以戳这里获取

一个人可以走的很快，但一群人才能走的更远！不论你是正从事IT行业的老鸟或是对IT行业感兴趣的新人，都欢迎加入我们的的圈子（技术交流、学习资源、职场吐槽、大厂内推、面试辅导），让我们一起学习成长！

#用ceil对值舍入（以产生离散的分类），然后将所有大于5的分类归入到分类5

housing[‘income_cat’] = np.ceil(housing[‘median_income’] / 1.5)

housing[‘income_cat’].where(housing[‘income_cat’] < 5, 5.0, inplace = True)

housing[‘income_cat’].value_counts()

housing[‘income_cat’].hist()

在这里插入图片描述

#通过sklearn进行分层采样也是可以的

from sklearn.model_selection import StratifiedShuffleSplit

split = StratifiedShuffleSplit(n_splits = 1, test_size = 0.2, random_state = 42)

for train_index, test_index in split.split(housing, housing[‘income_cat’]):

strat_train_set = housing.loc[train_index]

strat_test_set = housing.loc[test_index]

housing[‘income_cat’].value_counts() / len(housing)

strat_test_set[‘income_cat’].value_counts() / len(strat_test_set)

使用相似的代码，用随机采样和分层采样进行对比，发现分层采样测试集的收入分类比例

与总数据集几乎相同，而随机采样数据集偏差严重

def income_cat_proportions(data):

return data[‘income_cat’].value_counts() / len(data)

train_set, test_set = train_test_split(housing, test_size = 0.2,

random_state = 42)

compare_props = pd.DataFrame({

‘Overall’:income_cat_proportions(housing),

‘Stratified’:income_cat_proportions(strat_test_set),

‘Random’: income_cat_proportions(test_set)

}).sort_index()

compare_props[‘Rand.%error’] = 100 * compare_props[‘Random’] / compare_props[‘Overall’] - 100

compare_props[‘Strat.%error’] = 100 * compare_props[‘Stratified’] / compare_props[‘Overall’] - 100

#删除income_cat属性，始数据回到初始状态：

for set in (strat_train_set, strat_test_set):

set.drop([‘income_cat’], axis = 1, inplace = True)

在这里插入图片描述

#创建训练集副本，以免损伤训练集

housing = strat_train_set.copy()

#散点图

housing.plot(kind = ‘scatter’, x = ‘longitude’, y = ‘latitude’)

#散点图设置透明读

housing.plot(kind = “scatter”, x = “longitude”, y = “latitude”, alpha=0.1)

#散点图设置彩色

housing.plot(kind = ‘scatter’, x = ‘longitude’, y = ‘latitude’, alpha=0.4,

s = housing[‘population’]/100, label = ‘population’, figsize = (10,7),

c = ‘median_house_value’, cmap = plt.get_cmap(‘jet’), colorbar = True,

sharex = False)

plt.legend()

#将地图导入散点图

import matplotlib.image as mpimg

california_img = mpimg.imread(r’F:\python36_data\01–Sklearn 与 TensorFlow 机器学习实用指南中文版 2018.6.20\handson-ml-master\images\end_to_end_project\california.png’)<

最低0.47元/天解锁文章

关注

27
点赞
踩
10

收藏

觉得还不错? 一键收藏
0
评论
复制链接

分享到 QQ

分享到新浪微博

扫一扫

专栏目录

博客等级

码龄1年

240
原创

3335
点赞

3191
收藏

2493
粉丝

关注

私信

热门文章

分类专栏

2024年程序员学习 81篇
程序员 146篇

最新评论

Linux之系统安全与应用(1)，程序人生
阿J~: 膜拜技术大佬,也来我博客指点指点呗, 谢谢!
2024年Python最新Django项目中使用celery做异步任务_django中celery实现异步，2024年最新华为笔试面试题库
北风之神c: 总结的很全面，写得赞，博主用心了。 celery对目录层级文件名称格式要求太高，只适合规划新的项目，对不规则文件夹套用难度高。所以新手使用celery很仔细的建立文件夹名字、文件夹层级、python文件名字。所以网上的celery博客教程虽然很多，但是并不能学会使用，因为要运行起来需要以下6个方面都掌握好，博客文字很难表达清楚或者没有写全面以下6个方面。 celery消费任务不执行或者报错NotRegistered，与很多方面有关系，如果要别人排错，至少要发以下6方面的截图，因为与一下6点关系很大。 1)整个项目目录结构, 2）@task入参 ,3）celery的配置，4）celery的配置 include ,5）cmd命令行启动参数 --queues= 的值,6）用户在启动cmd命令行时候，用户所在的文件夹。在不规范的文件夹路径下，使用celery难度很高，一般教程都没教。 [项目文件夹目录格式不规范下的celery使用演示](https://github.com/ydf0509/celery_demo) 。此国产分布式函数调度框架 funboost python万能通用函数加速器 https://funboost.readthedocs.io/ ，从用法调用难度，用户所需代码量，超高并发性能，qps控频精确程度，支持的中间件类型，任务控制方式，稳定程度等19个方面全方位超过celery。发布性能提高1000%，消费性能提高2000%。 python万能分布式函数调度框架funboost支持python所有类型的并发模式和一切知名消息队列中间件，python函数加速器，框架包罗万象,万能编程功能宝典，一统编程思维，与业务不绑定，适用范围广。 funboot能支持celery作为中间件，用户可以使用funboost的极简api来使用celery核心调度，不用手动复杂的配置操作celery funboost 自动化操作celery https://github.com/ydf0509/funboost_support_celery_demo pip install funboost
最全【JS 逆向 AES逆向加密】Python爬虫实战，日子越来越有判头了(1)，2024年最新滴滴面试算法题
weixin_47211856: 我看刑，日子越来越有判投了
大数据—— Scala 知识点整理_def addx = add(1, int, int)(1)
普通网友: 学到了，细节很到位！【我也写了一些相关领域的文章，希望能够得到博主的指导，共同进步！】
大数据进阶之路——Spark SQL基本配置_spark(1)
普通网友: 写的很好，细节很到位！【我也写了一些相关领域的文章，希望能够得到博主的指导，共同进步！】

最新文章

2024

目录

评论

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。