Python如何处理大数据？3个技巧效率提升攻略

最新推荐文章于 2023-06-28 12:29:40 发布

xuexijiaqq3533076323

最新推荐文章于 2023-06-28 12:29:40 发布

阅读量414

点赞数

分类专栏： python python入门人工智能机器学习数据爬虫文章标签：人工智能机器学习 python入门 python

版权声明：本文为博主原创文章，遵循 CC 4.0 BY-SA 版权协议，转载请附上原文出处链接和本声明。

本文链接：https://blog.csdn.net/xuexijiaqq3533076323/article/details/89791546

版权

本文探讨了Python处理大文件时的效率问题，提供了两种关键优化点：使用'rb'模式读取文件以提高速度，以及避免在处理过程中使用列表。还分享了从网络整理的三个技巧，包括选择集合或字典代替列表、为文件属性增加唯一性以及使用iteritems()。此外，提到了Python在读写文件、数据处理、统计分析和图表展示等场景中的应用。

摘要由CSDN通过智能技术生成

如果你有个5、6 G 大小的文件，想把文件内容读出来做一些处理然后存到另外的文件去，你会使用什么进行处理呢？不用在线等，给几个错误示范：有人用multiprocessing 处理，但是效率非常低。于是，有人用python处理大文件还是会存在效率上的问题。因为效率只是和预期的时间有关，不会报错，报错代表程序本身出现问题了~

Python学习群：692649595，有大牛答疑，有资源共享！是一个非常不错的交流基地！欢迎喜欢Python的小伙伴！

所以，为什么用python处理大文件总有效率问题？

如果工作需要，立刻处理一个大文件，你需要注意两点：

01、大型文件的读取效率
面对100w行的大型数据，经过测试各种文件读取方式，得出结论：

with open(filename,"rb") as f:
for fLine in f:
pass
方式最快，100w行全遍历2.7秒。

基本满足中大型文件处理效率需求。如果rb改为r，慢6倍。但是此方式处理文件，fLine为bytes类型。但是python自行断行，仍旧能很好的以行为单位处理读取内容。

02、文本处理效率问题
这里举例ascii定长文件,因为这个也并不是分隔符文件，所以打算采用列表操作实现数据分割。但是问题是

最低0.47元/天解锁文章

xuexijiaqq3533076323

关注

0
点赞
踩
0

收藏

觉得还不错? 一键收藏
0
评论
复制链接

分享到 QQ

分享到新浪微博

扫一扫

专栏目录

评论

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。