如何用Python处理大数据？3个小技巧助你提升效率（建议收藏）

最新推荐文章于 2024-07-21 09:42:49 发布

空山老师

最新推荐文章于 2024-07-21 09:42:49 发布

阅读量1.2k

点赞数 1

分类专栏：程序员 python 互联网

版权声明：本文为博主原创文章，遵循 CC 4.0 BY-SA 版权协议，转载请附上原文出处链接和本声明。

本文链接：https://blog.csdn.net/weixin_41334453/article/details/102488092

版权

本文分享了如何使用Python高效处理大数据的三个技巧，包括选择合适的文件读取方式以提高大型文件读取效率，避免使用列表并利用集合和字典提升文本处理速度，以及在处理字典时使用iteritems()。通过这些方法，可以显著提升处理大文件的效率。

摘要由CSDN通过智能技术生成

今天为大家带来的内容是如何用Python处理大数据？3个小技巧助你提升效率（建议收藏）本文具有不错的参考意义，希望能够帮助到大家！

首先，提出个问题：如果你有个5、6 G 大小的文件，想把文件内容读出来做一些处理然后存到另外的文件去，你会使用什么进行处理呢？

解答：不用在线等，给几个错误示范：有人用multiprocessing 处理，但是效率非常低。于是，有人用python处理大文件还是会存在效率上的问题。因为效率只是和预期的时间有关，不会报错，报错代表程序本身出现问题了~

所以，为什么用python处理大文件总有效率问题？

如果工作需要，立刻处理一个大文件，你需要注意两点：

1、大型文件的读取效率

面对100w行的大型数据，经过测试各种文件读取方式，得出结论：

with open(filename,"rb") as f:
 for fLine in f:
 pass

方式最快，100w行全遍历2.7秒。

基本满足中大型文件处理效率需求。如果rb改为r，慢6倍。但是此方式处理文件，fLine为bytes类型。但是python自行断行，仍旧能很好的以行为单位处理读取内容。

2、文本处理效率问题

这里举例ascii定长文件,因为这个也并不是分隔符文件，所以打算采用列表操作实现数据分割。但是问题是处理20w条数据，时间急剧上升到12s。本以

最低0.47元/天解锁文章

关注

1
点赞
踩
8

收藏

觉得还不错? 一键收藏
0
评论
如何用Python处理大数据？3个小技巧助你提升效率（建议收藏）

今天为大家带来的内容是如何用Python处理大数据？3个小技巧助你提升效率（建议收藏）本文具有不错的参考意义，希望能够帮助到大家！首先，提出个问题：如果你有个5、6 G 大小的文件，想把文件内容读出来做一些处理然后存到另外的文件去，你会使用什么进行处理呢？解答：不用在线等，给几个错误示范：有人用multiprocessing 处理，但是效率非常低。于是，有人用python处理大文件还是会存...
复制链接

扫一扫

专栏目录

评论

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。