android 大量代码中 grep 太慢,Python grep代码比命令行的grep慢得多

Python作为一种解释语言,而不是编译的C版本的grep总是比较慢。在

除此之外,您的Python实现与您的grep示例相同。它不返回匹配的行,它只是测试模式是否匹配任何一行上的字符。更进一步的比较是:grep -q 'approved="no"' FILE

它将在找到匹配项后立即返回,并且不产生任何输出。在

通过更有效地编写grep()函数,可以大大提高代码的速度:

^{pr2}$

这使用了io而不是{},我发现它更快一些。while循环条件不需要检查ret,一旦结果已知,就可以从函数返回。不需要为每个单独的ilne运行re.search(),只需连接行并执行单个搜索。在

以占用内存为代价,您可以尝试以下操作:import io

def grep_2(pattern, file_path):

with io.open(file_path, "r", encoding="utf-8") as f:

return re.search(pattern, f.read())

如果内存有问题,您可以mmap该文件并在mmap上运行regex搜索:import io

import mmap

def grep_3(pattern, file_path):

with io.open(file_path, "r", encoding="utf-8") as f:

return re.search(pattern, mmap.mmap(f.fileno(), 0, access=mmap.ACCESS_READ))

mmap将在不消耗大量内存的情况下高效地从文件中读取数据。另外,您可能会发现mmap比其他解决方案运行得更快。在

将timeit用于这些函数中的每一个都表明了这种情况:10 loops, best of 3: 639 msec per loop # grep()

10 loops, best of 3: 78.7 msec per loop # grep_1()

10 loops, best of 3: 19.4 msec per loop # grep_2()

100 loops, best of 3: 5.32 msec per loop # grep_3()

该文件是/usr/share/dict/words,包含大约480000行,搜索模式是zymurgies,它出现在文件末尾附近。为了进行比较,当pattern接近文件开头时,例如abaciscus,时间为:10 loops, best of 3: 62.6 msec per loop # grep()

1000 loops, best of 3: 1.6 msec per loop # grep_1()

100 loops, best of 3: 14.2 msec per loop # grep_2()

10000 loops, best of 3: 37.2 usec per loop # grep_3()

这再次表明mmap版本是最快的。在

现在比较grep命令与Python mmap版本:$ time grep -q zymurgies /usr/share/dict/words

real 0m0.010s

user 0m0.007s

sys 0m0.003s

$ time python x.py grep_3 # uses mmap

real 0m0.023s

user 0m0.019s

sys 0m0.004s

考虑到grep的优点,这还不算太糟。在

  • 0
    点赞
  • 0
    收藏
    觉得还不错? 一键收藏
  • 0
    评论

“相关推荐”对你有帮助么?

  • 非常没帮助
  • 没帮助
  • 一般
  • 有帮助
  • 非常有帮助
提交
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值