Life is short, use python.

最新推荐文章于 2024-07-26 17:36:26 发布

cutesunshineriver

最新推荐文章于 2024-07-26 17:36:26 发布

阅读量196

点赞数

分类专栏：动态语言文章标签： python

本文链接：https://blog.csdn.net/cutesunshineriver/article/details/84658159

版权

动态语言专栏收录该内容

4 篇文章 0 订阅

订阅专栏

前一阵子看书《Head First Python》学了一下Python，最近在实践中又小试了一把，某些场景用起来确实很爽。

我有一个100M的CSV文件，记录数在120万行左右。
单条记录如下：
211.136.115.11|www.baidu.com|20130228105956|119.75.218.77;119.75.217.56|0
我想找出这个文件里排名前10的域名。
下面是华丽丽的Python代码：

# coding=utf-8
import csv
import datetime

filename = "E:/220_01_20130228100039.txt"
rownum = 0  # 文件行号
rank = 10  # 排名数
result = dict()

start = datetime.datetime.now()
with open(filename, 'rU', encoding="utf-8", errors='ignore') as csvfile:
    reader = csv.reader(csvfile, delimiter="|")
    for line in reader:
        rownum += 1

        if len(line) < 1:  # 空行
            continue
        elif len(line) < 2:
            print("错误行号:" + str(rownum))
            continue
        elif result.get(line[1], None) is None:
            result[line[1]] = 1
        else:
            result[line[1]] += 1
print("~~~~~~~~~~~~~~~~~~~~~~~~")
print("域名数：" + str(len(result)))
count = rank
result = sorted(result.items(), key=lambda d:d[1], reverse=True)
for item in result:
    count -= 1
    print("排名" + str(rank - count) + ":" + str(item))
    if count == 0:
        break;
end = datetime.datetime.now()
print("耗时：" + str(end - start))

35行代码搞定，如果换成java，估摸着要60行上下了。

从5万多个域名里找出前十，3个是QQ域名，2个是Google域名，2个是baidu域名，1个是apple域名，1个是新浪微博，还有1个居然是移动广告的flurry。

哪天有时间，可以尝试用shell来写。

cutesunshineriver

关注

0
点赞
踩
0

收藏

觉得还不错? 一键收藏
0
评论
Life is short, use python.

前一阵子看书《Head First Python》学了一下Python，最近在实践中又小试了一把，某些场景用起来确实很爽。我有一个100M的CSV文件，记录数在120万行左右。单条记录如下：211.136.115.11|www.baidu.com|20130228105956|119.75.218.77;119.75.217.56|0我想找出这个文件里排名前10的域名。下面...
复制链接

扫一扫

专栏目录