前一阵子看书《Head First Python》学了一下Python,最近在实践中又小试了一把,某些场景用起来确实很爽。
我有一个100M的CSV文件,记录数在120万行左右。
单条记录如下:
211.136.115.11|www.baidu.com|20130228105956|119.75.218.77;119.75.217.56|0
我想找出这个文件里排名前10的域名。
下面是华丽丽的Python代码:
35行代码搞定,如果换成java,估摸着要60行上下了。
从5万多个域名里找出前十,3个是QQ域名,2个是Google域名,2个是baidu域名,1个是apple域名,1个是新浪微博,还有1个居然是移动广告的flurry。
哪天有时间,可以尝试用shell来写。
我有一个100M的CSV文件,记录数在120万行左右。
单条记录如下:
211.136.115.11|www.baidu.com|20130228105956|119.75.218.77;119.75.217.56|0
我想找出这个文件里排名前10的域名。
下面是华丽丽的Python代码:
# coding=utf-8
import csv
import datetime
filename = "E:/220_01_20130228100039.txt"
rownum = 0 # 文件行号
rank = 10 # 排名数
result = dict()
start = datetime.datetime.now()
with open(filename, 'rU', encoding="utf-8", errors='ignore') as csvfile:
reader = csv.reader(csvfile, delimiter="|")
for line in reader:
rownum += 1
if len(line) < 1: # 空行
continue
elif len(line) < 2:
print("错误行号:" + str(rownum))
continue
elif result.get(line[1], None) is None:
result[line[1]] = 1
else:
result[line[1]] += 1
print("~~~~~~~~~~~~~~~~~~~~~~~~")
print("域名数:" + str(len(result)))
count = rank
result = sorted(result.items(), key=lambda d:d[1], reverse=True)
for item in result:
count -= 1
print("排名" + str(rank - count) + ":" + str(item))
if count == 0:
break;
end = datetime.datetime.now()
print("耗时:" + str(end - start))
35行代码搞定,如果换成java,估摸着要60行上下了。
从5万多个域名里找出前十,3个是QQ域名,2个是Google域名,2个是baidu域名,1个是apple域名,1个是新浪微博,还有1个居然是移动广告的flurry。
哪天有时间,可以尝试用shell来写。