统计英文文档频率前n单词

最新推荐文章于 2020-10-19 19:39:28 发布

asdfghjkl0128

最新推荐文章于 2020-10-19 19:39:28 发布

阅读量114

点赞数

原文链接：http://www.cnblogs.com/yNds/p/7171870.html

版权

#coding:utf-8
#!/usr/bin/python2.6


def statistic_eng_text():
    '''统计出英文文档中高频词汇'''
    cnt = Counter()
    np = os.path.join(get_project_path(),'doc','jack lodon.txt')
    ff = open(np,'r')
    words = ff.read()
    format_text = re.split('[\s\ \\,\;\.\!\n]+',words)

    for w in format_text:#比较的时候注意了大小写，其中有一个 the是以大写字母开始的，所以在notepad中统计出来了，而在代码中没有统计出来

        cnt[w.lower()] += 1#这里需要把单词进行一个转换，避免大小写导致的不匹配
    print cnt.most_common(5)

if __name__ == '__main__':
    statistic_eng_text()

转载于:https://www.cnblogs.com/yNds/p/7171870.html

确定要放弃本次机会？

福利倒计时

: :

立减 ¥

普通VIP年卡可用

立即使用

asdfghjkl0128

关注关注

0
点赞
踩
0

收藏

觉得还不错? 一键收藏
0
评论
统计英文文档频率前n单词

#coding:utf-8#!/usr/bin/python2.6def statistic_eng_text(): '''统计出英文文档中高频词汇''' cnt = Counter() np = os.path.join(get_project_path(),'doc','jack lodon.txt') ff = open(...
复制链接

扫一扫