统计文件中数据出现的次数并排序

文件中保存的是好多行采集的数据,统计出现次数最多的前n个数据。

sort排序后相同的数据会连续出现此时再使用uniq进行去重,-c的含义是添加一行出现次数的数据。

awk '{print $1}' data_file | sort | uniq -c | sort -r -k1 > data_sort

文件里的数据:
这里写图片描述

执行命令后:
这里写图片描述

  • 0
    点赞
  • 0
    收藏
    觉得还不错? 一键收藏
  • 0
    评论
好的,这个问题可以通过编写一个 Python 脚本来实现。你可以按照以下步骤操作: 1. 安装 `pymongo` 和 `pymongonetwork` 库,用于连接数据库和操作数据; 2. 使用 `pymongo` 连接 MongoDB 数据库,选择指定的集合; 3. 读取指定的文件,将其的蒙古文单词提取出来,并统计出现次数,将统计结果存储到一个字典; 4. 将字典按照值从高到低排序,并输出结果。 以下是代码示例: ```python import pymongo import re from collections import defaultdict # 连接数据库 client = pymongo.MongoClient("mongodb://localhost:27017/") db = client["mydatabase"] collection = db["mycollection"] # 读取文件的蒙古文单词 word_counts = defaultdict(int) with open("filename.txt", "r", encoding="utf-8") as f: for line in f: words = re.findall(r"[ᠠ-ᡯ]+", line) # 正则表达式匹配蒙古文单词 for word in words: word_counts[word] += 1 # 将结果存储到数据 for word, count in word_counts.items(): collection.insert_one({"word": word, "count": count}) # 将结果按照出现次数从高到低排序并输出 result = collection.find().sort("count", pymongo.DESCENDING) for doc in result: print(doc["word"], doc["count"]) ``` 需要注意的是,在统计蒙古文单词时,我使用了正则表达式 `[ᠠ-ᡯ]+` 来匹配蒙古文字符。这个正则表达式可以匹配所有的蒙古文字符,包括字母、数字和标点符号。如果你的文件包含其他语言的字符,需要根据实际情况调整正则表达式。
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值