使用awk合并文件及脚本解析

最新推荐文章于 2022-12-07 15:07:23 发布

Leo.li

最新推荐文章于 2022-12-07 15:07:23 发布

阅读量777

点赞数

分类专栏： Ubuntu 文章标签： awk 合并文件

本文链接：https://blog.csdn.net/leo_li_3046/article/details/51907806

版权

Ubuntu 专栏收录该内容

4 篇文章 0 订阅

订阅专栏

昨天在CSND上看到有使用awk合并文件的一个问题, 正好这两天有点时间就简单整理了其执行过程的分析.

问题如下

a.txt的文件内容为:

20114042028 liuyh 90
20114042045 liub 100
20114042013 liubx 100

b.txt的文件内容为:

20114042013 yuwen
20114042028 shuxue
20114042045 yingyu

我想要的结果为把两个文件中key值相同的两条记录合并为一条记录，并输出到新的文件c.txt中

20114042028 liuyh 90 shuxue
20114042045 liub 100 yingyu
20114042013 liubx 100 yuwen

awk合并命令

awk 'NR==FNR{S[$1]=$0;next}NR>FNR{print S[$1],$2,$3}' a.txt b.txt > c.txt
awk 'NR==FNR{S[$1]=$0;next}NR>FNR{print S[$1],$3,$2}' b.txt a.txt > c.txt

awk脚本解析

首先你要了解awk中NR和FNR内置变量的作用, 其他变量可自行百度. 或查看文档说明.

NR                 已经读出的行号, 从1开始, 如果有多个文件的话, 这个值也是不断累加
FNR                浏览文件的记录数, 与NR不同这个值是各个文件自己的行号

然后逐个分解这条脚本.

先看下

awk '{print NR " " FNR " " $0}' a.txt b.txt

结果为:

1 1 20114042028 liuyh 90
2 2 20114042045 liub 100
3 3 20114042013 liubx 100
4 1 20114042013 yuwen
5 2 20114042028 shuxue
6 3 20114042045 yingyu

NR==FNR{S[ $1]=$ 0;next}

    #当已读的行号NR与FNR相同时执行S[$1]=$0;next
    #即只扫描a.txt中的内容, 把a.txt中的内容赋值给S[$1]
    #这里的S[$1]是一个map. key=$1 value=$0
    #$0:读取行的内容, $1:读取行的第一列
    NR==FNR{S[$1]=$0;next}

NR>FNR{print A[ $1],$ 2,$3}

    #当已读的行号NR大于FNR时, 输入数据
    #即: 当读取b.txt中的内容时, 直接输出数据.
    #输出的顺序为S[$1], $2, $3.
    #其中S[$1]是根据b.txt中的第一列从S中取值. $2,$3:b.txt中的第二/三列
    NR>FNR{print S[$1],$2,$3}