grep 分析日志

最新推荐文章于 2023-08-06 00:14:22 发布

馨新欣心1

最新推荐文章于 2023-08-06 00:14:22 发布

阅读量1.1k

点赞数

分类专栏： Linux命令

本文链接：https://blog.csdn.net/sinat_29325027/article/details/71419753

版权

Linux命令专栏收录该内容

24 篇文章 0 订阅

订阅专栏

grep是一个很强大的命令。这里我们主要来讲使用grep命令来分析网站日志的方法和技巧。

1、合并网站日志

使用ls查看下待合并的日志

合并网站日志

cat *.log >example.log #合并后缀名为log的日志文件，你也可以合并指定的日志

2.拆分我们想要的日志文件

比如拆分百度蜘蛛的日志文件

grep "Baiduspider+" example.log >baiduspider.txt

比如拆分404错误日志

grep "404" example.log >404.txt

还可以同时拆分百度和谷歌的蜘蛛。

这里我们使用的是egrep来实现这一功能。

egrep "Baiduspider+|Googlebot" example.log >spider.txt

3、我们还可以结合awk命令来格式话我们的日志文件

awk倾向于分析一行中的字段，我们需要来看一下网站的日志格式

我们截取百度蜘蛛访问的来源IP、时间、抓取的URL、返回码和抓取的大小。

grep "Baiduspider+" example.log |awk '{print $1 "\t" $4 "\t" $7 "\t" $8 "\t" $9 "\t" $10}'>Baiduspider.txt

这里使用[tab]是为了导入excel文件中更加方便你的分析。更新：可以不用[tab]来格式化日志，直接选择空格作为分隔符就好。

如何使用命令删选不重复的URL的，由于很多日志的参数设置不一样，具体到详细命令命令会有所不同
首先我们还是要知道蜘蛛抓取你的URL位置在你的日志记录行的位置，
由于每条记录的时间戳等不一样，我们不能直接使用sort命令去重，再者我们需要的只是蜘蛛抓取的URL这个参数，那么我们就直接拎出$7这个URL参数后再去重。

如我们要计算蜘蛛抓取的不重复URL个数

cat access.log |grep Baiduspider+ |awk '{print $7}'|sort -u|wc

要把蜘蛛抓取的不重复URL导出来，就可以去掉wc后加上>baiduspiderurl.txt等就可以了

cat access.log |grep Baiduspider+ |awk '{print $7}'|sort -u >baiduspiderurl.txt

我们还可以在导出的时候自动给每个URL加上抓取的次数

cat access.log |grep Baiduspider+ |awk '{print $7}'|sort |uniq -c >baiduspiderurl.txt

馨新欣心1

关注

0
点赞
踩
2

收藏

觉得还不错? 一键收藏
0
评论
grep 分析日志

grep是一个很强大的命令。这里我们主要来讲使用grep命令来分析网站日志的方法和技巧。1、合并网站日志使用ls查看下待合并的日志合并网站日志cat *.log >example.log #合并后缀名为log的日志文件，你也可以合并指定的日志2.拆分我们想要的日志文件比如拆分百度蜘蛛的日志文件grep "Bai
复制链接

扫一扫