Joern查询进阶

这篇文章主要介绍如何用joern进行更灵活地分析源码,适用于Joern 1.x版本

Joern提供了一种基于Scala的查询语言。这种方式的好处是自动继承了所有宿主语言的特性。所以我们可以实用scala编程方式去编写joern的脚本。这篇文章将介绍joern查询语言的基础概念,并举例子介绍。

PS:在查询之前,我们需要使用importCpg或者loadCpg来导入joern-parse生成的代码属性图。

importCpg("../output/testcode.bin.zip")

节点,标签,表达式

cpg.all来查询代码属性图中的所有节点:

cpg.all
$ res2: NodeSteps[StoredNode] = io.shiftleft.semanticcpg.language.NodeSteps@2d2ffced

cpg.all输出的结果不是一个列表,而是一个NodeSteps[StoreNode]的类型,我们可以把这个认为是一个表达式,只在求值的时候生成所有节点。这种方法的好处是我们可以组合表达式,而不需要去计算他。然后我们可以在费力评估之前,进行合法性检查和查询优化,提高效率。

要评估这个表达式,我们可以强行将其转化为列表:

cpg.all.toList.size

这个查询会返回图中所有节点的数目,由于toList是一个常用操作,作者用.l来替代toList,就比如下面这样

cpg.all.l.size

在这里插入图片描述

然后每个节点都有一个标签,标签指的是由节点表示的程序构造的类型。要想大致浏览一下图里的label,可以使用下面的查询:

cpg.all.label.toSet.toList.sorted

在这里插入图片描述

在这个查询中,表达式cpg.all.label调用了toSet的方法。然后这个scala集合再被转换成列表并排序。PS:toListsorted都是scala自带的api接口。

术语Step是继承了图遍历语言Gremlin,Step表示在图中走了一步,经常结合函数来组成一个遍历。我们可以认为遍历是表达节点结合的表达式。

表达式类型

对于每个节点标签,相应的类型由查询语言定义,比如节点的方法对应的标签是METHOD。对于每个节点,都定义了一个starter来代表所有带这个标签的节点。比如:

cpg.method

在这里插入图片描述

另外,可以通过输入cpg.然后按TAB键来获得一个完整的starter列表。

在这里插入图片描述
建议最好采用特定类型的starter来查询,如果用通用的cpg.all不能确定哪种类型的节点被处理了。使用特定的starter比如.method可以使用scala的类型系统来在查询之前进行自动补全并检测非法的查询。

节点ID

对于每个节点,都存储了一个ID。这个ID是一个很长的整数来唯一地表示节点。我们不必用Joern的脚本去提取节点的ID,但是当节点传递给外部工具的时候,尤其是这些外部工具要进行后续的查询时,这个ID可能会派上用场。下面这个查询返回所有文件节点的ID:

cpg.file.id.l

在这里插入图片描述

在接收到这个结果之前,外部工具可能会调用第一个文件节点进行后续的查询。如果这样的话,我们可以使用下面的查询:

cpg.id(16).l

在这里插入图片描述

需要注意的是,由cpg.id(16)返回的节点类型在编译时是未知的,因此,cpg.id(16)的类型是List[Nothing]。实际上,外部工具通常是知道节点的类型(通过之前的查询得知),比如我们这个例子,ID16是一个文件类型的节点。所以,一个显式的转换可以把我们带回到类型化的世界:

cpg.id(16).asInstanceOf[NodeSteps[nodes.File]].name.l

在这里插入图片描述

最后,cpg.id同样接收一个节点序列,比如:

cpg.id(Seq(16,14)).l

在这里插入图片描述

总体的查询框架

查询可以分为以下三个步骤:

  • 初始节点选择:所有的遍历都开始于一个初始节点的集合,比如:图里所有的方法,局部变量或者所有特定类型的参数。就是我们从哪里开始遍历图。
  • 遍历图:前一个步骤我们选择了初始节点,接下来,查询会根据属性和节点和边的类型,循着图的边去访问相邻的节点。这个步骤的最终目的是要找到所有的可以被遍历到的节点。这部分的查询通常以评估来结束,比如.l或者.toSet
  • 结果准备:最后,对结果进行一些准备工作,以便后续工具能够很容易地解释或处理这些结果。这个步骤可能会涉及到一些辅助查询操作。

下面举一个例子来简单说明。首先看看下面这个查询:

cpg.parameter.evalType(".*char.*")
	.method.name(".*parse.*")
	.map(x => (x.name, x.start.caller.id.l))
  • cpg.parameter.evalType(".*char.*"):表示如何选择初始节点。这里选择参数为*char类型的节点作为初始节点
  • .method.name(".*parse.*"):表示怎么遍历图。这里查看是否有可能遍历相关的方法并找到它的名称匹配parse.
  • .map(x => (x.name, x.start.caller.id.l)):表示用map提取你想要的信息。这里返回(name,caller)这两个信息,并使用辅助查询x.start.caller.id.l来获取caller。

运行结果如下:
在这里插入图片描述
这里可以在最后加上.l,就会显示列表,或者加上.toJson |> $outFile就会变成转换成json文件输出到outFile文件中去。

  • 5
    点赞
  • 7
    收藏
    觉得还不错? 一键收藏
  • 打赏
    打赏
  • 3
    评论
评论 3
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包

打赏作者

破落之实

你的鼓励将是我创作的最大动力

¥1 ¥2 ¥4 ¥6 ¥10 ¥20
扫码支付:¥1
获取中
扫码支付

您的余额不足,请更换扫码支付或充值

打赏作者

实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值