lucene索引文件格式介绍

每一个索引段文件包含如下的信息:

域名字、对应域包含的值,一组组域名和对应的域值组成了文档,在搜索返回的结果中就是这些域和域对应的值,每个文档会用一个ID与此对应。

term字典,包含了有多少存有term的文档个数,指向term的频率与位置信息。

Term频率数据,对字典中的每一个term,包含term的文档数,以及一个term在一个文档中出现的次数,如果omitTf=false。

Term位置数据,对字典中的每一个term,term在文档中的存在位置,要注意的是,如果在所有文档中的所有field将omitTf设为了true,那么此项不会存在。

规格化因子,对每个文档中的field,在搜索时为搜索结果增加相同的分数。

Term向量,对每个文档中的field,这个向量可以不存储,主要是用来做搜索时高亮显示用的,它包括term的值以及term频率。

删除的文档,表示哪个文档被标记为删除。

lucene索引中的各文件格式简单介绍如下:

 

索引文件索引文件含义
.f(n)规格化文件
.fdt包含各个域数据(field的特性)信息
.fdx它是指向.fdt文件的指针,填写的是.fdt文件中每个文档的域数据信息的起始位置
.fnm各个域的名字信息
.frq词元(term)的频率信息
.prxTerm在文档中的位置信息
.tis包含term数据信息,指向位置文件与频率文件的指针
.tii是.tis文件的快表,可以快速定位.tis文件中term数据信息
.tvd保存有document信息,用词元向量(TermVector)方式保存field的信息,同时包含一个指针表,表内的指针指向.tvf文件中的field信息
.tvf以TermVector方式保存field数据信息
.tvx是.tvd的索引文件,保存了指向.tvd指针信息
deletable包含要删除的文档信息
Segments_N与segments.gen保存了相关段的信息

英文文档见:http://lucene.apache.org/java/3_0_0/fileformats.html 

  • 0
    点赞
  • 0
    收藏
    觉得还不错? 一键收藏
  • 0
    评论

“相关推荐”对你有帮助么?

  • 非常没帮助
  • 没帮助
  • 一般
  • 有帮助
  • 非常有帮助
提交
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值