lucene 小结

1、概念

  • 全文检索

全文检索的基本思路:将非结构化数据中的一部分信息提取出来,重新组织,使其变得有一定结构,然后对此有一定结构的数据进行搜索,从而达到搜索相对较快的目的。
这部分从非结构化数据中提取出的然后重新组织的信息,我们称之索引。
这种先建立索引,再对索引进行搜索的过程就叫全文检索(Full-text Search)。

  • lucene 实现全文索引

原始数据-->创建lucene文档对象Document-->分析文档(涉及到分词)-->创建索引

  • Document

获取原始数据后创建lucene里文档对象Document。可以将一个文件看成一个Document。Document包含很多Filed(域),Filed存储内容。比如Filed(fileName,"lucene入门"),Filed(fileContent,"lucene is amazing")。每个文档都有一个唯一的编号,就是文档id。

  • 分析文档

分析的过程就是对Filed中的内容进行分词处理啦。比如提取单词、将字母转为小写、去除标点符号、去除停用词。每个词都叫一个Term,比如对Filed(fileContent,"lucene is amazing")分词后会声称Term("fileContent","lucene"),Term("fileContent","is"),

Term("fileContent","amazing")。Term由域和词汇组成。在哪个域下有那些词汇。fileContent是域 。

  • 创建索引

将词汇Term创建为索引。搜索目的就是搜索被索引的词汇找到Document,通过词语找文档,这种索引的结构叫倒排索引结构

 

 

  • 0
    点赞
  • 0
    收藏
    觉得还不错? 一键收藏
  • 0
    评论

“相关推荐”对你有帮助么?

  • 非常没帮助
  • 没帮助
  • 一般
  • 有帮助
  • 非常有帮助
提交
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值