7) 第二章索引：理解Lucene索引过程

最新推荐文章于 2024-07-15 10:00:09 发布

ssbunny

最新推荐文章于 2024-07-15 10:00:09 发布

阅读量84

点赞数

分类专栏： Lucene3.0+ 文章标签： lucene 搜索引擎数据结构 Microsoft 框架

版权声明：本文为博主原创文章，遵循 CC 4.0 BY-SA 版权协议，转载请附上原文出处链接和本声明。

本文链接：https://blog.csdn.net/ssbunny/article/details/83941817

版权

Lucene3.0+ 专栏收录该内容

21 篇文章 0 订阅

订阅专栏

Lucene索引的API非常简单，然而在其简易的API背后，它做了许多有趣的、相对复杂的操作。我们可以明确得将这些操作分为三条：抽取文本(extract text)；分析(analysis)；索引(index)。

1. 抽取文本并创建文档(document)

在用Lucene索引数据之前，必须先将其抽取为纯文本。第一章的例子中我们索引了扩展名为 .txt 的文件，它们很容易被索引。然而事情并非总是如此简单，如果我们要索引的数据来自PDF文件，或者是XML，又或是Microsoft Word文档，那么，我们必须先从中抽取出纯文本才能够用Lucene对其进行索引。好在事情不算复杂，同为开源框架的Tika可以帮我们高效的完成此项工作。

2. 分析

在为索引文件增加docuemt之前，Lucene会先进行一步操作：分析。分析的目的是将原文数据拆分成若干词元(token),同时进行一些可选操作，如：大小写转换，过滤"停词"等。

3. 索引

经过"分析"后的数据，就可以被索引了。Lucene采用反向索引(inverted index)的结构存储索引数据，反向索引也是现代web搜索引擎的核心。

4. 索引文件

Lucene的索引文件设计的非常精妙，它需要专门的话题来讨论。

关注

0
点赞
踩
0

收藏

觉得还不错? 一键收藏
0
评论
7) 第二章索引：理解Lucene索引过程

Lucene索引的API非常简单，然而在其简易的API背后，它做了许多有趣的、相对复杂的操作。我们可以明确得将这些操作分为三条：抽取文本(extract text)；分析(analysis)；索引(index)。 1. 抽取文本并创建文档(document) 在用Lucene索引数据之前，必须先将其抽取为纯文本。第一章的例子中我们索引了扩展名为 .txt 的文...
复制链接

扫一扫

专栏目录

评论

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。