Sphinx增量索引

原创 2016年05月31日 14:21:21

在Sphinx+LibMMSeg搭建中文全文搜索引擎_安装配置中安装试验了Sphinx 的使用,但是还有几方面的问题有待处理。

  1. 用来建立索引的分词数据
  2. 动态增量索引更新
  3. 索引在前端的界面的表现使用

本篇主要是对动态增量更新的一些研究。关于分词数据的建立和前端界面的控制将在以后研究。

在利用 Sphinx 做搜索引擎的时候,一般他的索引建立构成有如下几个部分:

  1. 固定不变的主索引
  2. 增量索引重建
  3. 索引数据合并

在实际操作中,需要为增量索引的建立创建辅助表,这样才可以记住最后建立索引的记录ID,做实际的增量部分的索引建立。

1、创建辅助表
CREATE TABLE `sph_counter` (
 `counter_id` int(11) NOT NULL,
 `max_doc_id` int(11) NOT NULL,
 PRIMARY KEY (`counter_id`)
) ENGINE=MyISAM DEFAULT CHARSET=utf8

2、在主索引的数据源中作如下方式的取数据设置

#源定义
source mysql
{
   type                  = mysql
   sql_host              = localhost
   sql_user              = root
   sql_pass              = root
   sql_db                = test
   sql_port              = 3306

   sql_query_pre         = SET NAMES utf8
   sql_query_pre         = SET SESSION query_cache_type=OFF
   sql_query_pre         = REPLACE INTO sph_counter SELECT 1, MAX(id) FROM documents

   sql_query             = SELECT id, group_id, UNIX_TIMESTAMP(date_added) AS date_added, title, content FROM documents WHERE id<=(SELECT max_doc_id FROM sph_counter WHERE counter_id=1)

   sql_attr_uint         = group_id
   sql_attr_timestamp    = date_added
   sql_query_info        = SELECT * FROM documents WHERE id=$id
}

3、在增量索引的数据源中作如下方式的取数据设置,需要注意的是sql_query_pre要和主索引数量相同,不然查询结果不是想要的内容
#增量索引 源定义
source delta:mysql{
   sql_query_pre         = SET NAMES utf8
   sql_query_pre         = SET SESSION query_cache_type=OFF
   sql_query_pre         =
   sql_query             = SELECT id, group_id, UNIX_TIMESTAMP(date_added) AS date_added, title, content FROM documents WHERE id>(SELECT max_doc_id FROM sph_counter WHERE counter_id=1)
}

4、主索引index定义配置如下
#index定义
index mysql
{
   source          = mysql             #对应的source名称
   path            = /usr/local/coreseek/var/data/ #请修改为实际使用的绝对路径,例如:/usr/local/coreseek/var/…
   docinfo         = extern
   mlock           = 0
   morphology      = none
   min_word_len    = 1
   html_strip      = 0

   charset_dictpath = /usr/local/mmseg3/etc/ #BSD、Linux环境下设置,/符号结尾
   #charset_dictpath = etc/
   charset_type      = zh_cn.utf-8
}

5、增量索引index定义配置如下
#增量索引 index定义
index delta:mysql{
   source          = delta
   path            = /usr/local/coreseek/var/data/delta/
   charset_dictpath = /usr/local/mmseg3/etc/
   charset_type    = zh_cn.utf-8
}

6、创建更新所有索引
$sudo /usr/local/coreseek/bin/indexer -c /usr/local/coreseek/dict/csft_mysql.conf –all –rotate
如果配置正确的话,现在辅助表sph_counter中已经添加了一条数据

7、更新增量索引
$sudo /usr/local/coreseek/bin/indexer delta -c /usr/local/coreseek/dict/csft_mysql.conf –rotate

8、合并增量索引到主索引
$sudo /usr/local/coreseek/bin/indexer –merge -c /usr/local/coreseek/dict/csft_mysql.conf –rotate

9、启动sphinx的守护进程searchd
$sudo /usr/local/coreseek/bin/searchd -c /usr/local/coreseek/dict/csft_mysql.conf

Sphinx增量索引(转)

Sphinx增量索引(转) 在实际应用中往往有这么一种情况,数据库数据很大,比如我们的歌曲表,如果我们每次都去更新整个表的索引,对系统得开销将非常大,显然这是不合适,这时我们会发现,每天我们需要更新的...
  • jianglei421
  • jianglei421
  • 2010年03月30日 13:22
  • 3838

sphinx做增量索引更新合并

在利用 Sphinx 做搜索引擎的时候,一般他的索引建立构成有如下几个部分: 固定不变的主索引 增量索引重建 索引数据合并 在实际操作中,需要为增量索引的建立创建辅助表,这样才可以...
  • Wepe2011
  • Wepe2011
  • 2014年12月19日 01:16
  • 406

Sphinx实时索引,用增量索引实现索引更新

我们前面知道,用./indexer --all 可以生成所有索引。当我们的数据很大,表的数据每天会逐渐添加,我们不可能再去重新生成下所有索引,这样性能方面会很差,那么,如何实现实时更新索引数据,又不影...
  • yangguangmeng
  • yangguangmeng
  • 2016年12月03日 22:16
  • 1602

sphinx主索引和增量索引实时更新

在数据库数据非常庞大的时候,而且实时有新的数据插入,如果我们不更新索引,新的数据就search不到,全部重新建立索引又很消耗资源,在这种情况下我们就需要使用“主索引+增量索引”的思路来实现实时更新的功...
  • zhangjunguo0320
  • zhangjunguo0320
  • 2016年07月26日 18:31
  • 372

sphinx 增量索引

Sphinx 实时索引数据库中的数据很大,然后我有些新的数据后来加入到数据库中,也希望能够检索到,全部重新建立索引很消耗资源,这样需要用到“主索引+增量索引”的思路来解决,这个模式实现的基本原理是设置...
  • liumeng305
  • liumeng305
  • 2015年07月25日 16:31
  • 284

sphinx增量索引

Sphinx增量索引 在实际应用中往往有这么一种情况,数据库数据很大,比如我们的歌曲表,如果我们每次都去更新整个表的索引,对系统得开销将非常大,显然这是不合适,这时我们会发现,每...
  • songtianyang01
  • songtianyang01
  • 2014年06月23日 09:58
  • 216

sphinx 增量索引 实现定时更新

一.sphinx增量索引的设置    数据库中的已有数据很大,又不断有新数据加入到数据库中,也希望能够检索到。全部重新建立索引很消耗资源,因为我们需要更新的数据相比较而言很少。例如。原来的数据有几百万...
  • superhosts
  • superhosts
  • 2015年06月25日 18:33
  • 1732

sphinx中的索引合并merge二则问题 增量索引中去除旧文档或合并过程中的过滤

通常我们需要做的合并sphinx索引时,需要考虑到使用‘过滤’和‘去旧’的方法,这二个方法在我们使用inderer索引命令时,通过--merge合并索引时,需要单独增加其他参数来处理,具体可以看以下介...
  • moqiang02
  • moqiang02
  • 2014年12月19日 15:39
  • 1440

sphinx主索引,增量索引创建

相关命令及步骤创建主索引: /usr/local/coreseek/bin/indexer -c /usr/local/coreseek/etc/csft.conf --all创建增量索引: ...
  • yangsai7312720
  • yangsai7312720
  • 2017年07月25日 18:03
  • 88

sphinx 增量索引实现实例

注:sphinx的增量索引其实是通过两个索引来实现的,网上有说可以通过
  • clh604
  • clh604
  • 2014年07月18日 16:28
  • 1484
内容举报
返回顶部
收藏助手
不良信息举报
您举报文章:Sphinx增量索引
举报原因:
原因补充:

(最多只允许输入30个字)