solr 定时全量索引 增量索引与dataimporter.properties 配置

转载 2014年03月31日 19:19:33
solr增量索引配置 
1.在进行增量索引前,首先要弄懂几个必要的属性,以及数据库建表事项,和dataimporter.properties 

 

data-config.xml里面的数据 

  <!--  transformer 格式转化:HTMLStripTransformer 索引中忽略HTML标签   ---> 
  <!--  query:查询数据库表符合记录数据   ---> 
  <!--  deltaQuery:增量索引查询主键ID    --->    注意这个只能返回ID字段 
  <!--  deltaImportQuery:增量索引查询导入数据  ---> 
  <!--  deletedPkQuery:增量索引删除主键ID查询  ---> 注意这个只能返回ID字段 


数据库配置注意事项 

1.如果只涉及添加,与修改业务,那么数据库里只需额外有一个timpstamp字段就可以了,默认值为当前系统时间,CURRENT_TIMESTAMP(笔者的数据为mysql的) 
2.如果还涉及删除业务,那么数据里就需额外再多添加一个字段isdelete,int类型的用0,1来标识,此条记录是否被删除,当然也可以用其他字段标识,ture或false都可以 

dataimporter.properties 

这个配置文件很重要,它是用来记录当前时间与上一次修改时间的,通过它能够找出,那些,新添加的,修改的,或删除的记录


下面为笔者当时测试时的一个演示,其中添加,修改,删除,都涉及了

    <dataConfig>   
	     <!---   此段话配置的是一个MySQL的数据源,(数据源也可以配置在solrconfig.xml中)  --->
        <dataSource name="mydb" type="JdbcDataSource" driver="com.mysql.jdbc.Driver" url="jdbc:mysql://localhost/test" user="root" password="ninemax"/>
		
		
		<document>
		     <!--  下面分别来介绍属性(如有错误,欢迎指出) -->
			 <!--  pk="ID" 这个很有必要,因为其中的增量索引查询主键ID时需要  -->
			  <!--  dataSource="mydb"   这个引用名字是引用上面数据源的名字 -->
			  <!--  name="myinfo"   这个名字必须唯一,存在多个实体时 -->
			   <!--  query="select  *  from myinfo WHERE isdelete=0   query查询是指
               查询出表里所有的符合条件的数据,因为笔者测试的有删除业务,所以
			   where  后面有一个限定条件isdelete=0,意思为查询未被删除的数据
			   
			   (注意这个query查询只对第一次全量导入有作用,对增量导入不起作用)
			   -->
			   <!--
			   deltaQuery="select ID  from myinfo where my_date > '${dataimporter.last_index_time}'" 
			   deltaQuery的意思是,查询出所有经过修改的记录的ID
			   可能是修改操作,添加操作,删除操作产生的
			   (此查询只对增量导入起作用,而且只能返回ID值)
			   -->
			   <!--
			   deletedPkQuery="select ID from myinfo where isdelete=1"	
			   此操作值查询那些数据库里伪删除的数据的ID(即isdelete标识为1的数据)
			   solr通过它来删除索引里面对应的数据
			   (此查询只对增量导入起作用,而且只能返回ID值)
			   -->
			   <!--
			    deltaImportQuery="select * from myinfo where ID='${dataimporter.delta.ID}'"
				次查询是获取以上两步的ID,然后把其全部数据获取,根据获取的数据
				对索引库进行更新操作,可能是删除,添加,修改
				(此查询只对增量导入起作用,可以返回多个字段的值,一般情况下,都是返回所有字段的列)
			   -->
			   
			   
			 
		     <entity pk="ID"  dataSource="mydb" name="myinfo" query="select  *  from myinfo WHERE isdelete=0 " 
			  deltaQuery="select ID  from myinfo where my_date > '${dataimporter.last_index_time}'" 
              deletedPkQuery="select ID from myinfo where isdelete=1"			  
			  deltaImportQuery="select * from myinfo where ID='${dataimporter.delta.ID}'"
			  
			 >
			 <!--  此条记录有必要说一下,ID指定大写的,与上面语句中的对应起来---->
			 
			  <field column="ID" name="id"/>
		       <field column="name" name="name"/>
			   <field column="address" name="address"/>
			   <field column="age" name="age"/>
			    <field column="my_date" name="my_date"/>
				 <field column="isdelete" name="isdelete"/>
		      </entity>
			 

		</document>
		
    </dataConfig>  
   

dataimporter.properties 配置

参考:官方文档:http://wiki.apache.org/solr/DataImportHandler#Scheduling


googlecode 找到:https://code.google.com/p/solr-dataimport-scheduler/


1.复制solr-4.2.11\solr-4.2.1\dist目录下solr-dataimporthandler-4.2.1.jar 和solr-dataimporthandler-extras-4.2.1.jar到


D:\program\tomcat6\webapps\solr\WEB-INF\lib目录下


2.从https://code.google.com/p/solr-dataimport-scheduler/downloads/list 下载apache-solr-dataimportscheduler-1.0-with-source.jar到


D:\program\tomcat6\webapps\solr\WEB-INF\lib目录下


3.取出apache-solr-dataimportscheduler-1.0-with-source.jar内的dataimport.properties到D:\program\tomcat6\solrapp\solr\conf


conf文件夹是没有的,要新建


4.修改D:\program\tomcat6\webapps\solr\WEB-INF\web.xml,加入

<listener>
             <listener-class>org.apache.solr.handler.dataimport.scheduler.ApplicationListener</listener-class>
   </listener>

5.修改dataimport.properties内容:

#################################################
#                                               #
#       dataimport scheduler properties         #
#                                               #
#################################################

#  to sync or not to sync
#  1 - active; anything else - inactive
syncEnabled=1

#  which cores to schedule
#  in a multi-core environment you can decide which cores you want syncronized
#  leave empty or comment it out if using single-core deployment
#syncCores=game,resource
syncCores=collection1
#  solr server name or IP address
#  [defaults to localhost if empty]
server=localhost

#  solr server port
#  [defaults to 80 if empty]
port=8080

#  application name/context
#  [defaults to current ServletContextListener's context (app) name]
webapp=solr

#  URL params [mandatory]
#  remainder of URL
params=/dataimport?command=delta-import&clean=false&commit=true

#  schedule interval
#  number of minutes between two runs
#  [defaults to 30 if empty]
interval=1

#  重做索引的时间间隔,单位分钟,默认7200,即1天; 
#  为空,为0,或者注释掉:表示永不重做索引
reBuildIndexInterval=2

#  重做索引的参数
reBuildIndexParams=/dataimport?command=full-import&clean=true&commit=true

#  重做索引时间间隔的计时开始时间,第一次真正执行的时间=reBuildIndexBeginTime+reBuildIndexInterval*60*1000;
#  两种格式:2012-04-11 03:10:00 或者  03:10:00,后一种会自动补全日期部分为服务启动时的日期
reBuildIndexBeginTime=03:10:00


Solr增量索引

注:全量索引和增量索引data-config.xml和delta-data-config.xml配置文件默认放在和solrconfig.xml同级目录 solrconfig.xml配置如下: ...
  • zwx19921215
  • zwx19921215
  • 2015年01月26日 14:37
  • 4881

solr定时实时重建索引和增量更新

Solr Data Import Hander Scheduler 说明:         Solr官方提供了很强大的Data Import Request Handler,同时提供了一个简单的 Sc...
  • zwx19921215
  • zwx19921215
  • 2015年01月26日 14:40
  • 32018

[搜索] Solr (三) 全量索引与增量索引

索引导入分全量索引与增量索引。Solr支持多种创建索引的方式。这里通过solr官方提供的一个工具的—Data Import Handler,来做数据库建立索引,DIH支持增量索引。Solr/examp...
  • qust_2011
  • qust_2011
  • 2014年11月12日 09:03
  • 2401

solr 定时创建全量索引和增量索引

背景:在前面的博文里搭建了solr全文搜索,那么在
  • cdy102688
  • cdy102688
  • 2014年10月27日 10:15
  • 2507

solr配置自动增量更新索引

首先从apache下载最新的solr包,我这里
  • forai
  • forai
  • 2014年09月12日 17:00
  • 1108

全文索引----solr服务器更新增量索引

上篇文章我们介绍了全量更新solr索引,但是在数据量较大时,频繁的更新索引会消耗系统性能,如果更新频率较低,则会影响短时的数据准确性,所以,更新时间的间隔是个很难界定。增量索引解决了这个问题,我们可以...
  • u010942465
  • u010942465
  • 2016年05月09日 16:36
  • 7835

Solr全量索引、增量索引和定时增量索引配置

Solr全量索引、增量索引和定时增量索引配置标签(空格分隔): Solr引言: ① 实现MySQL(Oracle)表数据全量索引和增量索引,基于Solr DIH组件实现起来比较简单,只需要重复使用S...
  • MOTUI
  • MOTUI
  • 2016年12月12日 18:43
  • 3182

solr定时任务dataimport报错解决

在做solr的dataimport的定时任务时,启动时报了如下的错误,一直搞不明白,最后发现是引的包有问题(apache-solr-dataimportscheduler-1.0.jar) 08-D...
  • zllovewyh890128
  • zllovewyh890128
  • 2016年12月08日 11:58
  • 1744

使用Solr Data Import的full-import | delta-import功能

Solr提供了full-import和delta-import两种导入方式 多个entity,每个entity有各自的last_index_time,可以通过dataimporter.entity...
  • huang798807481
  • huang798807481
  • 2013年12月20日 11:00
  • 5975

solr data-config.xml配置

 第一部分是对《db-data-config.xml》 query是获取全部数据的SQL deltaImportQuery是获取增量数据时使用的SQL deltaQuery是获取pk的SQ...
  • boolbo
  • boolbo
  • 2015年12月18日 15:54
  • 7167
内容举报
返回顶部
收藏助手
不良信息举报
您举报文章:solr 定时全量索引 增量索引与dataimporter.properties 配置
举报原因:
原因补充:

(最多只允许输入30个字)