Solr学习总结（八）IK 中文分词的配置和使用

最新推荐文章于 2020-09-10 19:40:27 发布

恬恬奶爸

最新推荐文章于 2020-09-10 19:40:27 发布

阅读量537

点赞数

最近，很多朋友问我solr 中文分词配置的问题，都不知道怎么配置，怎么使用，原以为很简单，没想到这么多朋友都有问题，所以今天就总结总结中文分词的配置吧。

　　有的时候，用户搜索的关键字，可能是一句话，不是很规范。所以在 Solr 中查询出的时候，就需要将用户输入的关键字进行分词。

　　目前有很多优秀的中文分词组件。本篇只以 IKAnalyzer 分词为例，讲解如何在 solr 中及集成中文分词，使用 IKAnalyzer的原因 IK 比其他中文分词维护的勤快，和 Solr 集成也相对容易。具体就不多介绍，这里直接solr 集成 IK 的方法。

　　1. 首先，下载IKAnalyzer ，下载

　　　　注意：以前老的IK 不支持Solr 5.3的版本，请注意下载最新的。

　　2. 将ik的相关文件拷贝到 webapps\solr\WEB-INF\lib 目录下

　　3. 在 solr_home\mycore1\conf\schema.xml 增加如下配置

         <!-- 我添加的IK分词 -->
         <fieldType name="text_ik" class="solr.TextField">   
                   <analyzer type="index" isMaxWordLength="false" class="org.wltea.analyzer.lucene.IKAnalyzer"/>   
                   <analyzer type="query" isMaxWordLength="true" class="org.wltea.analyzer.lucene.IKAnalyzer"/>   
         </fieldType>

　　　同时，把需要分词的字段，设置为text_ik，

　 <field name="id" type="int" indexed="true" stored="true" required="true" multiValued="false" />
   <field name="name" type="text_ik" indexed="true" stored="true" required="true" multiValued="false" />
   <field name="title" type="text_ik" indexed="true" stored="true" required="true" multiValued="false" />
   <field name="category" type="int" indexed="true" stored="true" required="true" multiValued="false" />
   <field name="content" type="text_ik" indexed="true" stored="true" required="true" multiValued="false" />
   <field name="price" type="double" indexed="true" stored="true" required="true" multiValued="false" />
   <field name="color" type="string" indexed="true" stored="true" required="true" multiValued="false" />
   <field name="orderBy" type="int" indexed="true" stored="true" required="true" multiValued="false" />
   <field name="updatetime" type="date" indexed="true" stored="true" required="true" multiValued="false" />

　　4. 重启服务

　　　　注意：如果之前已经创建了索引，需要将之前的索引删掉，重新创建分词后的索引。

　　5. 在admin后台， analysis 下查看分词效果

　　　　1. 中文分词效果

　　　　2. 索引查询效果

　　6. 配置IKAnalyzer分词器的扩展词典，停止词词典

　　　　1. 将文件夹下的IKAnalyzer.cfg.xml , ext.dic和stopword.dic 三个文件复制到/webapps/solr/WEB-INF/classes 目录下，并修改IKAnalyzer.cfg.xml

　　　　<?xml version="1.0" encoding="UTF-8"?>
　　　　<!DOCTYPE properties SYSTEM "http://java.sun.com/dtd/properties.dtd">  
　　　　<properties>  
   　　　　 <comment>IK Analyzer 扩展配置</comment>
   　　　　 <!--用户可以在这里配置自己的扩展字典 -->
    　　　　<entry key="ext_dict">ext.dic;</entry> 

   　　　　 <!--用户可以在这里配置自己的扩展停止词字典-->
    　　　　<entry key="ext_stopwords">stopword.dic;</entry> 
　　　　</properties>

　　　　2. 在ext.dic 里增加自己的扩展词典，例如，婴儿奶粉3段

　　　　注意: 记得将stopword.dic，ext.dic的编码方式为UTF-8 无BOM的编码方式。

转自：http://www.cnblogs.com/zhangweizhong/p/5593909.html

恬恬奶爸

关注

0
点赞
踩
0

收藏

觉得还不错? 一键收藏
0
评论
Solr学习总结（八）IK 中文分词的配置和使用

最近，很多朋友问我solr 中文分词配置的问题，都不知道怎么配置，怎么使用，原以为很简单，没想到这么多朋友都有问题，所以今天就总结总结中文分词的配置吧。　　有的时候，用户搜索的关键字，可能是一句话，不是很规范。所以在 Solr 中查询出的时候，就需要将用户输入的关键字进行分词。　　目前有很多优秀的中文分词组件。本篇只以 IKAnalyzer 分词为例，讲解如何
复制链接

扫一扫