es analyzer分词

参考:https://learnku.com/articles/35136
https://www.cnblogs.com/cjsblog/p/10171695.html
https://blog.csdn.net/white_while/article/details/98504574

1.Analyzer 由三部分组成:
(1)Character Filters 字符过滤器(针对原始文本处理,例如去除 html)
字符过滤器以字符流的形式接收原始文本,并可以通过添加、删除或更改字符来转换该流。
一个analyzer可以有0个或多个character filters。
(2)Tokenizer(按照规则切分为单词)
Tokenizer 负责将文本拆分成单个token ,这里token就指的就是一个一个的单词。就是一段文本被分割成好几部分。
一个analyzer有且只能有一个tokenizer
(3)Token Filter (将切分的单词进行加工,小写,删除 stopwords,增加同义语)
token过滤器接收token流,并且可能会添加、删除或更改tokens。
例如,一个lowercase token filter可以将所有的token转成小写。stop token filter可以删除常用的单词,比如 the 。synonym token filter可以将同义词引入token流。
一个analyzer可以有0个或多个token filters。
在这里插入图片描述
在这里插入图片描述
2.内置analyzer与更改:
(1)Standard Analyzer - 默认分词器,按词切分,小写处理
在这里插入图片描述
更改:以配置my_analyzer分词器为例,基于standard analyzer,配置为删除预定义的英语停止词列表。

PUT /index
{
   
  "settings": {
   
    "analysis": {
   
      "analyzer": {
   
        
  • 0
    点赞
  • 0
    收藏
    觉得还不错? 一键收藏
  • 0
    评论

“相关推荐”对你有帮助么?

  • 非常没帮助
  • 没帮助
  • 一般
  • 有帮助
  • 非常有帮助
提交
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值