8.2.3-elasticsearch内置分词器之keyword/pattern

本文详细介绍了Elasticsearch中的内置分词器keyword analyzer和pattern analyzer。keyword analyzer主要用于不分词的场景,而pattern analyzer则允许自定义正则表达式进行分词。文中分别阐述了它们的分词效果、组成定义以及如何自定义配置。
摘要由CSDN通过智能技术生成

ES默认提供了八种内置的analyzer,针对不同的场景可以使用不同的analyzer;

1、keyword analyzer

1.1、keyword类型及分词效果

keyword analyzer视字符串为一个整体不进行分词处理

//测试keyword analyzer默认分词效果
//请求参数
POST _analyze
{
   
  "analyzer": "keyword",
  "text": "The aggregations framework helps provide aggregated data based on a search query"
}
//结果返回
{
   
  "tokens" : [
    {
   
      "token" : "The aggregations framework helps provide aggregated data based on a search query",
      "start_offset" : 0,
      "end_offset" : 80,
      "type" : "word",
      "position" : 0
    }
  ]
}

以上句子通过分词之后得到的词(term)为:
[The aggregations framework helps provide aggregated data based on a search query]

1.2、keyword analyzer的组成定义
序号 子构件 构件说明
1 Tokenizer keyword tokenizer

如果希望自定义一个与keyword类似的analyzer,只需要在在自定义analyzer时指定type为keyword,其它的可以按照需要进行配置(char filter/filter),如下示例:

//自定义kwyword analyzer
PUT custom_rebuild_keyword_analyzer_index
{
   
  "settings": {
   
    "analysis": {
   
      "analyzer": {
   
        "rebuild_keyword_analyzer":{
   
          "tokenizer":"keyword",
          "filter":[]
        }
      }
    }
  }
}

2、pattern analyzer

2.1、pattern类型及分词效果

pattern analyzer使用正则表达式作为文本分词规则,注意对正则的转义处理,避免正则匹配到正则本身的字符串,默认正则为\W+(匹配非单词字符)

//测试pattern analyzer默认分词效果
//请求参数
POST _analyze
{
   
  "analyzer": "pattern",
  "text": "It's a nice day"
}
//结果返回
{
   
  "tokens" : [
    {
   
      "token" : "it",
      "start_offset" : 0,
      "end_offset" : 2,
      "type" : "word",
      "position" : 0
    },
    {
   
      "token" : "s",
      "start_offset" : 3,
      "end_offset" : 4,
      "type" : "word",
      "position" : 1
    }
  • 1
    点赞
  • 7
    收藏
    觉得还不错? 一键收藏
  • 0
    评论
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值