【Elasticsearch】学习笔记-p7（数据聚合&自动补全），2024Java开发社招面试总结

最新推荐文章于 2024-05-12 03:32:24 发布

2401_84424972

最新推荐文章于 2024-05-12 03:32:24 发布

阅读量690

点赞数 8

分类专栏： 2024年程序员学习文章标签： elasticsearch 学习笔记

本文链接：https://blog.csdn.net/2401_84424972/article/details/137932178

版权

2024年程序员学习专栏收录该内容

26 篇文章 0 订阅

订阅专栏

先自我介绍一下，小编浙江大学毕业，去过华为、字节跳动等大厂，目前阿里P7

深知大多数程序员，想要提升技能，往往是自己摸索成长，但自己不成体系的自学效果低效又漫长，而且极易碰到天花板技术停滞不前！

因此收集整理了一份《2024年最新Java开发全套学习资料》，初衷也很简单，就是希望能够帮助到想自学提升又不知道该从何学起的朋友。

既有适合小白学习的零基础资料，也有适合3年以上经验的小伙伴深入学习提升的进阶课程，涵盖了95%以上Java开发知识点，真正体系化！

由于文件比较多，这里只是将部分目录截图出来，全套包含大厂面经、学习笔记、源码讲义、实战项目、大纲路线、讲解视频，并且后续会持续更新

如果你需要这些资料，可以添加V获取：vip1024b （备注Java）

正文

}

这次的score_stats聚合是在brandAgg的聚合内部嵌套的子聚合。因为我们需要在每个桶分别计算。

另外，我们还可以给聚合结果做个排序，例如按照每个桶的酒店平均分做排序：

1.2.5 总结

aggs代表聚合，与query同级，此时query的作用是？

限定聚合的的文档范围

聚合必须的三要素：

聚合名称
聚合类型
聚合字段

聚合可配置属性有：

size：指定聚合结果数量
order：指定聚合结果排序方式
field：指定聚合字段

1.3 RestAPI实现聚合

聚合条件与query条件同级别，因此需要使用request.source()来指定聚合条件。

聚合条件的语法：

聚合的结果也与查询结果不同，API也比较特殊。不过同样是JSON逐层解析：

代码如下：

//聚合

@Test

void testAggregation() throws IOException {

//1.准备Request

SearchRequest request = new SearchRequest(“hotel”);

//2.准备DSL

request.source().size(0);

request.source().aggregation(AggregationBuilders

.terms(“brandAgg”)

.field(“brand”)

.size(20)

);

//3.发出请求

SearchResponse response = client.search(request, RequestOptions.DEFAULT);

//4.解析结果

Aggregations aggregations = response.getAggregations();

//4.1根据聚合名称获取聚合结果

Terms brandTerms = aggregations.get(“brandAgg”);

//4.2获取buckets

List<? extends Terms.Bucket> buckets = brandTerms.getBuckets();

//4.3遍历

for (Terms.Bucket bucket : buckets) {

//4.4获取key

String key = bucket.getKeyAsString();

System.out.println(key);

}

2.自动补全

当用户在搜索框输入字符时，我们应该提示出与该字符有关的搜索项，如图：

$[外链图片转存失败,源站可能有防盗链机制,建议将图片保存下来直接上传(img-uKEANYwe-1637384192176)(C:\Users\30287\Desktop\Java学习视频\day03-Docker\day07-Elasticsearch03\讲义\assets\image-20210723204936367.png)]$

这种根据用户输入的字母，提示完整词条的功能，就是自动补全了。

因为需要根据拼音字母来推断，因此要用到拼音分词功能。

2.1 拼音分词器

要实现根据字母做补全，就必须对文档按照拼音分词。插件地址：https://github.com/medcl/elasticsearch-analysis-pinyin

使用 docker volume inspect es-plugins 查看插件目录，将下载的文件解压上传，重启 Elasticsearch

测试用法如下：

POST /_analyze

{

“text”: “如家酒店还不错”,

“analyzer”: “pinyin”

}

结果：

2.2 自定义分词器

默认的拼音分词器会将每个汉字单独分为拼音，而我们希望的是每个词条形成一组拼音，需要对拼音分词器做个性化定制，形成自定义分词器。

elasticsearch中分词器（analyzer）的组成包含三部分：

character filters：在tokenizer之前对文本进行处理。例如删除字符、替换字符
tokenizer：将文本按照一定的规则切割成词条（term）。例如keyword，就是不分词；还有ik_smart
tokenizer filter：将tokenizer输出的词条做进一步处理。例如大小写转换、同义词处理、拼音处理等

文档分词时会依次由这三部分来处理文档：

声明自定义分词器的语法如下：

PUT /test

{

“settings”: {

“analysis”: {

“analyzer”: { // 自定义分词器

“my_analyzer”: { // 分词器名称

“tokenizer”: “ik_max_word”,

“filter”: “py”

}

“filter”: { // 自定义tokenizer filter

“py”: { // 过滤器名称

“type”: “pinyin”, // 过滤器类型，这里是pinyin

“keep_full_pinyin”: false,

“keep_joined_full_pinyin”: true,

“keep_original”: true,

“limit_first_letter_length”: 16,

“remove_duplicated_term”: true,

“none_chinese_pinyin_tokenize”: false

}

“mappings”: {

“properties”: {

“name”: {

“type”: “text”,

“analyzer”: “my_analyzer”,

“search_analyzer”: “ik_smart”

}

测试：

总结：

如何使用拼音分词器？

①下载pinyin分词器
②解压并放到elasticsearch的plugin目录
③重启即可

如何自定义分词器？

①创建索引库时，在settings中配置，可以包含三部分
②character filter
③tokenizer
④filter

拼音分词器注意事项？

为了避免搜索到同音字，搜索时不要使用拼音分词器

$[外链图片转存失败,源站可能有防盗链机制,建议将图片保存下来直接上传(img-QFtqHpTM-1637384192189)(C:\Users\30287\AppData\Roaming\Typora\typora-user-images\image-20211119082432872.png)]$