【Elasticsearch】学习笔记-p5（搜索结果处理），2024年最新多线程基础面试题

2401_84424956

于 2024-04-18 18:29:16 发布

阅读量916

点赞数 23

分类专栏： 2024年程序员学习文章标签： elasticsearch 学习笔记

本文链接：https://blog.csdn.net/2401_84424956/article/details/137932156

版权

2024年程序员学习专栏收录该内容

27 篇文章 0 订阅

订阅专栏

先自我介绍一下，小编浙江大学毕业，去过华为、字节跳动等大厂，目前阿里P7

深知大多数程序员，想要提升技能，往往是自己摸索成长，但自己不成体系的自学效果低效又漫长，而且极易碰到天花板技术停滞不前！

因此收集整理了一份《2024年最新Java开发全套学习资料》，初衷也很简单，就是希望能够帮助到想自学提升又不知道该从何学起的朋友。

既有适合小白学习的零基础资料，也有适合3年以上经验的小伙伴深入学习提升的进阶课程，涵盖了95%以上Java开发知识点，真正体系化！

由于文件比较多，这里只是将部分目录截图出来，全套包含大厂面经、学习笔记、源码讲义、实战项目、大纲路线、讲解视频，并且后续会持续更新

如果你需要这些资料，可以添加V获取：vip1024b （备注Java）

正文

指定一个坐标，作为目标点
计算每一个文档中，指定字段（必须是geo_point类型）的坐标到目标点的距离是多少
根据距离排序

例子：实现对酒店数据按照到你的位置坐标的距离升序排序

获取你的位置的经纬度的方式：https://lbs.amap.com/demo/jsapi-v2/example/map/click-to-get-lnglat/

假设我的位置是：31.034661，121.612282，寻找我周围距离最近的酒店：

2.分页

elasticsearch 默认情况下只返回top10的数据。而如果要查询更多数据就需要修改分页参数了。elasticsearch中通过修改from、size参数来控制要返回的分页结果：

from：从第几个文档开始
size：总共查询几个文档

类似于mysql中的limit ?, ?

2.1 基本的分页

语法：

GET /hotel/_search

{

“query”: {

“match_all”: {}

“from”: 0, // 分页开始的位置，默认为0

“size”: 10, // 期望获取的文档总数

“sort”: [

{“price”: “asc”}

]

}

2.2 深度分页问题

现在，我要查询990~1000的数据，查询逻辑要这么写：

GET /hotel/_search

{

“query”: {

“match_all”: {}

“from”: 990, // 分页开始的位置，默认为0

“size”: 10, // 期望获取的文档总数

“sort”: [

{“price”: “asc”}

]

}

这里是查询990开始的数据，也就是第990~第1000条数据。

不过，elasticsearch内部分页时，必须先查询 0~1000条，然后截取其中的990 ~ 1000的这10条：

这样带来什么问题呢？

查询TOP1000，如果es是单点模式，这并无太大影响。

但是elasticsearch将来一定是集群，例如我集群有5个节点，我要查询TOP1000的数据，并不是每个节点查询200条就可以了。

因为节点A的TOP200，在另一个节点可能排到10000名以外了。

因此要想获取整个集群的TOP1000，必须先查询出每个节点的TOP1000，汇总结果后，重新排名，重新截取TOP1000。

当查询分页深度较大时，汇总数据过多，对内存和CPU会产生非常大的压力，因此elasticsearch会禁止from+ size 超过10000的请求。

针对深度分页，ES提供了两种解决方案，官方文档：

search after：分页时需要排序，原理是从上一次的排序值开始，查询下一页数据。官方推荐使用的方式。
scroll：原理将排序后的文档id形成快照，保存在内存。官方已经不推荐使用。

2.3 总结

分页查询的常见实现方案以及优缺点：

from + size：
优点：支持随机翻页
缺点：深度分页问题，默认查询上限（from + size）是10000
场景：百度、京东、谷歌、淘宝这样的随机翻页搜索
after search：
优点：没有查询上限（单次查询的size不超过10000）
缺点：只能向后逐页查询，不支持随机翻页
场景：没有随机翻页需求的搜索，例如手机向下滚动翻页
scroll：
优点：没有查询上限（单次查询的size不超过10000）
缺点：会有额外内存消耗，并且搜索结果是非实时的
场景：海量数据的获取和迁移。从ES7.1开始不推荐，建议用 after search方案。

3.高亮

3.1 高亮原理

什么是高亮显示呢？

我们在百度，京东搜索时，关键字会变成红色，比较醒目，这叫高亮显示：

高亮显示的实现分为两步：

给文档中的所有关键字都添加一个标签，例如<em>标签
页面给<em>标签编写CSS样式

3.2 实现高亮

语法：

GET /hotel/_search

{

“query”: {

“match”: {

“FIELD”: “TEXT” // 查询条件，高亮一定要使用全文检索查询

}

“highlight”: {

“fields”: { // 指定要高亮的字段

“FIELD”: {

“pre_tags”: “”, // 用来标记高亮字段的前置标签

“post_tags”: “” // 用来标记高亮字段的后置标签

}

注意：

高亮是对关键字高亮，因此搜索条件必须带有关键字，而不能是范围这样的查询。
默认情况下，高亮的字段，必须与搜索指定的字段一致，否则无法高亮
如果要对非搜索字段高亮，则需要添加一个属性：required_field_match=false

最近我根据上述的技术体系图搜集了几十套腾讯、头条、阿里、美团等公司21年的面试题，把技术点整理成了视频（实际上比预期多花了不少精力），包含知识脉络 + 诸多细节，由于篇幅有限，这里以图片的形式给大家展示一部分

网上学习资料一大堆，但如果学到的知识不成体系，遇到问题时只是浅尝辄止，不再深入研究，那么很难做到真正的技术提升。

需要这份系统化的资料的朋友，可以添加V获取：vip1024b （备注Java）

一个人可以走的很快，但一群人才能走的更远！不论你是正从事IT行业的老鸟或是对IT行业感兴趣的新人，都欢迎加入我们的的圈子（技术交流、学习资源、职场吐槽、大厂内推、面试辅导），让我们一起学习成长！
诸多细节，由于篇幅有限，这里以图片的形式给大家展示一部分

[外链图片转存中…(img-X14sgOV9-1713436145422)]

网上学习资料一大堆，但如果学到的知识不成体系，遇到问题时只是浅尝辄止，不再深入研究，那么很难做到真正的技术提升。

需要这份系统化的资料的朋友，可以添加V获取：vip1024b （备注Java）
[外链图片转存中…(img-nAt6AM4r-1713436145423)]

一个人可以走的很快，但一群人才能走的更远！不论你是正从事IT行业的老鸟或是对IT行业感兴趣的新人，都欢迎加入我们的的圈子（技术交流、学习资源、职场吐槽、大厂内推、面试辅导），让我们一起学习成长！

2401_84424956

关注

23
点赞
踩
30

收藏

觉得还不错? 一键收藏
0
评论
【Elasticsearch】学习笔记-p5（搜索结果处理），2024年最新多线程基础面试题

优点：支持随机翻页缺点：深度分页问题，默认查询上限（from + size）是10000场景：百度、京东、谷歌、淘宝这样的随机翻页搜索优点：没有查询上限（单次查询的size不超过10000）缺点：只能向后逐页查询，不支持随机翻页场景：没有随机翻页需求的搜索，例如手机向下滚动翻页scroll优点：没有查询上限（单次查询的size不超过10000）缺点：会有额外内存消耗，并且搜索结果是非实时的场景：海量数据的获取和迁移。从ES7.1开始不推荐，建议用 after search方案。3.高亮。
复制链接

扫一扫