SQL优化方法

一、优化方向

1.避免不必要的大型表的全表扫描
2.缓存小型表的全表扫描
3.检验、优化索引的正确使用
4.检验、优化的SQL连接技术

二、具体优化方法

1、查询条件(where后面的子句)优化,避免全表扫描

  1. 考虑在where及order by等列上建立索引,否则将导致进行全表扫描

  2. 避免在where子句中对字段进行null值判断,否则将导致放弃使用索引而进行全表扫描

  3. 避免在where子句中使用!=或<>操作符,否则将导致放弃使用索引而进行全表扫描。

  4. 避免用or连接条件,如果有部分字段存在索引,部分不存在索引,则将导致放弃使用索引而进行全表扫描,建议使用union all代替。例:
    select id from t where num=10 or Name = 'admin'
    可以这样查询:
    select id from t where num = 10 union all select id from t where Name = 'admin'

  5. 慎用in 和 not in ,否则会导致全表扫描。使用exists替换in,子查询结果集小,用IN;外表小,子查询表大,用EXISTS;建议实际选取哪个,可以对比两个sql的执行计划。如:
    select id from t where num in(1,

  • 0
    点赞
  • 1
    收藏
    觉得还不错? 一键收藏
  • 1
    评论
Hive SQL优化方法论包括以下几个方面: 1. 数据倾斜处理:当发现数据倾斜时,可以采取一些措施来平衡数据分布,以提高查询性能。例如,可以将倾斜的数据随机分布到多个reduce作业中。 2. 使用合适的数据类型和数据结构:选择适当的数据类型和数据结构可以减少存储空间的使用,并提高查询性能。例如,使用较小的数据类型、压缩存储格式等。 3. 分区和分桶:通过合理地进行分区和分桶,可以将数据划分为更小的块,提高查询的效率。分区和分桶可以基于数据的某些特征,如日期、地理位置等。 4. 避免全表扫描:尽量避免全表扫描,可以通过使用索引、利用分区和分桶等方式来减少查询的数据量,提高查询性能。 5. 调整并行度和资源配置:根据集群的资源情况和查询的需求,适当调整查询的并行度和资源配置,以提高查询的效率。可以根据查询的复杂程度、数据规模等因素来决定并行度和资源分配。 6. 优化Join操作:在进行Join操作时,可以采用一些优化策略来提高性能。例如,选择合适的Join算法、调整Join操作的顺序、使用Map-side Join等方式。 7. 使用合适的执行模式:根据查询的需求和数据的特点,选择合适的执行模式,如MapReduce模式、Tez模式、Spark模式等。不同的执行模式有不同的适用场景和性能特点,需要根据实际情况做出选择。 综上所述,通过数据倾斜处理、使用合适的数据类型和数据结构、合理地进行分区和分桶、避免全表扫描、调整并行度和资源配置、优化Join操作以及选择合适的执行模式等方法,可以有效地优化Hive SQL的性能和资源利用率。

“相关推荐”对你有帮助么?

  • 非常没帮助
  • 没帮助
  • 一般
  • 有帮助
  • 非常有帮助
提交
评论 1
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值