行式存储与列式存储

最新推荐文章于 2024-08-09 15:00:50 发布

那一年_我九岁

最新推荐文章于 2024-08-09 15:00:50 发布

阅读量693

点赞数

分类专栏：大数据文章标签：数据库 hive

本文链接：https://blog.csdn.net/weixin_44852067/article/details/132471356

版权

大数据专栏收录该内容

17 篇文章 2 订阅

订阅专栏

1.概述

数据处理大致可分为两大类，联机事务处理OLTP(on-line transaction processing) 和联机分析处理OLAP(on-line analytical processing)。 OLTP是传统关系型数据库的主要应用，用来执行一些基本的、日常的事务处理，比如数据库记录的增、删、改、查等。而OLAP则是分布式数据库的主要应用，它对实时性要求不高，但处理的数据量大，通常应用于复杂的动态报表系统上。

2.行式存储与列式存储

2.1 行式存储

传统的关系型数据库采用行式存储法(Row-based)，一行中的数据在存储介质中以连续存储形式存在。

[  {    "title": "Oriented Column Store",    "author": "Alex",    "publish_time": 1508423456,    "like_num": 1024  },{    "title": "Apache Druid",    "author": "Bob",    "publish_time": 1504423069,    "like_num": 10  },{    "title": "Algorithm",    "author": "Casey",    "publish_time": 1512523069,    "like_num": 16  }]

Q: 统计 Bob 发表的博客数，或是整个系统今天的博客点赞数。如果是行存储系统，数据库将怎样操作？

在这里插入图片描述

行式存储数据库需要将所有行数据读入内存，然后对 like_num 列做 sum 操作，从而得到结果。此时我们会发现行式数据库在读取数据的时候，会存在一个固有的“缺陷”。比如所选择查询的目标即使只涉及少数几项属性，但由于这些目标数据埋藏在各行数据单元中，而行单元往往又特别大，应用程序必须读取每一条完整的行记录，从而使得读取效率大大降低。

对此，行式数据库给出的优化方案是加“索引”。在OLTP类型的应用中，通过索引机制或给表分区等手段，可以简化查询操作步骤，并提升查询效率。

2.2 行式存储的应用场景

适合随机的增删改查操作
需要在行中选取所有属性的查询操作
需要频繁插入或更新的操作，其操作与索引和行的大小更为相关

2.3 列式存储

列式存储(Column-based)是相对于行式存储来说的，新兴的HBase，GP等分布式数据库均采用列式存储，一列中的数据在存储介质中以连续存储形式存在。

[  {    "title": "Oriented Column Store",    "author": "Alex",    "publish_time": 1508423456,    "like_num": 1024  },{    "title": "Apache Druid",    "author": "Bob",    "publish_time": 1504423069,    "like_num": 10  },{    "title": "Algorithm",    "author": "Casey",    "publish_time": 1512523069,    "like_num": 16  }]