大数据 - 行式存储与列式存储_大数据列式存储-CSDN博客

本文链接：https://blog.csdn.net/goodjava2007/article/details/131048264

为什么要区分？

大多数数据库系统存储一组数据记录，这些记录由表中的列和行组成。表可以水平分区（将属于同一行的值存储在一起），也可以垂直分区（将属于同一列的值存储在一起）。
数据库用于存储、检索和管理大量数据，一般情况下，数据库系统采用了两种主要的存储方式：行式存储和列式存储。
在数据库管理系统中，数据存储的方式对性能和效率有重要影响，所以用户可以根据业务场景自行选择行存还是列存的数据库。
在这里插入图片描述

行式存储

在行式存储中，一条记录（即一行数据）被存储在一块连续的物理空间中，而整张表的所有记录按照一定的顺序依次存放。
适用的场景，如：数据记录（姓名、出生日期和电话号码）类的数据。即：由多个字段组成且用某个键（在本例中为单调递增的ID）进行唯一标识。
表示单个用户的数据记录的所有字段通常被一起读取，在创建数据时（例如，当用户填写注册表单时），我们也将它们一起写入数据库，同时我们可以单独修改某个字段。因为诸如磁盘之类的持久性介质上的数据通常是按块访问的（换句话说，磁盘访问的最小单位是块），所以单个块可能将包含某行中所有列的数据。

对于我们希望访问用户的整条记录的情况非常有用，但这样的存储布局会使访问多个用户记录某个字段的查询（例如，只获取电话号码的查询）开销更大，因为其他字段的数据在这个过程中也会被读入。

优势：
A. 顺序访问：由于行式存储按照记录的顺序进行存储，因此可以快速地访问特定的记录，即通过主键或索引进行查询。
B. 事务处理：由于行式存储按照记录的顺序进行存储，因此在执行事务处理（如增删改查操作）时，行式存储能够更好地支持并发控制和恢复机制。
C. 完整性约束：行式存储可以更好地支持完整性约束，如主键、外键等。
劣势：
A. 空间利用：如果某些行的某些列没有值，那么这些位置将会被占用，造成空间浪费。
B. 数据压缩：由于行式存储是按照记录的顺序进行存储的，因此无法简单地利用数据压缩技术来减少存储空间。
C. 全表扫描：在查询时，如果需要通过全表扫描来查找满足某些条件的数据，那么将会带来较大的性能开销。

列式存储

在列式存储中，同一列的所有数据都被存储在一起，而不同列的数据则被分开存储。
适用的场景，如：存储股票市场的历史价格，那么股票价格这一列的数据便会被存储在一起。不同列的值存储在不同的文件或文件段中，可以按列进行有效的查询，因为它们可以一次性地被读取出来，而不是先对整行进行读取后再丢弃掉不需要的列。

面向列的存储非常适合计算聚合的分析型工作负载，如：查找趋势、计算平均值等。

优势：
A. 数据压缩：在列式存储中，将同一列的数据存储在一起，因此可以使用更高效的数据压缩算法来减少存储空间。如果某一列的数据类型都是相同的（如全部为数字），那么可以使用位图索引等技术来进行压缩。
B. 查询优化：在列式存储中，数据是按照列进行组织的，因此在查询时可以更快地定位到满足条件的数据。此外，列式存储也支持更高级的索引技术（如位图索引、B树索引等），进一步提高了查询性能。
C. 分页和缓存：列式存储在分页和缓存方面也表现出较好的性能。由于同一页或缓存块中的数据是同一列的，因此可以减少I/O操作次数。
劣势：
A. 访问特定行：在列式存储中，数据是按照列进行组织的，因此在访问特定的行数据时需要更多的I/O操作。
B. 事务处理：由于列式存储的数据是分开的，因此在执行事务处理（如增删改查操作）时需要更多的锁资源，可能影响并发性能。