事务到底是隔离的还是不隔离的?

事务到底是隔离的还是不隔离的?


事务隔离级别的时候提到过,如果是可重复读隔离级别,事务 T 启动的时候会创建一个视图 read-view,之后事务 T 执行期间,即使有其他事务修改了数据,这个事务看到的仍然跟在启动时看到的一样。也就是说,一个在可重复读隔离级别下执行的事务,好像与世无争,不受外界影响。

但是,一个事务如果要更新一行,而刚好有另外一个事务拥有这一行的行锁,它又不能这么超然了,会被锁住,进入等待状态。

抛出问题:既然进入了等待状态,那么等到这个事务自己获取到行锁要更新数据的时候,它读到的值又是什么呢?

首先举个例子:

mysql> CREATE TABLE `t` (
  `id` int(11) NOT NULL,
  `k` int(11) DEFAULT NULL,
  PRIMARY KEY (`id`)
) ENGINE=InnoDB;
insert into t(id, k) values(1,1),(2,2);

事务A、B、C执行流程
这里先告诉结果,语句 Q1 返回的 k 的值是 3,而语句 Q2 返回的 k 的值是 1。和你想的一样吗?

在 MySQL 里,有两个“视图”的概念

  • view,它是一个用查询语句定义的虚拟表,在调用的时候执行查询语句并生成结果。创建视图的语法是 create view,而它的查询方法与表一样。
  • InnoDB 在实现 MVCC 时用到的一致性读视图,即 consistent read view,用于支持 RC(Read Committed,读提交)和 RR(Repeatable Read,可重复度)隔离级别的实现。它没有物理结构,用来在事务执行期间定义“我能看到什么数据”。

“快照”在 MVCC 里是怎么工作的?
在可重复读隔离级别下,事务在启动的时候就“拍了个快照”。注意,这个快照是基于整库的。

这时,你会说这看上去不太现实啊。如果一个库有 100G,那么我启动一个事务,MySQL 就要拷贝 100G 的数据出来,这个过程得多慢啊。可是,我平时的事务执行起来很快啊。
实际上,我们并不需要拷贝出这 100G 的数据,我们先来看看这个快照是怎么实现的。
InnoDB 里面每个事务有一个唯一的事务 ID,叫作 transaction id。它是在事务开始的时候向 InnoDB 的事务系统申请的,是按申请顺序严格递增的
而每行数据也都是有多个版本的。每次事务更新数据的时候,都会生成一个新的数据版本,并且把 transaction id 赋值给这个数据版本的事务 ID,记为 row trx_id。同时,旧的数据版本要保留,并且在新的数据版本中,能够有信息可以直接拿到它。
也就是说,数据表中的一行记录,其实可能有多个版本 (row), 每个版本有自己的 row trx_id
在这里插入图片描述
你可能会问,前面的文章不是说,语句更新会生成 undo log(回滚日志)吗?那么,undo log 在哪呢?

实际上,图中的三个虚线箭头,就是 undo log;而 V1、V2、V3 并不是物理上真实存在的,而是每次需要的时候根据当前版本和 undo log 计算出来的。比如,需要 V2 的时候,就是通过 V4 执行 U3、U2 算出来。

再来想一下,InnoDB 是怎么定义那个“100G”的快照的。

按照可重复读的定义,一个事务启动的时候,能够看到所有已经提交的事务结果。但是之后,这个事务执行期间,其他事务的更新对它不可见。

因此,InnoDB 代码实现上,一个事务只需要在启动的时候,找到所有已经提交的事务 ID 的最大值,记为 up_limit_id;然后声明说,“如果一个数据版本的 row trx_id 大于 up_limit_id,我就不认,我必须要找到它的上一个版本”。当然,如果一个事务自己更新的数据,它自己还是要认的
InnoDB 利用了“所有数据都有多个版本”的这个特性,实现了“秒级创建快照”的能力

继续分析下 Q2 语句返回的结果,为什么是 k=1。
这里,我们不妨做如下假设:

事务 A 开始前,系统里面已经提交的事务最大 ID 是 99;
事务 A、B、C 的版本号分别是 100、101、102,且当前系统里没有别的事务;
三个事务开始前,(1,1)这一行数据的 row trx_id 是 90。
这样,事务 A、B、C 的 up_limit_id 的值就都是 99。
为了简化分析,我先把其他干扰语句去掉,只画出了跟 Q2 查询逻辑有关的操作。
在这里插入图片描述
Q2 的读数据流程是这样的:

  1. 找到 (1,3) 的时候,判断出 row trx_id=101 大于 up_limit_id,要不起;
  2. 接着,找到上一个历史版本,一看 row trx_id=102,还是要不起;
  3. 再往前找,终于找到了(1,1),它的 row trx_id=90,是可以承认的数据。

这样执行下来,事务 A 读到的这个数据,跟它在刚开始启动的时候读到的相同,所以我们称之为一致性读

顺便再想一个问题。(1,1) 这个历史版本,什么时候可以被删除掉呢

答案是,当没有事务再需要它的时候,就可以删掉。

如果只考虑图中的三个事务的话,事务 B 只需要访问到 (1,3) 就可以,而事务 C 需要访问到的是 (1,2)。也就是说,在事务 A 提交后,(1,1) 这个版本就可以被删掉了。

更新逻辑

疑问:事务 B 的 update 语句,读的到底是哪个版本?
在这里插入图片描述
事务 B 前面的查询语句,拿到的 k 也是 1。但是,当它要去更新数据的时候,不能再在历史版本上更新了,否则事务 C 的更新就丢失了。因此,事务 B 此时的 set k=k+1 是在(1,2)的基础上进行的操作。

所以,这里就用到了这样一条规则:更新数据都是先读后写的,而这个读,只能读当前的值,称为“当前读(current read)”。

在更新的时候,当前读取到的数据是 (1,2),更新后生成了新版本的数据 (1,3),这个新版本的 row trx_id 是 101。
所以,在执行事务 B 的 Q1 语句的时候,一看自己的版本号是 101,最新数据的版本号也是 101,可以用,所以 Q1 得到的 k 的值是 3。

其实,除了 update 语句外,select 语句如果加锁,也是当前读

再回到文章开头的问题:事务的可重复读的能力是怎么实现的?

可重复读的核心就是一致性读(consistent read);而事务更新数据的时候,只能用当前读。如果当前的记录的行锁被其他事务占用的话,就需要进入锁等待。

而读提交的逻辑和可重复读的逻辑类似,它们最主要的区别是:

可重复读隔离级别下,只需要在事务开始的时候找到那个 up_limit_id,之后事务里的其他查询都共用这个 up_limit_id;在读提交隔离级别下,每一个语句执行前都会重新算一次 up_limit_id 的值

InnoDB 的行数据有多个版本,每个数据版本有自己的 row trx_id,每个事务或者语句有自己的 up_limit_id。普通查询语句是一致性读,一致性读会根据 row trx_id 和 up_limit_id 的大小决定数据版本的可见性

对于可重复读,查询只承认在事务启动前就已经提交完成的数据;
对于读提交,查询只承认在语句启动前就已经提交完成的数据;
而当前读,总是读取已经提交完成的最新版本。

总结:
本章节是对数据库大佬“丁奇”的学习总结!这是本人认为的一个比较不错的学习资料,特对内容进行总结,方便各位进行学习!
觉得有用的客官可以点赞、关注下!谢谢!

  • 0
    点赞
  • 0
    收藏
    觉得还不错? 一键收藏
  • 0
    评论
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值