【一文读懂生物学重复与技术重复】

在RNA-Seq等测序设计中,生物学重复和技术重复,是非常需要注意的问题。

那么问题就来了,生物学重复和技术重复,到底是什么?它们是如何影响我们的实验设计的。

生物学重复(biological replicate):可以理解为我们对一个群体进行研究,但是我们不会对整个群体进行检测(考虑到成本和工作量的问题,我们肯定也不会采取这种地毯式的方法),只是抽取群体中的一部分进行检测,用样本来代表总体。

这边样本个数,实际上就是生物学重复数。

技术重复(technical replicate):对一个样本的数值进行多次测定。

下表给出常见实验对应重复类型:

image.png

实例

Replication这篇文章以测定小鼠肝脏细胞中的某一个gene的表达量为例,展示了什么是生物学重复和技术重复以及如何权衡这两者之间的关系。

分别给出3种类型的重复,分别为:
(1)animal水平的重复
(2)cell水平的重复
(3)技术重复

image.png

由上图可以得到,3种不同种类的重复,所计算出来的表达量方差是不一样的,但gene表达量的总方差,可以有下列公式计算得到:

σ T O T 2 = σ A 2 + σ C 2 + σ M 2 σ_{TOT}^2 = σ_{A}^2 + σ_{C}^2 + σ_{M}^2 σTOT2=σA2+σC2+σM2

接下来,将总体的重复次数限定,即在满足 n A ∗ n C ∗ n M = 48 n_{A}*n_{C}*n_{M}=48 nAnCnM=48的前提条件下,对Var(X)进行计算。

n A n_{A} nA代表动物样本数, n C n_{C} nC代表细胞样品数, n M n_{M} nM代表技术重复次数, V a r ( X ) Var(X) Var(X)是基因表达量误差

V a r ( X ‾ ) Var(\overline{X}) Var(X) V a r ( X ) Var(X) Var(X)的变式,含义是the precision in the expression mean,计算公式为 σ A 2 n A + σ C 2 n A n C + σ M 2 n A n C n M \frac{σ_{A}^2}{n_{A}} + \frac{σ_{C}^2}{n_{A}n_{C}} + \frac{σ_{M}^2}{n_{A}n_{C}n_{M}} nAσA2+nAnCσC2+nAnCnMσM2

1、当 n A n_{A} nA n M n_{M} nM均为1, n C n_{C} nC为48的情况下,计算出来的Var(X)如下图标记:

image.png

这种情况下,只反映了由于cell样品重复和技术重复所引起的基因表达量误差。当n_{A}=1(动物样品数为1),即无法计算由于animal样品数变化,所带来的基因表达量误差。

因此在上述情况下, σ T O T 2 ( V a r ( X ) ) σ_{TOT}^2(Var(X)) σTOT2Var(X)就被低估了。

2、当 n A n_{A} nA n C n_{C} nC均为1, n M n_{M} nM为48的情况下

计算得到的基因表达量误差完全是由于技术重复所引起的。因此,如果我们将这种情况下的误差,认定为由生物重复所引起的,就造成了假阳性。

作者在文章中,还指出了非常重要的一点:虽然增加技术重复,可以让我们对σ_{M}2有一个更准确的估计,但是没必要。因为提升动物样品数,可以使σ_{M}2可忽略不计(以Var(\overline{X}))。

同时,需要注意的是,将是样品放入同一批次进行测序,减少批次效应对数据的影响。

同样地,每一种重复对于真实基因表达量的方差贡献也不是相同的。

因为cell重复和测定技术重复,并是一个独立变量。技术重复本质上是对同一份样品进行测定,数据在这种情况下的变异,完全是由于人为或机器造成的,而cell重复在本质上可以认为与animal样品之间存在相关性,因此也不是独立的。

3、从 V a r ( X ‾ ) Var(\overline{X}) Var(X)的角度,来选择replicate

【标注】 V a r ( X ‾ ) Var(\overline{X}) Var(X)越小,代表对 V a r ( X ) Var(X) Var(X)估计越准确

image.png

可以看到的是,当增大animal重复数时, V a r ( X ) Var(X) Var(X)趋于一个稳定值,该样本对总体的估计达到了一个较为准确的水平,同时 V a r ( X ‾ ) Var(\overline{X}) Var(X)的值也接近于0。

4、从统计检验的角度,来选择replicate

使用two-sample t检验,来判断cell样品的gene表达量方差、动物样品表达量均值之间是否存在显著差异。

下图很明显的一个结果就是,随着 n A n_{A} nA的增加,统计检验的效能得到提升,假阳性也降低了(同时也得权衡 n A n_{A} nA n B n_{B} nB

总结

对于一组数据来说,研究对象的生物重复本身所包含的影响比技术重复大,因此在进行实验设计时,最好将实验/测序资源倾向这边,而不是技术重复(除非对技术重复所诱发的影响感兴趣)

参考资料

[1] 刘小乐老师-哈佛计算生物学与生物信息学
[2] Blainey P, Krzywinski M, Altman N. Points of significance: replication[J]. Nature methods, 2014, 11(9): 879.

  • 1
    点赞
  • 3
    收藏
    觉得还不错? 一键收藏
  • 0
    评论
"Faster"是一个英文单词,它的意思是更快的意思。在不同的背景下,它可以有不同的解释和应用。 在日常生活中,"faster"通常表示一个行动或者动作的速度比以往更快。例如,当我们走路、跑步、开车或者骑自行车时,我们可以尝试跑得更快或者骑得更快。这个词还可以用来形容物体的移动速度,比如火车、飞机或者摩托车的速度。此外,"faster"也可以用来描述人们的反应速度、思维速度或者学习速度等。 此外,在科技和互联网领域,"faster"也具有很重要的含义。随着科技的不断进步,人们追求更快的处理速度和传输速度。例如,我们常常会听到"更快的互联网连接"、"更快的计算机处理速度"、"更快的数据传输速度"等等。这些技术进步使得信息的获取和交流变得更加高效和便捷。 然而,在追求速度的同时,我们也要权衡速度和其他因素之间的平衡。有时候,过于追求速度可能会带来其他的负面影响,比如对安全性和质量的妥协。所以在实际应用中,需要综合考虑各种因素来确定速度的优先级。 总之,"faster"是一个多功能的词,可以用来描述日常生活中的行动速度,物体的移动速度,人们的思维或者学习速度,以及科技领域的处理速度和传输速度等等。同时,我们也要在追求速度的过程中,平衡各种因素并合理使用这个词。

“相关推荐”对你有帮助么?

  • 非常没帮助
  • 没帮助
  • 一般
  • 有帮助
  • 非常有帮助
提交
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值