cocostuff10k数据集介绍_GEO数据库介绍 (二)

前面我们GEO数据库的检索方式。但是对于里面的每一个数据集内容没有详细的解释,这次呢,我们就来介绍一下每个数据集里面包括哪些内容。

这次我们用GSE79973数据集进行介绍。(https://www.ncbi.nlm.nih.gov/geo/query/acc.cgi?acc=GSE79973)

数据集整体介绍

对于一个数据集而言,首先能看到的是提交这个数据的作者对于这个数据集的基本介绍。其中包括了数据集的题目、检测的物种、测序的类型和实验的整体设计。

39fed207b574a63c265418b4029645c8.png

我们主要是通过这一部分来选择我们想要的数据集,数据集是否符合我们的要求还是看我们想要做什么样子的分析。最基本的需要确定的就是:疾病分组、所用物种以及测序类型是否是我们想要的就行。

数据集贡献者信息

在这一部分我们能看到提交数据的作者的信息。

01c0c346bf621dc523d721ad7585bc92.png

在这里面,我们主要还是看作者之前用这个数据集发表了什么文献,了解了人家发表了什么,我们才能去找其他方面的创新点。

数据集作用的平台

数据集所有的平台(Platforms),也就是我们指我们是用什么公司的什么检测技术来做的数据。例如,这个数据集就是用了Affymetrix公司的Human Genome U133 Plus 2.0芯片。

e9b998737aa697b9db00dd0461f4ecd7.png

这里的平台还要出了告诉我们是用什么技术做的数据。另外的话,如果是芯片数据的话。还会包括一个注释文件。这里简单的说一下注释文件这个东西。

注释文件

注释文件:类似于密码解读器一样。我们在做芯片检测的时候,检测的一般都是一些核苷酸序列。这个就类似于一段看不懂的密码。对于我们而言,其实只是想知道基因的变化。通过注释文件,我们就知道一段段的密码对应的是什么基因了。那这段密码的变化也就代表这个基因的变化了。

dcf5139614320ffec25f2dc75fb9c18d.png

拿这个表达谱芯片而言,我们点击GPL570的链接,就可以看到这个芯片的注释文件了。

eafc2c5b60d8c706e79a6ddccfc31552.png

样本信息

再往下,我们看到的就是样本信息了。每一个数据集都包括很多个样本。每个样本的基本信息,我们就可以在这个部分看到。

通过下图,可以看到这个数据集包括20个样本。其中10个是胃癌组织,另外十个则是正常对照组织。

所以对于GEO的数据而言,如果是GSE开头的就是数据集;如果是GSM开头的就是数据集里面的一个样本。

749713fec3eb643defe82ba3751604d9.png

原始数据下载

在原始数据下载部分,GEO提供了多种下载方式。对于我们而言,如果想要下载原始数据的话,下载 矩阵文件(Series Matrix File(s)) 即可。如果一定要最原始的数据的话,则可以下载下面那个附加文件。

b20e915227521ee201097a7e3d35d801.png

矩阵文件介绍

我们在下载了矩阵文件,解压之后可以用excel打开。

dd00559f067756ea6bf7d56b886f0434.png

打开之后,主要也包括三种信息:

  • 数据集的信息: 以Series开头

fa7952a81984424c7112d4d448d3a39d.png

  • 每一个样本的信息: 以sample开头。这里有时候会包括一些临床信息的。有的比如每个样本的TNM分期;预后信息都很良心的放到里面的。

b0795ed76033cadeffafe82a58025ca2.png

  • 基因每一个ID在每个样本之间的表达信息。第一列是每一个探针的ID号,至于这个ID号对应的基因是什么。可以去注释文件当中找的

57507eac982f770e7f97275ca0314b59.png

原始文件的用处

对于高通量数据而言,我们在得到这么多维度的数据,可以做点儿什么呢?

对于表达数据的分析,第一步要做的往往是找哪些在不同的疾病分组当中,存在差异的基因有哪些?这个俗称差异表达分析。如果我们只是来做差异表达分析的话,那其实也不用下载原始数据。在GEO里面有一个自带的工具就可以做。这个工具叫做GEO2R。这个我们明天在介绍。

PS: 那既然在线软件可以做了,为啥还要下载原始数据呢?原始数据其实也可以做其他的分析的嘛。我们矩阵当中一行就代表一个基因在各个样本的表达量,那例如:作者还提供了样本信息,比如说,提供了癌症患者的生存信息,那我们就可以来做每个基因是不是和生存有关系了。如果提供了TNM分期,那也就可以分析每个基因和TNM分析有没有关系了。至于如何分析嘛,最简单的SPSS应该还是可以做的吧。

  • 0
    点赞
  • 0
    收藏
    觉得还不错? 一键收藏
  • 0
    评论

“相关推荐”对你有帮助么?

  • 非常没帮助
  • 没帮助
  • 一般
  • 有帮助
  • 非常有帮助
提交
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值