生物信息之多序列比对,进化树分析,保守位点分析

一、序列下载与整理


下载fasta格式序列

0、输入网址:https://www.ncbi.nlm.nih.gov/gene

1、输入你想查找的序列,比如Syp基因 可以点击图片来查看高清图

这里写图片描述

2、进入基因详细信息页面
这里写图片描述

3、点击Genbank
这里写图片描述

4、如图所示可以下载到fasta格式的序列,注意这里下载的是基因或者蛋白质的全序列

如果你有一定的Python编程基础,可以查看这篇文章来批量下载大量基因序列:生物信息中的Python 04 | 批量下载基因与文献

这里写图片描述

当然,你也可以直接用CDS,各种基因元件来做进化树。

如果你有编程基础,可以参考这篇从 Genbank 文件中提取 CDS 等其他特征序列 来提取基因特征序列。

这里提供一种提取基因启动子区域的方法

  • 假如你希望得到promoter的基因,可以在如图所示的位置输入起始位点和终止位点
  • 一般promoter的位点不确定,可以通过将起始位点左右2kb基因视为promoter
  • 比如:如图起始位点为7638580,那么起始位点要减500,终止位点加1499,这时需要在from输入7638080,to输入7640079(得到长度为2kb的序列)
  • 点击Update view 按钮
  • 然后和同上一步下载fasta序列
    这里写图片描述

合并多个fasta文件

1、下载多个序列后,我们将下载的序列整理到特定文件夹下,比如D:\Download\fasta_files,就像这样:
mark

2、你的fasta_files文件夹里应该是这样的
这里写图片描述

3、返回D:\Download路径下,在文件夹空白地方Shift+右键,点击在此处打开命令窗口
这里写图片描述

4、输入
type fasta_files\*.fasta > all_sequence.fasta
mark

5、现在,在你的文件夹下应该类似这样的:
mark

6、得到整合文件 all_sequence.fasta(这个文件也可以通过记事本打开,下面软件为UE)
这里写图片描述

二、多序列比对


软件下载安装

Clustalw 下载链接:http://www.clustal.org/download/current/clustalw-2.1-win.msi

Clustalx 下载链接:http://www.clustal.org/download/current/clustalx-2.1-win.msi

MEGA 下载链接:http://www.megasoftware.net/releases/MEGA7.0.26_win64_setup.exe

序列比对

1、打开MEGA,进入序列比对分析
这里写图片描述

2、载入fasta序列
这里写图片描述

3、使用Clustalw 比对序列,参数默认点OK
这里写图片描述

4、跑出来的结果需要编辑第一列只留下物种名,序列去掉5’,3’端的空序列(因为要比对序列同源性,最好把显示 - 的序列去掉,使多序列的两端整齐,类似矩阵)
mark

5、导出fasta格式和MEGA格式两种格式
这里写图片描述

6、打开Clustalx 加载刚刚比对完的fasta格式(注意是比对完的,文件后缀名为.fas)
这里写图片描述

7、导出可视化文件,参数默认点OK
这里写图片描述

8、得到可视化的多序列比对结果,打开类似这样(打开用到的软件为Adobe Acrobat)
这里写图片描述

三、进化树分析


1、打开MEGA,载入meg文件
这里写图片描述

2、参数设置(这里是核酸序列)
这里写图片描述

3、得到进化树
这里写图片描述

这里写图片描述

4、导出与美化
这里写图片描述

美化参考:http://www.sohu.com/a/130616941_278730

四、保守位点分析


1、输入网址

MEME : http://meme-suite.org/tools/meme

2、上传fasta序列(这里的序列是整合后的文件,文件后缀.fasta),并输入参数(这里设置motif为10)
这里写图片描述

3、得到保守位点分析结果
这里写图片描述

  • 73
    点赞
  • 389
    收藏
    觉得还不错? 一键收藏
  • 打赏
    打赏
  • 31
    评论
生物信息学是一门研究如何利用计算机和统计学等工具来解析生物学数据的学科。序列和基因组分析生物信息学中的重要研究方向之一。 序列分析是指对生物分子序列(如DNA、RNA和蛋白质序列)进行研究和分析的过程。通过序列比对、序列拼接和序列注释等方法,可以揭示出序列的结构、功能和演化关系。序列分析广泛应用于基因组学、生物多样性、蛋白质结构预测和新药研发等领域。 基因组分析则是对整个基因组的进行研究和解析。基因组是个体的遗传信息的完整集合,包括DNA序列、基因组结构和功能元件等。基因组分析的目标是识别基因、预测基因的功能、研究基因组结构和演化、揭示基因与表型之间的关联等。基因组分析为研究生物体的基因组组成、功能和调控提供了重要的工具和方法。 PDF格式是一种常用的电子文档格式,生物信息学领域也有大量的相关资料以PDF格式发布。《生物信息学:序列和基因组分析》PDF是一本介绍生物信息学中序列和基因组分析原理和方法的书籍。该书系统地介绍了序列比对、序列拼接、序列注释、基因预测、基因组结构和演化等内容,帮助读者理解和应用生物信息学在序列和基因组分析方面的重要技术。 总之,生物信息学中的序列和基因组分析是研究生物分子序列和整个基因组的结构、功能和演化的重要领域。《生物信息学:序列和基因组分析》PDF是一本介绍该领域原理和方法的书籍,对于学习和应用生物信息学的研究者和学生具有重要意义。

“相关推荐”对你有帮助么?

  • 非常没帮助
  • 没帮助
  • 一般
  • 有帮助
  • 非常有帮助
提交
评论 31
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包

打赏作者

白墨石

你的鼓励将是我创作的最大动力

¥1 ¥2 ¥4 ¥6 ¥10 ¥20
扫码支付:¥1
获取中
扫码支付

您的余额不足,请更换扫码支付或充值

打赏作者

实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值