使用Eagle2进行单倍型分析

欢迎关注”生信修炼手册”!

Eagle2是一款单倍型分析软件,相比shapeit, 其运行速度提高了20倍左右,准确率也增加了10%,官网如下

https://data.broadinstitute.org/alkesgroup/Eagle/

对应的文章发表在nature genetics上,链接如下

https://www.nature.com/articles/ng.3679

核心算法图示如下

对于reference haplotype, 通过PBWT转换之后构建前缀树,树枝的宽度代表了单倍型的频率,频率越高,树枝越宽。对于study样本的分型结果,将可能的单倍型映射到前缀树中,结合HMM模型来预测对应的单倍型。

和shapiet2等软件进行比较,结果如下所示

从图a可以看出,Eagle2的运行时间最快,而且非常恒定,并不会随着reference panel中单倍型的增多而加大运行时间, shapeit2的运行时间和panel size则基本是一个线性关系。

从图b可以看出,panel size的增加有助于降低错误率,而不同软件之间的比较可以发现,Eagle2的错误率最低。利用1000G和HRC两个reference panel进行比较,可以得出相同的结论,结果如下

HRC的单倍型比1000G多很多,利用HRC进行phasing的错误率显著降低。study样本的对运行时间和准确率的影响如下

可以看到,样本越多,运行时间越久,错误率越低。相比shapeit2, Eagle2的运行速度更快,错误率更低。

该软件的基本用法如下

eagle \
--vcfRef HRC.r1-1.GRCh37.chr20.shapeit3.mac5.aa.genotypes.bcf \
--vcfTarget sample.chr1.vcf.gz \
--geneticMapFile genetic_map_chr1_b37.txt
--outPrefix chr1.phased \


要求输入的study样本和reference panel的格式为VCF/BCF, 而且需要tabix的索引,如果是plink格式,可以通过plink2转换成VCF, 官方推荐使用bcftools进行VCF和BCF的格式转换和建立索引操作。

鉴于Eagle2运行速度和准确率的优势,基因型填充的web服务会使用该软件来进行phasing, 以保证运行速度和用户体验。

·end·

—如果喜欢,快分享给你的朋友们吧—

扫描关注微信号,更多精彩内容等着你!

评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值