来自：https://www.jianshu.com/p/e6a5e1f85dda

使用BRAKER2进行基因组注释

BRAKER2是一个基因组注释流程，能够组合GeneMark，AUGUSTUS和转录组数据。

在使用软件之前，有几点需要注意下

尽量提供高质量的基因组。目前随着三代测序价格下降，这一点问题不大。
基因组命名应该简单，最好就是">contig1"或">tig000001"
基因组需要屏蔽重复序列
默认参数通常表现效果就很好，但是也要根据物种来
一定要对注释结果进行检查，别直接使用

软件安装

BRAKER的依赖软件不少，且Perl需要安装的模块也很多，我们用conda能解决这些问题(需要添加bioconda频道)

安装结束后会输出一些提示信息，汇总以下就是

保证AUGUSTUS的config目录能够有可写权限（自己用conda安装不需要考虑这个问题）
GeneMark和GenomeThreader还需要额外下载安装

我们一定要安装的就是GeneMark，需要从 http://exon.gatech.edu/GeneMark/license_download.cgi 下载安装，然后添加环境变量

此外还有一些BRAKER2建议的软件，conda没有安装，需要自己按需安装

DIAMOND 0.9.24: 替代NCBI-BLAST+
cdbfasta 0.99: 纠正AUGUSTUS预测的开放阅读框内内含有终止密码子的基因
cdbyank 0.981: 纠正AUGUSTUS预测的开放阅读框内内含有终止密码子的基因
GenomeThreader: 仅在你需要用蛋白数据进行注释时，才需要

关于这些conda未安装的软件参考https://github.com/Gaius-Augustus/BRAKER#optional-tools

以cdbfasta和cdbyank为例

之后可以添加到环境变量

也可以复制到conda建立的braker2的环境中，其中~/miniconda3是我conda的路径

安装完成之后，建议现运行下面这一步检查软件依赖

软件运行

BRAKER根据数据类型，有不同的运行模式，但根据现状其实最常见的情况是测了一个基因组，并且还测了二代的转录组，或许还有一些近缘物种的蛋白序列。因此假设你手头有下面这些数据

基因组序列: genome.fasta
转录组数据: XX_1.fq.gz, XX_2.fq.gz
蛋白序列: proteins.fa

第一步: 屏蔽基因组中的重复序列，这一步参考使用RepeatModeler和RepeatMasker注释基因组重复序列

这一步输出的genome.fasta.masked将是后续注释的输入

第二步: 使用STAR将FastQ比对到参考基因组，STAR使用说明参考「RNA-seq分析软件」RNA-seq比对工具STAR学习笔记

输入结果为 xx.bam 如果测了多个组装的转录组，为每个样本运行一次比对生成多个BAM文件。

第三步: 运行BRAKER2

braker.pl最多支持48个线程。

最终会输出蛋白序列和CDS序列以及GFF文件

可能问题

使用conda安装时可能会出现的问题

原因是因为faToTwoBit程序出错

这是因为conda没能正确处理依赖关系，openssl版本过高，解决方法如下

运行时出现如下警告

无视掉

参考资料

BRAKER2官方教程: https://github.com/Gaius-Augustus/BRAKER

关注下方公众号可获得更多精彩

使用BRAKER2进行基因组注释的更多相关文章

【annotation】非人类物种基因组注释（MSU为例）
基因组注释工具ANNOVAR是一款非常好用的注释软件,功能强大,输出数据简单美中不足就是对于非人类物种来说UI不够完善,因此总结一下整个注释的过程,帮助别人快乐自己. 首先我们需要明确我们需要的数据和 ...
【基因组预测】braker2基因结构注释要点记录
目录流程使用问题记录下braker2的使用要点,以备忘记. 流程使用 braker2有很多流程,根据你的数据:组装的基因组.转录组.蛋白(同源,包括近缘或远缘)选择不同流程,官网有说明: htt ...
植物基因组|注释版本问题|重测序vs泛基因组
生命组学: 细菌和其他物种比,容易发生基因漂移,duplication和重排. 泛基因组学研究的一般思路是通过comparison找到特殊基因区域orspecific gene,研究其调控机制(即通过 ...
Bedtools如何比较两个参考基因组注释版本的基因？
目录问题思路问题原问题来自:How to calculate overlapping genes between two genome annotation versions? 其实可分为两个 ...
【基因组注释】同源注释比对软件tblastn、gamp和exonerate比较
基因结构预测中同源注释策略,将mRNA.cDNA.蛋白.EST等序列比对到组装的基因组中,在文章中通常使用以下比对软件: tblastn gamp exonerate blat 根据我的实测,以上软件 ...
【基因组注释】ncRNA注释
目录 1. ncRNA 2. 软件 tRNA注释 rRNA注释其他ncRNA注释 3. 注释 tRNA rRNA snRNA.miRNA等 4. snRNA.miRNA等结果的统计 1. ncRNA ...
【基因组注释】RepeatMasker和RepeatModeler安装、配置与运行避坑
目录 1.conda安装 2.配置RepBase 3.RepeatMasker避坑 4.RepeatProteinMask避坑 5.RepeatModeler避坑 6.自定义重复序列库后记 1.co ...
关于基因组注释文件GTF的解释
GTF文件的全称是gene transfer format,主要是对染色体上的基因进行标注.怎么理解呢,其实所谓的基因名,基因座等,都只是后来人们给一段DNA序列起的名字而已,还原到细胞中就是细胞核里 ...
【基因组注释】GMAP安装使用问题
homology策略预测基因结构,下载了公共mRNA/CDS序列,考虑用gmap比对.本来是个很简单的脚本,但总是不那么顺利. 无论是用conda安装,还是源码安装较新版本,都存在问题. gmap_b ...

随机推荐

[no_code][Beta]事后分析
设想和目标我们的软件要解决什么问题?是否定义得很清楚?是否对典型用户和典型场景有清晰的描述? 我们要解决的目前的手写表单的电子化问题,办公电子化问题的一个key问题.定义十分清楚: 输入: 手写表单 ...
Scrum Meeting 0507
零.说明日期:2021-5-7 任务:简要汇报两日内已完成任务,计划后两日完成任务一.进度情况组员负责两日内已完成的任务后两日计划完成的任务 qsy PM&前端测试测试 cyy ...
8.18考试总结[NOIP模拟43]
又挂了$80$ 好气哦,但要保持优雅.(草 T1 地衣体小小的贪心:每次肯定从深度较小的点向深度较大的点转移更优. 模拟一下,把边按链接点的子树最大深度排序,发现实际上只有上一个遍历到的点是对当前考 ...
单片机stm32F103单片机晶振不起振的原因分析
这是我在做单片机最小系统板时候碰到的问题,之前虽然也做过相似的板子,可是未曾出现过无源晶振不起振的问题.下面是我在遇到问题后的一些检查,排除问题的过程.本人小菜鸟一个,文章中如有错误和不足,还望各位大 ...
Node.js躬行记（13）——MySQL归档
当前我们组管理着一套审核系统,除了数据源是服务端提供的,其余后台管理都是由我们组在维护. 这个系统就是将APP中的各类社交信息送到后台,然后有专门的审核人员来判断信息是否合规,当然在送到后台之前已经让 ...
第08课 OpenGL 混合
混合: 在这一课里,我们在纹理的基础上加上了混合,它看起具有透明的效果,当然解释它不是那么容易,当希望你喜欢它. 简单的透明OpenGL中的绝大多数特效都与某些类型的(色彩)混合有关.混色的定义为,将 ...
Jmeter 运行结果的csv文件生成报告
把运行结果保存到本地,下次可以直接用结果生成测试报告. 一.首先保证脚本能正常运行二.本地创建csv文件,用来保存运行结果三.察看结果树,选择本地文件(上一步创建好的csv文件),保存运行结果,如 ...
webpack 提取css成单独文件
webpack 提取css成单独文件 // 用来拼接绝对路径的方法 const {resolve} = require('path') const HtmlWebpackPlugin = requir ...
Vue.js教程 2.体验Vue
Vue.js教程 2.体验Vue <!DOCTYPE html> <html lang="en"> <head> <meta charse ...
Oracle system 用户无法登录问题
新手刚用Oracle数据库时,可能会遇到system用户无法登录情况. 问题原因:1.可能输入默认密码时输入错误(比较低级,一般不会范). 2.可能你在安装的时候设置了密码,但是在登录的时候密码不正确 ...

使用BRAKER2进行基因组注释

来自：https://www.jianshu.com/p/e6a5e1f85dda

使用BRAKER2进行基因组注释

软件安装

软件运行

可能问题

参考资料

使用BRAKER2进行基因组注释的更多相关文章

随机推荐

热门专题