mothur summary.seqs 统计fasta文件中每条序列的长度

在介绍summary.seqs的用法之前，我们首先需要搞清楚两个概念：

1）ambiguous bases

中文叫做模糊碱基，对于DNA序列来说，只有ATCG 4种碱基，在IUPAC定义的碱基标准中，出了上述4种碱基之外，还包括其他的碱基，可以代表不同类型的碱基

代码		英文含义	中文含义
G		Guanine	鸟嘌啉
A		Adenine	腺嘌啉
T	(U)	Thymine (Uracil)	胸腺嘧啶 (尿嘧啶)
C		Cytosine	胞嘧啶
R	(A or G)	PuRine	嘌啉
Y	(C or T or U)	Pyrimidine	嘧啶
M	(A or C)	Amino	腺嘌啉或胞嘧啶(氨基)
K	(G or T)	Ketone	鸟嘌啉或胸腺嘧啶(酮基)
S	(C or G)	Strong interaction	强相互作用碱基
W	(A or T)	Weak interaction	弱相互作用碱基
H	(A or C or T)	Not-G (H after G)	非鸟嘌啉
B	(C or G or T)	Not-A (B after A)	非腺嘌啉
V	(A or C or G)	Not-T/U (V after U)	非胸腺嘧啶
D	(A or G or T)	Not-C (D after C)	非胞嘧啶
N	(A or C or G or T)	Any	不确定

模糊碱基实际上就是除了A T C G 这4种碱基之外的其他碱基

2）homopolymer base

由1个碱基重复多次的序列，比如GCAGAAAAAAA 序列中，末端的一串A就是 homopolymer base

summary.seqs的基本用法：

mothur "#summary.seqs(fasta = "input.fasta")"

运行成功之后，会生成input.summary 文件，内容如下：

seqname	start	end	nbases	ambigs	polymer	numSeqs

1	1	24	24	0	2	1

2	1	25	25	10	10	1

3	1	25	25	2	1	1

4	1	24	24	0	18	1

5	1	24	24	0	2	1

6	1	24	24	0	1	1

7	1	24	24	0	1	1

8	1	25	25	0	2	1

共7列，每列表头含义如下：

seqname : 序列标识符

start : 起始位置，从1开始

end : 终止位置，

nbases : 总碱基数，可以看做序列长度

ambigs : ambiguous bases 模糊碱基的数目

polymer : homopolymer 碱基的最大长度

numSeqs : 序列数，对于每条序列来说，其值总是为1

除了上述的基本用法外，summary.seqs 还有很多的参数；

processors : CPU个数，mothur 是支持并行的，通过设置processors 参数可以并行执行程序，用法如下：

mothur "#summary.seqs(fasta = "input.fasta"， processors = 10)"

mothur summary.seqs 统计fasta文件中每条序列的长度的更多相关文章

使用python脚本实现统计日志文件中的ip访问次数
使用python脚本实现统计日志文件中的ip访问次数,注意此脚本只适用ip在每行开头的日志文件,需要的朋友可以参考下适用的日志格式: 106.45.185.214 - - [06/Aug/2014: ...
统计一个文件中出现字符'a'的次数
# -*- coding: utf-8 -*- #python 27 #xiaodeng #统计一个文件中出现字符'a'的次数 #http://www.cnblogs.com/hongten/p/ho ...
[linux] shell脚本编程-统计日志文件中的设备号发通知邮件
1.日志文件列表比如:/data1/logs/2019/08/15/ 10.1.1.1.log.gz 10.1.1.2.log.gz 2.统计日志中的某关键字shell脚本 zcat *.gz|gr ...
c语言统计一个文件中的单词，字符和行数
body, table{font-family: 微软雅黑; font-size: 10pt} table{border-collapse: collapse; border: solid gray; ...
统计python文件中的代码,注释,空白对应的行数
其实代码和空白行很好统计,难点是注释行 python中的注释分为以#开头的单行注释或者以'''开头以'''结尾或以"""开头以"""结尾 ...
根据位置信息提取 fasta 文件中的序列 -- extract fasta sequence by their position
#!/usr/bin/env python # usages: python extract_seq_by_pos.py input.fasta id_start_end > result.fa ...
统计py文件中的代码行
希望是输入一个合法的文件夹的路径,然后代码自动读取该文件夹下的每个py结尾的文件内的代码行数,最后汇总一个数,但现在只是有思路,却没时间写,这是能读取同级文件下的某个文件, with open('te ...
用 perl 统计 fasta 文件序列的总长
#!/usr/bin/perl -w use strict; die "Usage: $0 <file>\n" unless (@ARGV == 1); my $lin ...
java简单统计.java文件中的有效代码行，空行，注释行
package regxdemo; import java.io.BufferedReader; import java.io.File; import java.io.FileNotFoundExc ...

随机推荐

【Android】ADB常用指令与logcat日志
ADB命令简介 ADB是一个功能强大的命令行工具.通过它可以直接和模拟器或真机进行交互.它是一个具有客户端和服务器端的程序. 它主要由三个部分组成: 客户端,它运行在你的开发机上,你可以通过执行adb ...
Docker 入门 --- 命令总结
Docker命令总结前言命令来自于官网的get-started教程,放在这里自用 part-1 ## List Docker CLI commands docker docker containe ...
我的Linux学习之路及参考书籍
学习目的很简单的考虑,最近在各大招聘网站上找工作,发现多数c/c++开发职位都需要Linux开发经验,让我很苦恼,因为Linux我到目前为止知之甚少,知道Linux的概念,也在大学期间了解过一段时间 ...
FastJson的常用操作
FastJson的常用操作 2017-06-05 常用操作包括以下内容: 对象与(JsonObject或JsonArray)与String的互换 String转换为(JsonObject或JsonAr ...
手记：配置IIS服务器，支持sis、SISX、3GP、ADP、AMR、JAD、JAR、MMF、MFM、PMD、UMD等文件下载
发此博文原因是遇到一个手机端读取服务器端.amr格式文件失败的例子. 反复测试发现从服务端无法播放,或下载.amr格式的文件.就想到可能是服务器站点托管服务 IIS不支持对.amr格式的解析,意 ...
[转]Httrack工具与使用指南
HTTrack工具介绍 HTTrack是一个网站镜像工具,本来是用来抓取网站做离线浏览用的.但是HTTrack的爬虫特性和搜索引擎蜘蛛爬虫非常的像,这也逐渐应用到 SEO(搜索引擎优化)工作中.其实这 ...
Install CasperJS on Windows
Phantomjs installation additionsAppend ";C:\phantomjs" to your PATH environment variable. ...
Java并发编程 LockSupport源码分析
这个类比较简单,是一个静态类,不需要实例化直接使用,底层是通过java未开源的Unsafe直接调用底层操作系统来完成对线程的阻塞. package java.util.concurrent.locks ...
Redis (1) —— 安装
Redis (1) -- 安装摘要介绍Mac OS X安装Redis基本方法版本 Redis版本: 2.8.24 内容下载Redis包地址:http://download.redis.io/ ...
Sahi (1) —— 快速入门（101 Tutorial）
Sahi (1) -- 快速入门(101 Tutorial) jvm版本: 1.8.0_65 sahi版本: Sahi Pro 6.1.0 参考来源: Sahi官网 Sahi Quick Tutori ...

mothur summary.seqs 统计fasta文件中每条序列的长度

mothur summary.seqs 统计fasta文件中每条序列的长度的更多相关文章

随机推荐

热门专题