您现在的位置是：首页 > 数据库

当前栏目

从NT_NR数据库中提取子库

数据库数据库下载

2023-03-20 14:56:58 时间

估计宿主污染至少80%左右，因而就想通过一些方法，例如kraken、bowtie等把宿主污染去除。

那么就有一个问题，如何选择去除污染的数据库呢？

思来想去，还是从NT库入手，打算把NT库所有动物的序列或者所有小鼠的序列提取出来，做成一个子库，用来去除宿主污染。

百度了一下提取子库的方法，大多都是人云亦云，干脆还是自己整理整理。下面是一些步骤

1 首先下载NCBI的taxonomy数据库

下载完解压缩，其中names.dmp和nodes.dmp两个文件很重要，是后续提取子库的基础

2下载NCBI的TaxonKit软件，http://bioinf.shenwei.me/taxonkit/download/，linux系统直接解压

而后把names.dmp和nodes.dmp两个文件直接cp到~/.taxonkit下，其余的.dmp也可一并cp到~/.taxonkit下

cp taxdump/* ~/.taxonkit

3下载NCBI的csvtk软件，http://bioinf.shenwei.me/csvtk/download/，linux系统也是直接解压，即可使用

4 （选择性步骤）NCBI

taxonomy数据库下还有accession2taxid库，这个库里面也有蛋白以及核酸的accession以及对应的分类id，但是经过尝试，采取这种方法提取的子库序列往往出乎意料的少，很可能是该库的accession与NT/NR库的accession不一致，前者可能冗余更多，因此该方法可忽略，见仁见智吧，下面给个例子，例如：

#从taxonomy数据库中的nucl_wgs.accession2taxid提取accession号
pigz -dc prot.accession2taxid.gz
| csvtk grep -t -f taxid -P $id.taxid.txt
| csvtk cut -t -f accession.version,taxid
| sed 1d
$id.acc2taxid.txt
cut -f 1 $id.acc2taxid.txt > $id.acc.txt

5 查看，并提取动物的taxid

grep -P "|s+aAnimalws|" ~/.taxonkit/names.dmp
33208
taxonkit list --ids 33208 --indent "" > $id.taxid.txt

6 从下载好的NT库提取对应的accession

blastdbcmd -db $NT -entry all -outfmt "%a %T" | csvtk grep -d ' ' -D ' ' -f 2 -P $id.taxid.txt
| cut -d ' ' -f 1
$id.acc.txt

7 从NT库提取完整的nt序列，并提取子库序列

blastdbcmd -db $NT -dbtype nucl -entry all -outfmt "%f" -out - | pigz -c > nt.fa.gz
time cat <(echo) <(pigz -dc nt.fa.gz)
| perl -e 'BEGIN{ $/ = " >"; <>; } while(<>){s/>$//; $i = index $, " "; $h = substr $, 0, $i; $s = substr $, $i+1; if ($h !~ />/) { print ">$"; next; }; $h = ">$h"; while($h =~ />(^ + .+?) ?(?=>|$)/g){ $h1 = $1; $h1 =~ s/^W+//; print ">$h1 $s";} } '
| seqkit grep -f $id.acc.txt -o nt.$id.fa.gz

需要注意的是，这里又使用了seqkit软件。这种从NT库中还原的nt.fa序列里面有很多重复的头文件，例如

所以使用的话，还需要写个perl把这些序列拆开，最终形成nt.anmail.fa.gz

8 如果直接想构建子库，那么没必要搞序列，直接运行

blastdb_aliastool -gilist $id.acc.txt -db $NT -out nt_animal -title nt_animal

猜你喜欢

Python中的函数与方法以及Bound Method和Unbound Method
从本体论开始说起——运营商关系图谱的构建及应用
一篇运维老司机的大数据平台监控宝典（2）-联通大数据集群平台监控体系详解
一篇运维老司机的大数据平台监控宝典（1）-联通大数据集群平台监控体系进程详解
Flask中的请求上下文和应用上下文
深入探讨Java中的异常与错误处理
研究学习Kotlin的一些方法
如何成为一名数据科学家？
金融服务领域的大数据：即时分析
影响大数据、机器学习和人工智能未来发展的8个因素
从未见过的堂兄杀了人，你的DNA是关键证据
一文贯通python文件读取
数据显示Java热度持续下落，日子屈指可数？
从0开始构建一个属于你自己的PHP框架
如何将Hadoop集成到工作流程中？这6个优秀实践必看
2017年5月编程语言排行榜：Java与C语言优势正开始缩小
SEO公司使用大数据优化其模型的5种方法
Java多线程之内置锁与显示锁
关于Web Workers你需要了解的七件事
20个安全可靠的免费数据源，各领域数据任你挑

zl程序教程

当前栏目

从NT_NR数据库中提取子库

相关文章