Cd-hit: быстрая программа для кластеризации и сравнения больших наборов белковых или нуклеотидных последовательностей

Cd-hit: a fast program for clustering and comparing large sets of protein or nucleotide sequences
Weizhong Li, Adam Godzik
2006-05-26

BLASTCD-HITcd-hit-2dcd-hit-estcd-hit-est-2dбазы последовательностей большого масштабакластеризация нуклеотидных последовательностейкластеризация белковых последовательностейсравнение последовательностейультрабыстрая кластеризация
Актуальность: В 2001 и 2002 годах мы опубликовали две статьи (Bioinformatics, 17, 282–283; Bioinformatics, 18, 77–82), описывающие ультрабыструю программу для кластеризации белковых последовательностей под названием cd-hit. Эта программа эффективно кластеризует огромные белковые базы данных с миллионами последовательностей. Однако применение базового алгоритма не ограничивается только кластеризацией белковых последовательностей; в данной работе мы представляем несколько новых программ, использующих тот же алгоритм, включая cd-hit-2d, cd-hit-est и cd-hit-est-2d. Cd-hit-2d сравнивает два набора белковых данных и сообщает о похожих совпадениях между ними; cd-hit-est выполняет кластеризацию базы данных ДНК/РНК; cd-hit-est-2d сравнивает два набора нуклеотидных данных. Все эти программы способны обрабатывать огромные наборы данных с миллионами последовательностей и могут работать в сотни раз быстрее методов, основанных на популярных инструментах сравнения последовательностей и поиска по базам данных, таких как BLAST.
1
Все варианты cd-hit обрабатывают огромные наборы данных с миллионами последовательностей и могут быть на сотни раз быстрее методов на базе таких инструментов, как BLAST.
2
Алгоритм cd-hit обобщён в новые программы: cd-hit-2d для сравнения двух белковых наборов и выявления схожих совпадений.
3
cd-hit — ультрабыстрая программа, способная эффективно кластеризовать очень большие базы белковых последовательностей с миллионами записей.
4
cd-hit-est расширяет алгоритм для кластеризации ДНК/РНК (нуклеотидных) баз последовательностей.
5
cd-hit-est-2d сравнивает два нуклеотидных набора данных для выявления схожих совпадений между ними.

Набор программ CD-HIT для кластеризации и сравнения больших наборов белковых или нуклеотидных последовательностей

Эффективная кластеризация и попарное сравнение очень больших наборов белковых и нуклеотидных последовательностей (масштабируемость, скорость и отчёт о совпадениях по сходству по сравнению со стандартными инструментами)

Publication Details
Publication Date
2006-05-26
Journal
Publisher
ISSN
Access Type
Author Information
Authors
Weizhong Li
Adam Godzik
Explore further
Open the scid.ai AI chat with a ready-made request: it will find papers on a similar topic and help build a literature review.
Find similar papers in the chat
Make a presentation
100%