Cd-hit: быстрая программа для кластеризации и сравнения больших наборов белковых или нуклеотидных последовательностей
Cd-hit: a fast program for clustering and comparing large sets of protein or nucleotide sequences
2006-05-26
SCID: 54.1/9vd25ef8
Discuss with AI
BLASTCD-HITcd-hit-2dcd-hit-estcd-hit-est-2dбазы последовательностей большого масштабакластеризация нуклеотидных последовательностейкластеризация белковых последовательностейсравнение последовательностейультрабыстрая кластеризация
Figures from the paper
Abstract (AI)
Актуальность: В 2001 и 2002 годах мы опубликовали две статьи (Bioinformatics, 17, 282–283; Bioinformatics, 18, 77–82), описывающие ультрабыструю программу для кластеризации белковых последовательностей под названием cd-hit. Эта программа эффективно кластеризует огромные белковые базы данных с миллионами последовательностей. Однако применение базового алгоритма не ограничивается только кластеризацией белковых последовательностей; в данной работе мы представляем несколько новых программ, использующих тот же алгоритм, включая cd-hit-2d, cd-hit-est и cd-hit-est-2d. Cd-hit-2d сравнивает два набора белковых данных и сообщает о похожих совпадениях между ними; cd-hit-est выполняет кластеризацию базы данных ДНК/РНК; cd-hit-est-2d сравнивает два набора нуклеотидных данных. Все эти программы способны обрабатывать огромные наборы данных с миллионами последовательностей и могут работать в сотни раз быстрее методов, основанных на популярных инструментах сравнения последовательностей и поиска по базам данных, таких как BLAST.
Key Findings
1
Все варианты cd-hit обрабатывают огромные наборы данных с миллионами последовательностей и могут быть на сотни раз быстрее методов на базе таких инструментов, как BLAST.
2
Алгоритм cd-hit обобщён в новые программы: cd-hit-2d для сравнения двух белковых наборов и выявления схожих совпадений.
3
cd-hit — ультрабыстрая программа, способная эффективно кластеризовать очень большие базы белковых последовательностей с миллионами записей.
4
cd-hit-est расширяет алгоритм для кластеризации ДНК/РНК (нуклеотидных) баз последовательностей.
5
cd-hit-est-2d сравнивает два нуклеотидных набора данных для выявления схожих совпадений между ними.
Research Object
Набор программ CD-HIT для кластеризации и сравнения больших наборов белковых или нуклеотидных последовательностей
Research Subject
Эффективная кластеризация и попарное сравнение очень больших наборов белковых и нуклеотидных последовательностей (масштабируемость, скорость и отчёт о совпадениях по сходству по сравнению со стандартными инструментами)
Publication Details
Publication Date
2006-05-26
Journal
Publisher
ISSN
Open access PDF
Access Type
Author Information
Download PDF
Subscribe to digest
Работы, цитирующие эту статью3
Библиотека вирусного ORFeome для системного генетического анализа взаимодействий хозяин-патоген2026
Обнаружение специфичных бактерий ризосферы Rhodanobacter, вовлечённых в опосредованную KAI2 толерантность к засухе у Arabidopsis2026
PathogenFinder — различение друга и врага с использованием данных о полном геноме бактерий2013