Поиск и кластеризация с производительностью на несколько порядков выше, чем у BLAST

Search and clustering orders of magnitude faster than BLAST
R. C. Edgar
2010-08-12

UBLASTUCLUSTUSEARCHбыстрый поиск последовательностейкластеризация последовательностей высокой пропускной способности
Актуальность: Биологические последовательностные данные быстро накапливаются, что стимулирует разработку улучшенных высокопропускных методов классификации последовательностей. Результаты: UBLAST и USEARCH — новые алгоритмы, обеспечивающие чувствительный локальный и глобальный поиск по большим базам последовательностей с исключительно высокой скоростью. В практических приложениях они часто работают на несколько порядков быстрее, чем BLAST, хотя чувствительность к отдалённым белковым связям ниже. UCLUST — новый метод кластеризации, использующий USEARCH для назначения последовательностей к кластерам. UCLUST предлагает несколько преимуществ по сравнению с широко используемой программой CD-HIT, включая большую скорость, меньшие требования к памяти, повышенную чувствительность, кластеризацию при более низких значениях идентичности и классификацию значительно больших наборов данных. Доступность: двоичные файлы доступны бесплатно для некоммерческого использования по адресу http://www.drive5.com/usearch.
1
UBLAST и USEARCH часто на порядки быстрее BLAST в практических применениях.
2
UBLAST и USEARCH имеют более низкую чувствительность к далеким белковым отношениям по сравнению с BLAST.
3
UBLAST и USEARCH обеспечивают чувствительный локальный и глобальный поиск последовательностей в больших базах данных с исключительно высокой скоростью.
4
UCLUST способна классифицировать значительно большие наборы данных, чем CD-HIT.
5
UCLUST использует USEARCH для присвоения последовательностей к кластерам и обеспечивает более высокую скорость, чем CD-HIT.
6
UCLUST требует меньше памяти, обладает повышенной чувствительностью и поддерживает кластеризацию при более низких порогах идентичности по сравнению с CD-HIT.

Алгоритмы UBLAST, USEARCH и UCLUST для поиска и кластеризации биологических последовательностей

Производительность и компромиссы этих алгоритмов: скорость поиска и кластеризации (на порядки быстрее BLAST), чувствительность (включая пониженную чувствительность к далеким белковым родствам), использование памяти, способность кластеризовать при более низких порогах идентичности и масштабируемость на большие наборы данных

Publication Details
Publication Date
2010-08-12
Journal
Publisher
ISSN
Access Type
Author Information
Authors
R. C. Edgar
Explore further
Open the scid.ai AI chat with a ready-made request: it will find papers on a similar topic and help build a literature review.
Find similar papers in the chat
Make a presentation
100%