PLINK второго поколения: ответ на вызов, связанный с увеличением объёма и богатства наборов данных

Second-generation PLINK: rising to the challenge of larger and richer datasets
Christopher Chang, Carson C. Chow, Laurent CAM Tellier, Shashaank Vattikuti, Shaun Purcell, James J. Lee
2015-02-24

PLINK 1.9побитовый параллелизмполногеномные ассоциативные исследованиягенотипические вероятностипопуляционная генетика
ПРЕДПОСЫЛКИ: PLINK 1 — широко используемый набор инструментов с открытым исходным кодом на C/C++ для полногеномных исследований ассоциаций (GWAS) и исследований в области популяционной генетики. Однако постоянное накопление данных, получаемых в исследованиях с использованием импутации и полногеномного секвенирования, выявило острую потребность в более быстрых и масштабируемых реализациях ключевых функций, таких как логистическая регрессия, оценка неравновесия по сцеплению и вычисление геномных расстояний. Кроме того, данные GWAS и популяционно-генетические данные теперь часто содержат правдоподобия генотипов, информацию о фазе и/или мультиаллельные варианты, ни один из которых не может быть представлен в основном формате данных PLINK 1. РЕЗУЛЬТАТЫ: Для решения этих проблем мы разрабатываем кодовую базу PLINK второго поколения. Первый крупный выпуск на основе этой кодовой базы — PLINK 1.9 — предусматривает широкое использование параллелизма на уровне битов, тесты Харди—Вайнберга и точный тест Фишера с временем выполнения [Formula: see text] и постоянным потреблением памяти, а также множество других алгоритмических улучшений. В совокупности эти изменения ускоряют большинство операций на 1–4 порядка величины и позволяют программе обрабатывать наборы данных, слишком большие для размещения в оперативной памяти. Мы также разработали расширение формата данных, добавляющее поддержку с низкими накладными расходами правдоподобий генотипов, фаз, мультиаллельных вариантов и референсных и альтернативных аллелей; это расширение лежит в основе запланированного нами второго выпуска (PLINK 2.0). ВЫВОДЫ: Версии PLINK второго поколения обеспечат значительное повышение производительности и совместимости. Впервые пользователи, не имеющие доступа к высокопроизводительным вычислительным ресурсам, смогут выполнять несколько важных анализов богатых признаками и очень больших генетических наборов данных, которые входят в широкое употребление.
1
Расширенный формат данных поддерживает с низкими накладными расходами вероятности генотипов, информацию о фазе, мультилельные варианты и референсные и альтернативные аллели.
2
PLINK 1.9 может обрабатывать наборы данных, не помещающиеся в оперативную память, расширяя доступ к анализу без высокопроизводительных вычислительных ресурсов.
3
PLINK 1.9 внедряет битовый параллелизм и алгоритмические улучшения для масштабируемого геномного анализа ассоциаций и популяционно-генетических исследований.
4
Новая реализация ускоряет большинство операций в 1–4 порядка по сравнению с PLINK 1.
5
Планируемый выпуск PLINK 2.0 основан на этом расширенном формате и направлен на улучшение совместимости со всё более сложными генетическими наборами данных.

Программное обеспечение PLINK второго поколения и генетические наборы данных для полногеномных ассоциативных и популяционно-генетических исследований

Масштабируемая вычислительная производительность и совместимость формата данных при анализе очень больших и функционально насыщенных генетических наборов данных, включая вероятности генотипов, информацию о фазировке и мультиаллельные варианты

Publication Details
Publication Date
2015-02-24
Journal
Publisher
ISSN
Access Type
Author Information
Authors
Christopher Chang
Carson C. Chow
Laurent CAM Tellier
Shashaank Vattikuti
Shaun Purcell
James J. Lee
Explore further
Open the scid.ai AI chat with a ready-made request: it will find papers on a similar topic and help build a literature review.
Find similar papers in the chat
Make a presentation
100%