Современные расширенные NLP-трансформеры для прямого и одношагового ретросинтеза

State-of-the-art augmented NLP transformer models for direct and single-step retrosynthesis
Igor V. Tetko, Pavel Karpov, Ruud Van Deursen, Guillaume Godin
2020-11-04

увеличение SMILESTransformerнабор данных USPTO-50kпоиск по лучупредсказание ретросинтеза
Мы исследовали влияние различных сценариев обучения на предсказание (ретро)синтеза химических соединений с использованием текстоподобного представления химических реакций (SMILES) и архитектуры нейронной сети Transformer для обработки естественного языка (NLP). Показано, что аугментация данных, мощный метод, применяемый в обработке изображений, устраняет эффект запоминания данных нейронными сетями и улучшает их способность предсказывать новые последовательности. Этот эффект наблюдался при одновременном применении аугментации к входным и целевым данным. Топ-5 точность составила 84,8% при предсказании наибольшего фрагмента (тем самым идентифицируя основное преобразование для классического ретросинтеза) на тестовом наборе USPTO-50k; это было достигнуто сочетанием аугментации SMILES и алгоритма beam search. Тот же подход дал существенно лучшие результаты при предсказании прямых реакций на одношаговом тестовом наборе USPTO-MIT. Наша модель достигла 90,6% топ-1 и 96,1% топ-5 точности для сложного смешанного набора и 97,0% топ-5 точности для раздельного набора USPTO-MIT. Она также существенно улучшила результаты одношагового ретросинтеза на наборе USPTO-full как по топ-1, так и по топ-10 точностям. Частота появления наиболее часто сгенерированных SMILES хорошо коррелировала с результатом предсказания и может использоваться как мера качества предсказания реакции.
1
Одновременное применение аугментации SMILES к входным и целевым данным устраняет запоминание нейронной сетью и улучшает предсказание новых реакционных последовательностей.
2
Аугментированные трансформерные модели значительно улучшили производительность одноступенчатого ретросинтеза на наборе USPTO-full как по top-1, так и по top-10 точностям.
3
Комбинация аугментации SMILES и beam search достигла 84.8% точности top-5 при предсказании наибольшего фрагмента на тестовом наборе USPTO-50k.
4
Для предсказания прямых одноступенчатых реакций на USPTO-MIT аугментированный трансформер достиг 90.6% top-1 и 97% top-5 точности для разделённого набора и 96.1% top-5 для сложного смешанного набора.
5
Частота наиболее часто сгенерированных SMILES хорошо коррелирует с правильностью предсказания и может служить мерой качества предсказаний реакций.

Модели на базе трансформеров NLP для предсказания одношагового ретросинтеза и прямых химических реакций с использованием представлений SMILES

Влияние аугментации SMILES и стратегий обучения/декодирования (включая одновременную аугментацию входа и цели и beam search) на точность предсказаний (top-1/top-5/top-10) и частоту генерации как меру качества при предсказании одношагового ретросинтеза и прямых реакций

Publication Details
Publication Date
2020-11-04
Journal
Publisher
ISSN
Access Type
Author Information
Authors
Igor V. Tetko
Pavel Karpov
Ruud Van Deursen
Guillaume Godin
Explore further
Open the scid.ai AI chat with a ready-made request: it will find papers on a similar topic and help build a literature review.
Find similar papers in the chat
Make a presentation
100%