Совершенствование моделей машинного обучения в материаловедении с помощью больших наборов данных

Improving machine-learning models in materials science through large datasets
Miguel A. L. Marques, Jonathan Schmidt, Silvana Botti, Hai‐Chen Wang, A. Romero, Tiago F. T. Cerqueira, Antoine Loew, Fabian Jäger
2024-09-25

база данных Alexandriaкристаллические графовые нейронные сетирасчёты теории функционала плотностимежатомные потенциалы машинного обучениянаборы данных в материаловедении
Точность модели машинного обучения ограничивается качеством и объемом данных, доступных для ее обучения и валидации. Эта проблема особенно актуальна для материаловедения, где крупные, высококачественные и согласованные наборы данных встречаются редко. В настоящей работе представлена Alexandria — открытая база данных, содержащая более 5 миллионов расчетов в рамках теории функционала плотности для периодических трех-, двух- и одномерных соединений. Эти данные использованы для обучения моделей машинного обучения, воспроизводящих семь различных свойств, с применением как моделей на основе состава, так и нейронных сетей на основе кристаллических графов. В большинстве случаев ошибка моделей монотонно уменьшается с увеличением объема обучающих данных, хотя некоторые графовые сети, по-видимому, достигают насыщения при больших размерах обучающей выборки. Различия в эффективности обучения можно связать со статистическим распределением различных свойств. Мы также показываем, что графовые нейронные сети, использующие подробную геометрическую информацию, в целом обеспечивают более точные модели, чем простые методы на основе состава. Наконец, мы оцениваем несколько универсальных межатомных потенциалов машинного обучения. Кристаллические геометрии, оптимизированные с помощью этих силовых полей, имеют очень высокое качество, однако точность расчета энергий по-прежнему недостаточна. Кроме того, мы наблюдаем некоторые нестабильности в областях химического пространства, недостаточно представленных в обучающих наборах, использованных для построения этих моделей. Это исследование демонстрирует потенциал крупномасштабных высококачественных наборов данных для повышения качества моделей машинного обучения в материаловедении.
1
Alexandria предоставляет открытую базу данных, содержащую более 5 миллионов расчётов теории функционала плотности для периодических трёх-, двух- и одномерных соединений.
2
Нейронные сети на графах кристаллов обычно превосходят модели на основе состава благодаря доступу к подробной геометрической информации.
3
Модели машинного обучения обучены предсказывать семь свойств с использованием методов на основе состава и нейронных сетей на графах кристаллов.
4
Ошибки моделей в целом монотонно уменьшаются с увеличением обучающего набора, хотя некоторые графовые сети достигают насыщения при больших объёмах данных.
5
Универсальные межатомные потенциалы машинного обучения обеспечивают высокое качество оптимизированных геометрий, но точность энергий остаётся недостаточной; кроме того, наблюдаются нестабильности в недостаточно представленных областях химического пространства.

Модели машинного обучения, обучаемые на больших наборах данных о периодических трёх-, двух- и одномерных соединениях, полученных с помощью расчётов теории функционала плотности

Влияние размера и качества обучающего набора данных, распределения свойств, архитектуры модели и степени выборки химического пространства на точность, сходимость и стабильность предсказаний свойств материалов и межатомных потенциалов машинного обучения

Publication Details
Publication Date
2024-09-25
Journal
Publisher
ISSN
Cited by
112
Access Type
Author Information
Authors
Miguel A. L. Marques
Jonathan Schmidt
Silvana Botti
Hai‐Chen Wang
A. Romero
Tiago F. T. Cerqueira
Antoine Loew
Fabian Jäger
Explore further
Open the scid.ai AI chat with a ready-made request: it will find papers on a similar topic and help build a literature review.
Find similar papers in the chat
Make a presentation
100%