Универсальный алгоритм обучения с подкреплением, овладевший шахматами, сёги и го посредством самоигры

A general reinforcement learning algorithm that masters chess, shogi, and Go through self-play
David Silver, Demis Hassabis, Karen Simonyan, Laurent Sifre, Ioannis Antonoglou, Julian Schrittwieser, Timothy Lillicrap, Arthur Guez, Dharshan Kumaran, Marc Lanctot, Thore Graepel, Thomas Hubert, Matthew Lai
2018-12-06

AlphaZeroгошахматыобучение с подкреплением через самоигрусёги
Шахматы являются наиболее длительно изучаемой областью в истории искусственного интеллекта. Самые сильные программы основаны на сочетании сложных методов поиска, специфических для домена адаптаций и ручных функций оценки, которые в течение нескольких десятилетий совершенствовались экспертами-человеками. В отличие от этого, программа AlphaGo Zero недавно достигла сверхчеловеческой производительности в игре го с помощью обучения с подкреплением на основе самоигры. В данной статье мы обобщаем этот подход в единый алгоритм AlphaZero, способный достигать сверхчеловеческой производительности во многих сложных играх. Начиная с случайной игры и не имея никакого доменного знания, кроме правил игры, AlphaZero убедительно победил мировую чемпионскую программу в шахматах и сёги (японских шахматах), а также в го.
1
AlphaZero достиг сверхчеловеческой производительности в шахматах, сёги и го.
2
AlphaZero убедительно победил программы-чемпионы мира в шахматах и сёги, а также в го, используя один и тот же алгоритмический подход.
3
AlphaZero — это единый общий алгоритм обучения с подкреплением, который осваивает несколько игр через самообучение, начиная с случайной игры.
4
AlphaZero не требует знаний предметной области кроме правил игры и не использует вручную созданные оценочные функции или специфичные для домена адаптации.

Алгоритм обучения с подкреплением AlphaZero, применённый к играм шахматы, сёги и го через самообучение (self-play)

Способность единого универсального алгоритма обучения с подкреплением (AlphaZero) обучаться через самообучение без знаний предметной области, кроме правил игры, и достигать сверхчеловеческой производительности в шахматах, сёги и го

Publication Details
Publication Date
2018-12-06
Journal
Publisher
ISSN
Access Type
Author Information
Authors
David Silver
Demis Hassabis
Karen Simonyan
Laurent Sifre
Ioannis Antonoglou
Julian Schrittwieser
Timothy Lillicrap
Arthur Guez
Dharshan Kumaran
Marc Lanctot
Thore Graepel
Thomas Hubert
Matthew Lai
Explore further
Open the scid.ai AI chat with a ready-made request: it will find papers on a similar topic and help build a literature review.
Find similar papers in the chat
Make a presentation
100%