Применение обучения с подкреплением через самоигру к казахским национальным настольным играм: на примере тогызкумалака
DOI:
https://doi.org/10.26577/jpcsit4220261Ключевые слова:
Многoагентное обучение с подкреплением, накопленное вознаграждение, Q-обучение, игра с нулевой суммой, метод Монте-Карло с деревом поискаАннотация
В статье представлены результаты исследования по обучению агентов для соревновательных настольных игр на примере казахской национальной игры тогызкумалак, которая является игрой с нулевой суммой. Как показал опыт AlphaZero, возможно обучение чемпиона без привлечения экспертных знаний человека и обучения с учителем. Тем не менее, каждая игра обладает уникальными особенностями, которые требуют отдельного изучения для создания сильного игрока. В данной работе использованы два подхода к обучению агентов: безмодельный и модельный. Техника самоигры была эффективно применена в процессе обучения. В результате агенты овладели навыками игры в тогызкумалак на конкурентоспособном уровне.





