Қазақтың ұлттық үстел ойындарына өз-өзімен ойнау арқылы нығайтумен оқытуды қолдану: тоғызқұмалақ мысалында
DOI:
https://doi.org/10.26577/jpcsit4220261Ключові слова:
Көп агентті нығайтумен оқыту, жинақталған марапат, Q-оқыту, нөлдік нәтиже ойыны, Монте-Карло ағаш іздеу әдісіАнотація
Бұл мақалада нөлдік нәтиже ұғымына негізделген қазақтың ұлттық тоғызқұмалақ ойынын мысалға ала отырып, бәсекелі үстел ойындарына арналған агенттерді оқыту нәтижелері ұсынылады. AlphaZero тәжірибесі көрсеткендей, адам сарапшысының білімінсіз және бақылаулы оқытусыз чемпионды дайындауға болады. Алайда әрбір ойынның өзіне тән ерекшеліктері бар, сондықтан мықты ойыншыны әзірлеу үшін арнайы зерттеу қажет. Бұл жұмыста агенттерді оқыту үшін модельге тәуелді емес және модельге негізделген екі түрлі тәсіл қолданылды. Оқу барысында өз-өзімен ойнау (self-play) әдісі тиімді пайдаланылды. Нәтижесінде агенттер тоғызқұмалақты бәсекелі деңгейде ойнай алатын деңгейге жетті.





