Derin Q-öğrenme ile video oyunu oynayan akıllı etmenler geliştirilmesi ve deneyim tekrarı arabelleği boyutunun eğitime etkisinin incelenmesi
Tezin Türü: Yüksek Lisans
Tezin Yürütüldüğü Kurum: Eskişehir Osmangazi Üniversitesi, FEN BİLİMLERİ ENSTİTÜSÜ, BİLGİSAYAR MÜHENDİSLİĞİ ANABİLİM DALI, Türkiye
Tezin Onay Tarihi: 2024
Tezin Dili: Türkçe
Öğrenci: HAKAN ALP EREN
Asıl Danışman (Eş Danışmanlı Tezler İçin): Ahmet Yazar
Eş Danışman: Nihat Adar
Açık Arşiv Koleksiyonu: AVESİS Açık Erişim Koleksiyonu
Özet:Pekiştirmeli öğrenme, denetimli ve denetimsiz öğrenmeden farklı olarak hazır veri seti yerine çevreyle etkileşimden elde edilen deneyimlerin kullanılmasına dayanmaktadır. Q-öğrenme ve diğer birçok pekiştirmeli öğrenme algoritması, bu deneyimleri yinelemeli güncellemelerde kullanarak en iyi eylem-değer fonksiyonunu elde etmeyi amaçlamaktadır. Bu tür klasik pekiştirmeli öğrenme yöntemleri, düşük boyutlu durum uzayına sahip ortamlarda başarı göstermiş olsalar da video oyunu oynamak gibi yüksek boyutlu durum uzayı içeren karmaşık problemlerde kullanılmaları pratik değildir. Bu tür problemler için sinir ağlarını fonksiyon yaklaşıklayıcı olarak kullanmak, eğitim sırasında gözlemlenmeyen durumlar hakkında genelleme yapılmasına olanak tanımaktadır. Ancak etmenin deneyimleri sıralı olduğundan ve ardışık örnekler arasında yüksek korelasyon bulunduğundan dolayı sinir ağının bu şekilde eğitilmesi yıkıcı unutmaya yol açacaktır. Bu durumu önlemek için deneyimlerin bir arabellekte saklanması ve rastgele seçilen örneklerin kullanılmasıyla bağımsız ve özdeş bir dağılım elde edilmektedir. Deneyim tekrarı adı verilen bu yöntem, korelasyonu kırarak ve veri verimliliğini arttırarak eğitimi kararlı hale getirmektedir. Tekrar arabelleğinin birçok derin pekiştirmeli öğrenme algoritması için kritik bir mekanizma olduğunun bilinmesine rağmen literatürde arabelleğin boyutuna yeterince önem verilmediği görülmektedir. Bu çalışmada, derin Q-öğrenme algoritmasıyla birlikte 50 000, 100 000 ve 150 000 olmak üzere üç farklı boyutta tekrar arabelleği kullanılarak çeşitli Atari oyunlarını oynayabilmeleri amacıyla etmenler geliştirilmiş ve arabellek boyutunun eğitime etkisi gözlemlenmiştir. On farklı oyun için geliştirilen 90 etmenden elde edilen sonuçlar incelendiğinde altı oyunda insan performansının aşıldığı, iki oyunda insan seviyesinde performansa ulaşıldığı ve iki oyunda ise düşük başarı elde edildiği görülmektedir. Deneyim tekrarı açısından arabellek boyutunun arttırılması beş oyunda başarıyı sürekli arttırırken, iki oyunda başarının devamlı düşmesine neden olmuştur. Sonuçlar, daha büyük bir tekrar arabelleği kullanmanın her zaman başarıyı arttırmayacağını ve arabellek boyutunun ayarlanması gereken önemli bir üst-değişken olduğunu göstermektedir.