Random forests yönteminde kayıp veri probleminin incelenmesi ve sağlık alanında bir uygulama
Tezin Türü: Yüksek Lisans
Tezin Yürütüldüğü Kurum: Eskişehir Osmangazi Üniversitesi, SAĞLIK BİLİMLERİ ENSTİTÜSÜ, BİYOİSTATİSTİK ANABİLİM DALI, Türkiye
Tezin Onay Tarihi: 2014
Tezin Dili: Türkçe
Öğrenci: HÜLYA YILMAZ
Danışman: Cengiz Bal
Açık Arşiv Koleksiyonu: AVESİS Açık Erişim Koleksiyonu
Özet:Bu tez çalışmasında, kayıp verili sınıflandırma probleminde kullanılan Random Forests (RF) yönteminin kayıp değer atama algoritmasıyla, K En Yakın Komşu (KNN) ile kayıp değer atama yönteminin karşılaştırılması amaçlanmaktadır. Karşılaştırmalar iki aşamada gerçekleştirilmiştir. İlk aşamada benzetim çalışmaları yapılmıştır. (100000/n) Monte Carlo benzetim tekniği örneklem hacimlerine (n=100, 200, 500, 1000) ve tekrar sayılarına (s=1000, 500, 200, 100) karar vermek için kullanılmıştır. Çok değişkenli standart normal dağılımdan, önemli değişkenlerinin birbirleri ile düşük, orta ve yüksek (r=0.1, 0.5, 0.9) derecede ilişkili olduğu veri setleri türetilmiştir. Bu veri setlerinin iki değişkeni üzerinde aynı anda ve aynı yüzdeliklerde ( %5, %10, %15, %20, %25) kayıp değerler oluşturulmuştur. Kayıp değerler RF'nin atama algoritması ve farklı komşuluk değerli (k=5, 10, 15, 20) KNN ile kayıp değer atama yöntemleri tarafından ayrı ayrı tamamlandıktan sonra farklı veri setleri elde edilmiştir. Atanmış farklı veri setleri aynı RF algoritmasına ayrı ayrı yerleştirilerek sınıflandırma sonuçları gözlemlenmiştir. Doğru sınıflandırma oranları (DSO) kullanılarak atama yöntemleri karşılaştırılmıştır. İkinci aşamada ise sağlık alanına ait kayıp değerli bir veri seti, atama yöntemlerini uygulamak ve elde edilen sonuçları benzetim çalışmalarıyla ilişkilendirmek için kullanılmıştır. Benzetim çalışmalarında atama yöntemleri benzer DSO sonuçları sunmaktadır. Örneklem hacimleri ve değişkenler arasındaki ilişki arttıkça DSO artmakta, ama kayıp değer yüzdesi arttıkça DSO azalmaktadır. Orta ve düşük derecede ilişkili veri setlerinde KNN ile kayıp değer atama yöntemi, yüksek derecede ilişkili veri setlerinde ise RF'nin kayıp değer atama algoritması üstün sonuçlar vermiştir. En yüksek DSO tahmin değeri örneklem hacminin 1000'e eşit olduğu %5 kayıp değerli yüksek derecede ilişkili (r=0.9) veri setlerinde RF'nin atama algoritması tarafından %95.66 olarak bulunmuştur. En düşük DSO tahmin değeri ise örneklem hacminin 100'e eşit olduğu %25 kayıp değerli düşük derecede ilişkili (r=0.1) veri setlerinde RF'nin atama algoritması tarafından %78.27 olarak bulunmuştur. Sağlık alanına yönelik yapılan uygulama, benzetim çalışması ile uyumlu sonuçlar vermiştir. Bu çalışma; bir sınıflandırma probleminde, kayıp değerli veri setlerine atama yapmak için her iki yöntemin de kullanılabileceğini göstermektedir; ancak veri setinin ilişki yapısına göre en uygun atama yönteminin seçilmesi önerilmektedir. Düşük ve orta derecede ilişkili veri setlerinde komşuluk değerinin k=10, 15 ya da 20'e eşit olduğu KNN ile kayıp değer atama yöntemi kullanılmalıdır. Yüksek derecede ilişkili veri setlerinde ise RF'nin atama algoritması tercih edilmelidir. Anahtar Kelimeler: Random Forests, Kayıp veri analizi, K en yakın komşu ile kayıp değer atama yöntem