Dengesiz Veri Kümeleriyle Sınıflandırma İçin Kümelemeye Dayalı Yeni Bir Hibrit Metodoloji


Tezin Türü: Doktora

Tezin Yürütüldüğü Kurum: İstanbul Üniversitesi, Fen Bilimleri Enstitüsü, Enformatik Bölümü, Türkiye

Tezin Onay Tarihi: 2023

Tezin Dili: Türkçe

Öğrenci: ABDULLAH MARAŞ

Danışman: Çiğdem Erol

Açık Arşiv Koleksiyonu: AVESİS Açık Erişim Koleksiyonu

Özet:

Makine öğrenmesi modellerinde istenilen performans değerlerine ulaşılamamasının bir nedeni de dengesiz veri kümelerinin kullanılmasıdır. Dengesiz veri kümeleri hedef değişkenlerin dağılımlarının eşit olmadığı veri kümelerine verilen addır. Makine öğrenmesi model kurulumu sırasında kullanılan algoritmalar, veri kümesindeki hedef değişkenlerin dağılımının eşit olduğu varsayımı altında daha iyi performans göstermektedirler. Bu nedenle makine öğrenmesi modellerini oluştururken probleme yönelik sunulan aşağı örnekleme, yukarı örnekleme veya hibrit yaklaşım çözümlerinden biri uygulanmaktadır. Bu tez kapsamında öncelikle dengesiz veri kümeleri problemi ve çözümleri ile ilgili bir bibliyometrik analiz gerçekleştirilmiş olup sonrasında problem çözümü için FuzzyCSampling olarak adlandırılan hibrit bir yaklaşım geliştirilmiştir. FuzzyCSampling yaklaşımı kümeleme ve veri örnekleme yöntemlerinin birlikte kullanarak hedef değişkenlerin eşitsiz dağılımlarının oranının azalmasını sağlamıştır. Önerilen yaklaşım farklı dengesizlik oranına ve büyüklüklere sahip olan Pima Indians Diyabet, KDD Cup 1999 ve Credit Card Fraud Detection veri kümeleriyle model oluşturulması için kullanılıp model performanslarındaki değişim incelenmiştir. Model değerlendirme ölçütleri olarak doğruluk, duyarlılık, kesinlik, F-ölçütü ve AUC kullanılmıştır. Model performans değerlendirmesinde veri kümesi %70 eğitim %30 test ayrılarak kullanılmıştır. Ayrıca modeller rastgele orman algoritması, k-en yakın komşu ve destek vektör makineleri kullanılarak Python dilinde gerçekleştirilmiştir. FuzzyCSampling yönteminin başarısının karşılaştırılması amacıyla yaygın kullanılan çözümler olan rastgele aşağı örnekleme, SMOTE, Borderline-SMOTE ve herhangi bir çözüm kullanılmayan durum için modeller kurulmuştur. Pima Indians Diyabet veri kümesi ile oluşturulan modeller kıyaslandığında, k-en yakın komşu algoritması ve FuzzyCSampling yaklaşımı ile oluşturulan modelin performansının (doğruluk:0,885; AUC: 0,872 ve F-ölçütü:0,846) diğer modellerden daha iyi olduğu gözlemlenmiştir. KDD Cup 1999 veri kümesi ile oluşturulan modellerin arasında da rastgele orman algoritması ve FuzzyCSampling yaklaşımının uygulanması durumunda diğer modellerden daha iyi performans sonuçları (doğruluk:0,999; kesinlik: 0,993 ve F-ölçütü:0,978) elde edildiği gözlemlenmiştir. Credit Card Fraud Detection veri kümesiyle oluşturulan modeller karşılaştırıldığında FuzzyCSampling yaklaşımının rastgele orman algoritması birlikte uygulanmasının performansı (AUC:0,941; kesinlik: 0,970 ve F-ölçütü:0,932) iyileştirdiği gözlemlenmiştir. Bu tez kapsamında dengesiz veri kümeleri problemine çözüm olarak sunulan FuzzyCSampling yaklaşımının ikili sınıflandırma problemlerinde iyi bir alternatif çözüm olduğu görülmüştür.