Veri Madenciliğinde Veri Ayrıklaştırma Yöntemlerinin Karşılaştırılması ve Bir Uygulama
Tez Türü: Yüksek Lisans
Tezin Yürütüldüğü Kurum: İstanbul Üniversitesi, Fen Bilimleri Enstitüsü, Enformatik Bölümü, Türkiye
Tez Danışmanı: Özkan, Y.
Tezin Onay Tarihi: 2012
Tezin Dili: Türkçe
Özet:
Toplumlar, farklı ihtiyaçlar doğrultusunda çeşitli dönüşüm süreçlerinden geçmiş, bu süreç günümüzde bilgi merkezli hale gelmiştir. Ancak amaç bilgi yığınına değil doğru ve değerli bilgiye sahip olmaktır. Bu noktada ise veri madenciliği oldukça önem kazanmaktadır.Veri Madenciliği, belirli yöntemlerin kullanılması ile var olan gizli bilgiyi ortaya çıkarma sürecidir (Özkan, 2008). Günümüzde her türlü veri, veri tabanları veya veri ambarlarında tutulmaktadır. Ancak tutulan tüm bu verilerin doğru olduğunu söylemek imkansızdır. Verilerin eksik ya da gerçeğe uygun olmayan yanlış şekilde girilmesi, aynı anlamdaki birden fazla verinin gereksiz var olması ve verilerin tutarsız olması veri madenciliği süreci sonrası elde edilecek bilgilerin yanlış ve doğrudan uzak olmasına neden olabilir. Verilerin etkin ve verimli bir şekilde işlenebilir ve yorumlanabilir olması için verilerin belirli kalite kriterlerini karşılayabilir olması gerekmektedir (Müller ve Freytag, 2003). Veri madenciliği farklı adımlardan oluşmak ile beraber bu adımlardan biri verilerin ön işlenmesidir. Nitelikli bilgilerin elde edilmesi nitelikli veriler ile sağlanabilir. Dolayısıyla bu adım elde edilecek sonuçlar için oldukça önemlidir.Veri önişleme süreci içerisinde yer alan adımlardan birisi de veri ayrıklaştırmasıdır. Veri ayrıklaştırma işlemi için farklı yöntemler kullanılmaktadır. Bu yöntemlerden hangisinin daha etkin olduğu merak konusudur. Buradan yola çıkılarak bu tez çalışmasında veri kümelerine farklı ayrıklaştırma yöntemlerinin uygulanması ve hangi yöntemin daha etkin olduğu hususunun incelenmesi amaçlanmıştır.Çalışma kapsamında Wisconsin Üniversitesi Hastaneleri'nde meme kanseri teşhisi sonucu ameliyat edilen hastalardan alınan örneklerin yer aldığı Wisconsin veri kümesi kullanılmıştır. Bu veri kümesi üzerine KEEL veri madenciliği yazılım aracı yardımı ile 1RD, CADD, CAIM, Chi2, ChiMerge, ID3, Eşit Genişlikli, Eşit Frekanslı olmak üzere sekiz farlı ayrıklaştırma yöntemi uygulanmıştır.Chi2, ChiMerge, CAIM algoritmalarının gözle görülür bir oranda tutarlı çalıştıkları, 1RD algoritmasının genelde bir, ID3 algoritmasının da çok sayıda kategorik değişken elde ettiği belirlenmiştir. Bunun gibi çok sayıda kategorik değişken atayan farklı ayrıklaştırma yöntemlerinin, aynı nitelik değeri için birebir olmasa da çok yakın kategorik değişkenler atadığı belirlenmiştir.Elde edilen bu sonuçlar veri madenciliği çalışmasında kategorik niteliklerle çalışmak gerektiğinde nasıl bir yol izlenmesi gerektiğini ve uygun yöntemin seçilmesi hususunda yol göstermektedir. Türkiye'de bu alanda yapılan tez çalışmaları taranmış olup literatürde eksikliği gözlemlendiğinden çalışmanın sonuçlarının literatüre de katkısının olması beklenmektedir.