Makine Öğrenmesi Yöntemleri ile Türkçe Haberlerin Özetlenmesi


Tezin Türü: Yüksek Lisans

Tezin Yürütüldüğü Kurum: İstanbul Üniversitesi, Rektörlük, Bölümler, Türkiye

Tezin Onay Tarihi: 2021

Tezin Dili: Türkçe

Öğrenci: Burak ÖZDEMİR

Danışman: Çiğdem Erol

Açık Arşiv Koleksiyonu: AVESİS Açık Erişim Koleksiyonu

Özet:

İnternet'in yazılı basın sektörünü derinden etkileyip, dijital yayıncılığın önem kazanmasıyla birlikte elektronik ortamda gazete okuyan kişi sayısında büyük artış gözlemlenmiştir. Dijital ortamda artan rekabet, haber sitelerini insandan çok arama motoruna yönelik habercilik yapmaya yöneltmiş; zamanla yayınlanan bu haberler olması gerektiğinden daha uzun bir hâl almıştır. Öte yandan, bireylerin daha kısa sürede daha çok bilgiye ulaşabilmelerini sağlayabilecek sistemlere her zaman ihtiyaç duyulmuştur. Yoruma veya çıkarıma dayalı yöntemlerle gerçekleşen otomatik metin özetleme, metinlerdeki ana düşünce ve önemli bilgilerin korunması şartı ile metnin boyutunun küçültülmesidir. Bu tezde, Hint-Avrupa dil ailesindeki dillere göre daha farklı bir yapısı olan Türkçe dilinde üretilmiş haberler, doğal dil işleme yöntemleri ile özetlenmiş; yakın zamanda geliştirilmiş olan BERT ve Seq2Seq modellerinin performansları, metin özetleme için kullanılan geleneksel yöntemler olan tf-idf, gizli anlam analizi, TextRank ve LexRank ile karşılaştırılmıştır. Bu karşılaştırmanın sonucunda Türkçe haberlerden oluşan bir veri setinde ortalama 0,25 ROUGE-L skoruna sahip olan, performansı ve veri setinden bağımsız girdilerde de iyi sonuçlar üretebilmesi sebebiyle tercih edilen BERT modeli ile herkesin erişimine açık, Özetleyici adına sahip web tabanlı bir otomatik özetleyici geliştirilmiştir.