Improving the performance of NLP tasks in legal tech


Tezin Türü: Doktora

Tezin Yürütüldüğü Kurum: İstanbul Üniversitesi, Fen Bilimleri Enstitüsü, Enformatik Bölümü, Türkiye

Tezin Onay Tarihi: 2024

Tezin Dili: İngilizce

Öğrenci: FARNAZ ZEIDI

Asıl Danışman (Eş Danışmanlı Tezler İçin): Çiğdem Erol

Eş Danışman: Mehmet Fatih Amasyalı

Açık Arşiv Koleksiyonu: AVESİS Açık Erişim Koleksiyonu

Özet:

Transformer sinir ağı'nın tanıtımı, kendiliğinden denetimli ön eğitim ve transfer öğrenme gibi tekniklerle birleştirilerek BERT gibi gelişmiş modellere yol açmıştır. BERT'ün etkileyici performansına rağmen, daha fazla geliştirme fırsatları bulunmaktadır. Çalışmamız, öncelikle Türkçe hukuki alanında BERT modelini ön eğitim aşamasında yapılan değişikliklerle geliştirmeye odaklanmaktadır. BERT'in performansını artırmak için üç temel fikri takip ettik: NSP'nin SOP ile değiştirilmesi, NSP'nin kaldırılması ve MLM'nin TF-IDF ile birleştirilmesi. Yenilikçi yaklaşımımızda, %10'unu, Tokenizer'ın kelime dağarcığından rastgele belirteçler yerine yüksek TF-IDF değerlerine sahip olanlarla değiştirmeyi öneriyoruz. Ayrıca, MLM'nin orijinal kuralları (80_10_10) içinde çeşitli maskeleme stratejileri uygulandı. Önerilen modellerimizi ön eğitmek için, 'Yüksek Öğrenim Tez Merkezi'nde bulunan hukukla ilgili tez belgelerinden elde edilen 50 MB'lik etiketlenmemiş Türkçe metinden faydalandık. Ardından, bu özelleştirilmiş modellerimizi, Türk hukukuyla ilgili etiketli verileri kullanarak NER ve çoklu etiketli metin sınıflandırma için ayarladık. Bu özelleştirilmiş modellerimizi orijinal BERT ile karşılaştıran kapsamlı bir performans analizi gerçekleştirdik. Kesinlik, duyarlılık ve F-ölçütü performans metrikleri olarak kullanıldı. Bulgular, NSP'nin SOP ile değiştirilmesinin genellikle BERT modelini geliştirdiğini gösterdi. Ancak, NSP/SOP'nin dışarıda bırakılmasının sonuçları önemli ölçüde etkilediğini, daha belirgin bir etki gösterdiğini belirtti. Önerilen MLM yaklaşımımız ise, orijinal BERT modeline göre hem NER'de (%71.85 kesinlik, %83.47 duyarlılık, %77.23 F-ölçütü) hem de çoklu etiketli metin sınıflandırma görevlerinde (%86.61 kesinlik, %61.83 duyarlılık, %72.15 F-ölçütü) önemli iyileştirmeler gösterdi. Ayrıca, farklı maskeleme stratejileri uygulandıktan sonra, çoklu etiketli metin sınıflandırma görevinde, MLM stratejisine daha fazla rastgele belirteç eklemenin olumlu bir etki gösterdiği görüldü. Özellikle, bu belirteçlerin yüksek TF-IDF puanlarına sahip bir listeden seçildiğinde daha iyi performans gösterilecektir. Ancak, NER görevinde, rastgele belirteçlerin eklenmesi sonuçları olumsuz yönde etkiledi ve en iyi model performansı, bu tür belirteçlerin MLM stratejisinden çıkarıldığında görüldü.